东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
作者测试六款推理模型发现,模型依据ID数值或整除规则决策,导致共享ID时群体决策相关且审计审查具有可预测性。
- 0.211GPT-6 Sol在群体任务共享agent_id时的群体损失(Study 2)
- 0.385GPT-6 Sol在群体任务UUIDv7条件下的群体损失(Study 2)
- 0.89%GPT-6 Sol在审计任务普通UUIDv4下的审查率,目标1%(Study 5)
探讨推理智能体在随机选择中利用标识符确定性规则,如何引发群体决策相关与审计预测漏洞。
涵盖大语言模型随机性偏差、算法单一文化与隐式协调,以及系统标识符规范和 AI 监督控制协议。
通过形式化群体损失、测定单智能体阈值与余数规则,设计标识符结构与审计任务检验输入依赖性。
测试了六款模型在群体与审计任务下的表现,共享标识符使损失上升数倍,外部随机数可规范决策。
作者指出研究仅停留在闭源模型单次运行的行为层面,未测试自适应攻击者与实际系统环境。
研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。