东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
- 研究定位:该研究评估了推理大语言模型智能体在利用输入标识符实现随机选择时的行为规律及其安全隐患。
- 核心问题:当智能体被要求执行概率选择(如资源分配或人工审计抽检)时,是否会将上下文中的结构化标识符作为伪随机源并应用确定性数学规则,从而在群体中诱发决策相关性与审计失效。
- 方法设计:作者基于 El Farol 博弈构建四智能体二元参与任务,并构建 1% 目标的人工审计任务,在六款前沿推理模型上测试阈值规则与整除规则,进一步操控标识符结构(如 UUIDv7 时间戳)、字段标签及外部随机数输入。
- 主要实验发现:
- 单智能体测试中,GPT-6 Sol 与 Gemini 3.8 Flash 在 64 个设计标识符上表现出阈值规则(效应值 0.62 至 0.80),而关闭推理后该效应降至 0.08 以下(Table 1, Study 1)。
- 群体任务中,共享单一标识符使 Sol 和 Gemini 的全员一致率分别升至 91% 和 88%,群体损失升至 0.211 和 0.192,达独立抽样参考值的 3.5 至 3.8 倍;UUIDv7 的共同时间戳更导致参与率超过 0.93(Extended Data Table 4, Study 2)。
- 审计任务中,Sol 对 1,008 条普通 UUIDv4 请求的抽查率虽为 0.89%,但抽中的 9 条全部符合标识符低位规则,其余 989 条无一被抽检;而 Gemini 抽取为 0,Claude 仅抽取 2 条(Figure 4, Study 5)。
- 显式添加独立随机选择提示无法消除相关性,但在输入中直接提供外部均匀随机数时,四款模型在 1,004 至 1,008 次回答中均严格遵循该随机数进行决策(Table 1, Study 7)。
- 作者结论与启示:作者认为,个体选择率符合预期无法掩盖输入依赖引发的集体脆弱性;对 AI 智能体的评测必须将校准度、相关性与可预测性分开检验;在安全敏感场景中,应由可信代码生成并显式传入外部随机性,而非依赖模型自行解释上下文。