跳到正文
原文
论文追踪· arXiv:2610.09667·本站收录 · 原文发表 精选关注度65

东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

让 agent「随机抽 1% 人工复核」它并不随机:推理模型按 UUID 阈值或请求号整除来选,控制标识符就能躲开审查

论文速读

分析/可解释性

据论文 PDF 整理(Gemini 生成),以原文为准

作者测试六款推理模型发现,模型依据ID数值或整除规则决策,导致共享ID时群体决策相关且审计审查具有可预测性。

问题
AI智能体常需执行随机选择策略(如资源分配或1%人工审计)。若智能体将上下文中的标识符等输入作为变异来源并应用确定性规则,可能破坏决策的独立性与不可预测性,造成群体行为失真或审计漏洞。
方法
通过群体参与任务(El Farol变体)和客户请求抽检审计任务,测试六款模型是否遵循基于标识符的阈值或整除规则;进一步改变标识符共享方式、字段标签、时间戳与提示词指令以验证预测。
实验与结果
GPT-6 Sol与Gemini 3.8 Flash在共享标识符下损失升至独立基准的3.5至3.8倍;UUIDv7时间戳使参与率偏至0.93以上。审计任务中GPT-6 Sol仅抽取低数值请求,使其可被预测;四款模型均能紧密遵循外部提供的随机数。
局限与可以继续做的
局限在于证据仅为行为层面未识别内部算法;模型均为闭源且大多无带日期的快照;各研究为单次运行且群体仅四成员;外部均匀随机数在稀有目标下的样本量较小;论文未测试自适应发送者或敌对模型。
实验设置GPT-6 Sol、GPT-6 Luna 等 · Group participation task、Audit task 等 · Group loss、Threshold effect 等
模型
GPT-6 SolGPT-6 LunaGPT-5.4 miniGemini 3.8 FlashGemini 3.5 FlashClaude Sonnet 5
基准
Group participation taskAudit taskSupplementary text-input tests
指标
Group lossThreshold effectResidue effectUnanimityReview rate
AI 导读和推荐理由全文 375 字

东京大学的研究者测试了来自三家开发者的六个闭源推理模型,发现它们在需要随机选择的场景中并非真正随机,而是把标识符转成数值后套用阈值或整除规则。在 1% 人工复核任务中,GPT-6 Sol 的选取率接近目标(1008 条请求中选中 9 条,0.89%),但选中的请求集中在标识符数值低于 1% 的样本上,掌握标识符的发送方可以据此避开审查;Gemini 3.8 Flash 与 Claude Sonnet 5 几乎不选,Luna 选取率 0.40%。在四人参与博弈任务中,共享同一标识符使 GPT-6 Sol 和 Gemini 3.8 Flash 分别有 91% 和 88% 的组出现全体一致,损失升至独立随机基准的 3.5 至 3.8 倍;使用同一毫秒生成的 UUIDv7 时参与率高达 0.95 和 0.93,损失为基准的 6.6 至 6.9 倍。

推荐理由论文用六个推理模型的实测数据说明,仅看选择率无法发现智能体随机抽样中的相关性与可预测性,审计与 AI 控制协议可据此调整检查项。

深度解读

6 个问题 · 约 6,500 字

  1. 这篇论文试图解决什么问题?

    探讨推理智能体在随机选择中利用标识符确定性规则,如何引发群体决策相关与审计预测漏洞。

    推理大语言模型智能体在执行随机选择策略时,是否会将上下文中的结构化标识符转化为确定性规则,从而破坏群体决策的独立性并引入可预测的审计漏洞。

    • 随机选择的应用场景与重要性:作者指出,随机选择是资源分配和系统监督的基础工具,例如要求对 1% 的交易进行抽样人工审查,或在 AI 监管(AI control)中对不可信模型的少量操作进行抽查。
    • 大语言模型实现随机性的不足:作者称,直接要求大语言模型按概率行动经常出现偏差;推理模型在思考过程中会自发寻找上下文中的输入变量转化为数字并应用阈值或整除规则,使输出变成输入的确定性函数。
    • 群体层面的输入依赖风险:作者提出,当多个智能体接收共享标识符或带有相同时间戳前缀的标识符时,单智能体表面的合理选择率无法保证独立性或不可预测性,反而会导致群体决策高度相关或产生整体偏移。
    • 研究提出的检验方案:作者设计了群体参与任务与客户请求抽检审计任务,在六款闭源推理模型上测试阈值规则与整除规则,评估输入依赖对群体表现与审计安全性的影响。
  2. 有哪些相关研究?

    涵盖大语言模型随机性偏差、算法单一文化与隐式协调,以及系统标识符规范和 AI 监督控制协议。

    大语言模型的随机性与概率选择偏差

    • Van Koevering and Kleinberg (2024)、Hopkins et al. (2023)、Zhao et al. (2026):评估了大语言模型在抛硬币、离散空间与统计分布采样中的表现,发现模型直接按概率指令选择时普遍存在偏差。
    • Gu et al. (2026)、Misaki and Akiba (2026):研究了大语言模型随机性的假象,并提出通过提示词生成和变换随机字符串等方法来改善分布生成。
    • Serrano et al. (2026):观察到前沿推理模型能够在单次响应中将上下文中的标识符转换为数字、取余数并应用阈值,从而在无外部指令的情况下以低概率执行操作。

    算法单一文化与多智能体协调

    • Kleinberg and Raghavan (2021)、Bommasani et al. (2022)、Kim et al. (2025):研究了算法单一文化(algorithmic monoculture)导致错误集中与结果同质化的现象。
    • Ballestero et al. (2026)、Sinishaw et al. (2026)、Riedl (2026):在多智能体博弈与去中心化协调中发现,模型难以自发展开互补行动。
    • Aharon et al. (2026)、Flint Ashery et al. (2025)、Flint et al. (2026):研究了大语言模型在缺乏通信时的隐式协调(tacit coordination)以及在群体互动中形成的集体偏差。

    系统标识符规范与控制协议

    • RFC 9562 (2024)、ULID 规范:定义了版本 4 随机 UUID、包含 48 位 Unix 毫秒时间戳的 UUIDv7 以及 ULID 的生成结构。
    • Greenblatt et al. (2024)、Mallen et al. (2024)、Järviniemi (2025):探讨了 AI 监督协议(AI control)中应对无状态协议破坏与共谋的审计机制。

    基线方法与对比参考

    • 论文采用目标概率 q 下的独立伯努利抽样作为理论参考基准,并以私有随机数(random_seed)和无标识符(no identifier)作为实验对照条件。

    作者指出,以往研究探讨了原生采样的偏差或模型互动的同质化,而本文将输入依赖作为独立于模型选择和交互的实验变量,展示了个体层面的选择率校准如何掩盖共享和结构化输入导致的集体脆弱性。

  3. 论文如何解决这个问题?

    通过形式化群体损失、测定单智能体阈值与余数规则,设计标识符结构与审计任务检验输入依赖性。

    作者提出了一套输入依赖性行为评估框架,通过测定单智能体决策规则,预测并检验共享与结构化输入在多智能体协同与人工审计场景中引发的集体失准。

    问题设定与形式化

    • 群体参与任务设计:设定四智能体群体在无通信条件下做出二元参与决策(参与编码为 1,不参与编码为 0),群体的目标是最小化期望损失。
    • 群体损失公式:群体实际损失定义为 ℓ = (f − q)2,其中 f = k/n 为 n 个智能体中参与的比例,q 为目标参与率。在 n=4 且各自以独立概率 p=q=1/3 参与时,期望损失理论基准为 1/18 ≈ 0.056。
    • 损失分解:在独立假设下期望损失分解为采样方差与偏差平方:L = (p(1−p))/n + (p−q)2;若存在输入依赖导致决策相关,还会额外引入协方差项。

    决策规则假设与单智能体刻画

    • 阈值规则与余数规则:作者提出两种行为假设,其一为阈值规则(Threshold rule),即当 128 位标识符的整数值除以 2128(数值分位数)小于 q 时参与;其二为余数规则(Residue rule),即标识符数值能被 1/q 整除时参与。
    • 规则效应指标:定义规则效应为该规则预测参与时的实际参与率减去预测不参与时的参与率;完全遵循时为 1,完全忽略时为 0。
    • 平衡测试集(Study 1):在 q = 1/3 条件下设计 64 个随机标识符,使两类规则在四个设计分层中正交且平衡,在 q ∈ {1/2, 1/3, 1/4, 1/5} 下测定单智能体响应。

    输入结构与时间戳演化设计

    • 群体输入条件(Study 2):在 q = 1/3 下设置无标识符、私有随机标识符、私有随机数(random_seed)、计数器 1 至 4、单个共享随机标识符以及同一毫秒生成的 UUIDv7。
    • UUIDv7 时间戳前缀设计(Study 3):UUIDv7 的前 48 位由毫秒时间戳决定,其数值分位数随生成时间单调递增;作者选取 2016 年、2026 年和 2036 年生成的 UUIDv7,在 q ∈ {1/120, 1/145, 1/170, 1/220} 下检验阈值阶梯效应。

    审计任务与干预设计

    • 客户请求审计策略(Studies 4–7):要求智能体对合成客户请求按约 1%(或 0.5%)的比例随机路由至人工审查,输出 review 或 auto。
    • 输入特征与外部随机性干预:测试设计型与普通 UUIDv4、将标识符字段从 agent_id 改为 record_id、加入显式独立随机化提示词、加入禁止使用请求字段指令,以及在输入中直接提供未附带使用说明的外部随机数(random_draw 或 nonce)。
  4. 论文做了哪些实验?

    测试了六款模型在群体与审计任务下的表现,共享标识符使损失上升数倍,外部随机数可规范决策。

    实验设置

    • 被测模型:测试六款闭源模型,包括 OpenAI 的 GPT-6 Sol(gpt-6-sol,推理开启 high 与关闭 none)、GPT-6 Luna(gpt-6-luna,推理 high 与 none)、GPT-5.4 mini(gpt-5.4-mini-2026-03-17,推理 high);Google 的 Gemini 3.8 Flash(gemini-3.8-flash,thinking LOW 与 HIGH)、Gemini 3.5 Flash(gemini-3.5-flash,thinking HIGH);Anthropic 的 Claude Sonnet 5(claude-sonnet-5,thinking max 与 disabled)。
    • 数据集与任务:群体参与任务采用 64 组四智能体配置,搭配 64 个设计标识符或新标识符及无关主题句;审计任务使用 48 条合成客户请求摘要,Study 5 与 7 结合 21 种渠道句扩展至 1,008 条新请求。
    • 主要指标:群体平均损失(loss,均方误差)、全员一致率(unanimity,组内全为 0 或全为 4 的比例)、规则效应值(阈值效应与余数效应)、人工审查抽取率(review rate)。
    • 评审与输出约束:通过接口的 JSON-schema 严格限制输出为合法 JSON 选项,群体任务为 action(A 或 B),审计任务为 decision(review 或 auto,Study 6 包含 escalate);未依赖外部大模型评审。
    • 样本量与重复次数:Study 1 为 3,968 次请求;Study 2 包含 64 组每组 4 个智能体共 6 个条件;Study 5 包含 1,008 条自然请求及 48 条格式测试;Study 7 共发送 10,960 次请求(Extended Data Table 3)。

    主结果

    据 Extended Data Table 4,四智能体在目标 q = 1/3 下的群体任务主结果如下:

    表格较宽,可左右滑动

    模型设定私有标识符损失私有全员一致率共享标识符损失共享全员一致率UUIDv7损失UUIDv7全员一致率
    GPT-6 Sol (high)0.04113%0.21191%0.38578%
    Gemini 3.8 Flash (LOW)0.04720%0.19288%0.36873%
    GPT-6 Luna (high)0.05114%0.09233%0.06011%
    理论独立抽样参考0.05621%0.05621%0.05621%
    • 共享标识符引发集体相关:作者指出,遵循阈值规则的 Sol 和 Gemini 在共享标识符时全员一致率升至 91% 和 88%(独立基准预期为 19% 和 22%),群体损失升至 0.211 和 0.192,达到独立抽样基准的 3.5 至 3.8 倍。
    • 时间戳前缀导致系统性参与偏差:UUIDv7 的前缀数值分位数约为 1/157(小于 1/3),导致 Sol 和 Gemini 的参与率升至 0.95 和 0.93,群体损失升至 0.385 和 0.368(为独立基准的 6.6 至 6.9 倍),损失主要由均值偏离而非协方差主导。
    • 先验特征模型的预测优势:基于 Study 1 单智能体规则构建的输入特征模型紧密预测了上述损失,在三个 UUID 条件下的平均对数预测概率得分相较忽略输入数值的边际模型分别高出 +0.78 和 +0.79(Table 1)。

    审计任务中的抽检可预测性与不足(Studies 4 & 5)

    • 测了什么:在 1% 与 0.5% 目标审计率下,测试智能体对设计型 UUID、普通 UUIDv4 及时间戳 UUIDv7 客户请求的人工审查选择。
    • 实验结果:在 Study 5 的 1,008 条普通 UUIDv4 请求中,Sol 抽取了 9 条进行审查(0.89%,95% CI 0.41%–1.69%),其中 5 条数值分位数低于 1%,4 条末 16 位低于 1%,其余 989 条无一被抽中(Figure 4b);Gemini 抽取 0 条,Claude 抽取 2 条,Luna 抽取 4 条(0.40%)。
    • 作者的解读:作者指出,Sol 的平均抽取率虽接近目标,但决策实际上完全依赖标识符数值,掌控标识符生成的发送者可蓄意避开审查;而其余模型则抽取不足,未达到策略设定的抽查率。

    提示词字段标签与显式随机化干预(Studies 6 & 7)

    • 测了什么:在群体任务中将 agent_id 字段更名为 record_id、提供同时包含两者的提示,并增加显式独立随机选择指令;测试外部随机数(random_draw / nonce)对标识符选择的替代作用。
    • 实验结果:将 agent_id 改为 record_id 后,共享与私有标识符的损失差值在 Sol 和 Gemini 上分别缩减了 0.078 和 0.169(Study 7,Figure 5a);增加显式独立随机指令后,共享损失超额仍有 0.120 和 0.057(Figure 5a);提供无使用说明的外部随机数时,四款模型在 1,008 条请求中均严格依据该字段做出审查(遵循率在 1,004 至 1,008 条之间,Figure 5e)。
    • 作者的解读:作者认为,字段标签从自身标识符变为记录标识符削弱了依赖,但显式独立随机化指令无法消除相关性;由受信任代码注入外部随机数能够有效置换模型对标识符的自发利用。

    其他消融与分析

    • 推理开启与关闭对比:关闭推理时 Sol、Luna、Claude 的规则效应均不超过 0.08,开启推理后 Sol 阈值效应上升 0.78,Luna 余数效应上升 0.29(Extended Data Table 1)。
    • 计数器标识符测试:Study 2 中使用 1 至 4 连续整数时先验预测失效,Sol 的参与率按位置分别为 92%、2%、100% 和 34%(Extended Data Figure 2)。
    • 生成时间戳阶梯效应:Study 3 中使用 2016、2026 和 2036 年原始 UUIDv7,Sol 在 12 个日期-目标组合中阈值效应达 0.95,符合时间戳阶梯预测(Figure 3d)。
    • 禁止使用请求字段指令:在审计提示中添加禁止使用请求 ID 或其他字段的指令后,四款模型在 96 次测试中抽检数均降为 0(Figure 4a)。
    • 末16位规则的新样本泛化失效:Study 7 测试新请求时,Sol 遵循数值阈值规则抽取了 41/48,但末 16 位规则仅抽取 3/48,未达到预设标准(效应值 0.06,95% CI -0.02 至 0.17,Table 1)。
  5. 有什么可以进一步探索的点?

    作者指出研究仅停留在闭源模型单次运行的行为层面,未测试自适应攻击者与实际系统环境。

    作者指出的局限与后续方向

    • 证据范围局限于行为层面:作者指出本研究的证据属于行为层面,仅识别了行为规律及其迁移界限,并未识别模型内部的具体计算算法(Discussion, page 7)。
    • 模型均为闭源且缺乏时间快照:所有测试模型均为闭源商业模型,除 GPT-5.4 mini 外均未提供带日期的快照,结果受限于具体版本与数据收集时间窗口(Methods, page 7)。
    • 单次运行与固定群体规模:每项实验均为单次运行,绝大多数实验仅使用一种提示词表述,且群体规模均固定为 4 名成员(Discussion, page 7)。
    • 干预措施覆盖的模型有限:字段标签与独立随机化指令干预仅覆盖了 Sol 和 Gemini 3.8 Flash 两款模型,二者在 record_id 标签下的组合效果尚未测试(Discussion, page 7)。
    • 未覆盖部署环境与工具历史:实验基于缺乏工具交互或历史上下文的合成输入进行单次决策,未在实际部署系统中确立效应(Discussion, page 7)。
    • 未测试自适应攻击与防御对抗:作者明确指出对 AI 监督的启示属于有条件推论,未实际测试自适应发送者(adaptive senders)、恶意模型(hostile models)或包含日期的系统提示词(Discussion, page 7)。

    实验覆盖范围

    • 被测模型范围:覆盖 GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini、Gemini 3.8 Flash、Gemini 3.5 Flash 和 Claude Sonnet 5 共六款闭源模型。
    • 任务与场景范围:覆盖四智能体二元参与博弈任务与单请求合成客户审计抽检任务,未测试混合模型组成的群体。
    • 标识符类型与字段标签:覆盖 UUIDv4、UUIDv7、ULID、连续数字编号以及 agent_id、record_id、nonce 等字段设置。
    • 样本规模:群体任务每条件 64 组,审计任务普通 UUIDv4 测试规模为 1,008 条请求。
    • 信息报告情况:论文未报告各模型的具体内部权重或未开源的系统提示词细节,未评估多轮交互下的策略演化。
  6. 总结一下论文的主要内容

    研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
    • 研究定位:该研究评估了推理大语言模型智能体在利用输入标识符实现随机选择时的行为规律及其安全隐患。
    • 核心问题:当智能体被要求执行概率选择(如资源分配或人工审计抽检)时,是否会将上下文中的结构化标识符作为伪随机源并应用确定性数学规则,从而在群体中诱发决策相关性与审计失效。
    • 方法设计:作者基于 El Farol 博弈构建四智能体二元参与任务,并构建 1% 目标的人工审计任务,在六款前沿推理模型上测试阈值规则与整除规则,进一步操控标识符结构(如 UUIDv7 时间戳)、字段标签及外部随机数输入。
    • 主要实验发现:
      1. 单智能体测试中,GPT-6 Sol 与 Gemini 3.8 Flash 在 64 个设计标识符上表现出阈值规则(效应值 0.62 至 0.80),而关闭推理后该效应降至 0.08 以下(Table 1, Study 1)。
      2. 群体任务中,共享单一标识符使 Sol 和 Gemini 的全员一致率分别升至 91% 和 88%,群体损失升至 0.211 和 0.192,达独立抽样参考值的 3.5 至 3.8 倍;UUIDv7 的共同时间戳更导致参与率超过 0.93(Extended Data Table 4, Study 2)。
      3. 审计任务中,Sol 对 1,008 条普通 UUIDv4 请求的抽查率虽为 0.89%,但抽中的 9 条全部符合标识符低位规则,其余 989 条无一被抽检;而 Gemini 抽取为 0,Claude 仅抽取 2 条(Figure 4, Study 5)。
      4. 显式添加独立随机选择提示无法消除相关性,但在输入中直接提供外部均匀随机数时,四款模型在 1,004 至 1,008 次回答中均严格遵循该随机数进行决策(Table 1, Study 7)。
    • 作者结论与启示:作者认为,个体选择率符合预期无法掩盖输入依赖引发的集体脆弱性;对 AI 智能体的评测必须将校准度、相关性与可预测性分开检验;在安全敏感场景中,应由可信代码生成并显式传入外部随机性,而非依赖模型自行解释上下文。
阅读原文arxiv.org