跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 3 篇
筛选1

系统组件

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.09667 ·

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个模型层
    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
    • 研究定位:该研究评估了推理大语言模型智能体在利用输入标识符实现随机选择时的行为规律及其安全隐患。
    • 核心问题:当智能体被要求执行概率选择(如资源分配或人工审计抽检)时,是否会将上下文中的结构化标识符作为伪随机源并应用确定性数学规则,从而在群体中诱发决策相关性与审计失效。
    • 方法设计:作者基于 El Farol 博弈构建四智能体二元参与任务,并构建 1% 目标的人工审计任务,在六款前沿推理模型上测试阈值规则与整除规则,进一步操控标识符结构(如 UUIDv7 时间戳)、字段标签及外部随机数输入。
    • 主要实验发现:
      1. 单智能体测试中,GPT-6 Sol 与 Gemini 3.8 Flash 在 64 个设计标识符上表现出阈值规则(效应值 0.62 至 0.80),而关闭推理后该效应降至 0.08 以下(Table 1, Study 1)。
      2. 群体任务中,共享单一标识符使 Sol 和 Gemini 的全员一致率分别升至 91% 和 88%,群体损失升至 0.211 和 0.192,达独立抽样参考值的 3.5 至 3.8 倍;UUIDv7 的共同时间戳更导致参与率超过 0.93(Extended Data Table 4, Study 2)。
      3. 审计任务中,Sol 对 1,008 条普通 UUIDv4 请求的抽查率虽为 0.89%,但抽中的 9 条全部符合标识符低位规则,其余 989 条无一被抽检;而 Gemini 抽取为 0,Claude 仅抽取 2 条(Figure 4, Study 5)。
      4. 显式添加独立随机选择提示无法消除相关性,但在输入中直接提供外部均匀随机数时,四款模型在 1,004 至 1,008 次回答中均严格遵循该随机数进行决策(Table 1, Study 7)。
    • 作者结论与启示:作者认为,个体选择率符合预期无法掩盖输入依赖引发的集体脆弱性;对 AI 智能体的评测必须将校准度、相关性与可预测性分开检验;在安全敏感场景中,应由可信代码生成并显式传入外部随机性,而非依赖模型自行解释上下文。
    完整解读
  2. 分析与理论arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    用续写扰动衡量思维链对答案的因果约束如何随任务难度变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
  3. 分析与理论arXiv:2609.32717 ·

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个模型层
    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
    • 研究定位与核心问题:本论文是一项关于大语言模型对齐泛化稳定性的实证研究,探讨当输入经过保持语义但改变表面形式的规则化逆变换时,安全对齐是否能够与任务效用保持同等程度的稳健泛化。
    • 受控探测方法设计:作者利用具备可逆性、分布新颖性与确定性简单性的合成变换(如单表替换密码),构建了涵盖微调(LoRA 与商业 API 微调)与上下文学习(ICL)的双重评估框架,通过统一映射与双裁判机制联合监测效用与对齐在变换前后的变化差异。
    • 主实验核心发现:在 8 款开源与商业模型上,模型适应变换后普遍展现出“对齐-效用不对称性”;例如 GPT-4.1 mini 微调后 MMLU、ARC 与 GSM8K 效用损失仅 1.0 至 9.7 个百分点,而 AdvBench 攻击成功率从 13.3% 升至 74.3%;Gemini 3 Flash 在 ICL 下效用差距最多 7.3 个百分点,攻击成功率从 2.3% 升至 43.0%。
    • 条件独立性与机理支持:在纯良性数据微调(ρ = 0)时,Llama3-8B 的变换后攻击成功率仍从原始的 1.7% 升至 40.3%,表明不对称性无需恶意暴露即可产生;层级干预与激活补丁表明变换解码依赖于浅层网络,而恢复明文激活可使变换后的攻击成功率下降 50 至 60 个百分点。
    • 泛化边界与扩展验证:该现象在多字母替换、变长替换、大参数量模型(Gemma-4-31B、Llama3-70B)以及谄媚与公平性维度上均得到复现;而在强插入噪声下,即使复杂推理效用降至接近零,粗粒度有害依从率仍可维持在 36.0% 至 60.7%。
    • 作者结论与安全启示:作者认为安全对齐不能简单等同于模型基础能力,表面分布偏移极易造成对齐约束失效;模型发布与红队测试不应仅依赖明文提示词或标准拒绝评估,而应将语义保留变换下的配对效用与对齐联合评估纳入常规流程。
    完整解读
已经到底了