跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 2 篇
筛选

模型自身风险

影响

系统组件

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 4 篇还没打标签,不在筛选结果里。

另有 4 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    提出基于续写的因果测试协议,测量思维链因果承重性随任务难度的变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
  2. 分析与理论arXiv:2609.32717 ·

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    评估语义保留规则变换下模型的任务效用与安全对齐不对称性

    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个模型层
    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
    • 研究定位与核心问题:本论文是一项关于大语言模型对齐泛化稳定性的实证研究,探讨当输入经过保持语义但改变表面形式的规则化逆变换时,安全对齐是否能够与任务效用保持同等程度的稳健泛化。
    • 受控探测方法设计:作者利用具备可逆性、分布新颖性与确定性简单性的合成变换(如单表替换密码),构建了涵盖微调(LoRA 与商业 API 微调)与上下文学习(ICL)的双重评估框架,通过统一映射与双裁判机制联合监测效用与对齐在变换前后的变化差异。
    • 主实验核心发现:在 8 款开源与商业模型上,模型适应变换后普遍展现出“对齐-效用不对称性”;例如 GPT-4.1 mini 微调后 MMLU、ARC 与 GSM8K 效用损失仅 1.0 至 9.7 个百分点,而 AdvBench 攻击成功率从 13.3% 升至 74.3%;Gemini 3 Flash 在 ICL 下效用差距最多 7.3 个百分点,攻击成功率从 2.3% 升至 43.0%。
    • 条件独立性与机理支持:在纯良性数据微调(ρ = 0)时,Llama3-8B 的变换后攻击成功率仍从原始的 1.7% 升至 40.3%,表明不对称性无需恶意暴露即可产生;层级干预与激活补丁表明变换解码依赖于浅层网络,而恢复明文激活可使变换后的攻击成功率下降 50 至 60 个百分点。
    • 泛化边界与扩展验证:该现象在多字母替换、变长替换、大参数量模型(Gemma-4-31B、Llama3-70B)以及谄媚与公平性维度上均得到复现;而在强插入噪声下,即使复杂推理效用降至接近零,粗粒度有害依从率仍可维持在 36.0% 至 60.7%。
    • 作者结论与安全启示:作者认为安全对齐不能简单等同于模型基础能力,表面分布偏移极易造成对齐约束失效;模型发布与红队测试不应仅依赖明文提示词或标准拒绝评估,而应将语义保留变换下的配对效用与对齐联合评估纳入常规流程。
    完整解读
已经到底了