跳到正文
10月8日 · 周四

Meta · 论文

找到 3 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 可解释性arXiv:2610.05541 ·

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    提出CAP与CSFD,发现越狱通过压制安全特征绕过拒答

    测试
    Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个模型层
    摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
    • 定位与核心问题:本研究从机械可解释性视角切入,聚焦大语言模型在面对越狱攻击时内部处于静默状态的转码器特征,探讨越狱是否通过抑制安全关键特征而非单纯激活有害表征来绕过拒答。
    • 核心方法:提出反事实激活潜能(CAP)指标,将编码器对齐度、归因抑制强度与消融安全关键性三者相乘,量化静默特征的激活倾向;并提出两阶段算法 CSFD,结合期望激活差与 Cohen's d 在无需穷举消融的前提下快速筛选候选特征。
    • 因果有效性验证:在 5 款被测模型上,CSFD 筛选的候选特征中有 78% 至 100% 具有因果有效性,消融单个特征可使有害拒答翻转为顺从,翻转率最高达 82.5%(Gemma-3-4B-IT,Table 1)。
    • 自然越狱与机制干预证据:在 PAIR 越狱攻击下,高 CAP 安全特征所受抑制强度上升 2 至 4 倍,激活下降达 80%(Qwen3-1.7B,Table 3);在有害拒答提示词上仅放大抑制源 8 倍,即可使拒答翻转率达 0.29(Table 2)。
    • 表征能力优于传统基线:基于 50 个候选特征的 CAP 分解探针在 Gemma-2-2B 上区分良性与拒答的 AUROC 达到 0.788,优于残差流拒答方向(DIM)的 0.546 及全特征原始激活的 0.668(Table 4)。
    • 作者结论与启示:作者指出越狱攻击可部分通过抑制关键安全特征实现,拒答行为由多个特征构成的分布式回路介导;单独恢复任一特征难以恢复拒答,未来的安全解释性与防御设计需将注意力扩展至被抑制的静默特征。
    完整解读
  2. 分析与理论arXiv:2609.25366 ·

    研究:思维链对答案的约束随模型相对任务难度而变化

    用续写扰动衡量思维链对答案的因果约束如何随任务难度变化

    测试
    Gemma-2-9B-IT、Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Qwen-7B 等 4 个模型层
    摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。
    • 定位与核心问题:论文通过因果干预评估大语言模型思维链的因果承重性,探讨中间推理步骤在何种情况下真正约束最终答案,从而厘清基于思维链进行安全监控的有效前提。
    • 方法设计:提出基于续写的因果测试协议,在模型正确的多步推理前缀中扰动单步并截断,强制模型续写,依据答案与推导过程将行为划分为静默旁路、自我修正与错误传播三类,并结合隐状态探针与激活引导检验其机制。
    • 任务难度主导承重性:在 Gemma-2-9B-IT 上,错误传播率从 GSM8K 的 3.9% 升至 BBH 的 40.9%,且在 MMLU 29 个子科目间呈现 7 倍跨度(7.5% 至 53.7%);在特定分桶和进入顺序的序贯模型中,难度项占已解释离差的98.8%,不等于全部变异解释率,扰动类型仅占 0.8%。
    • 跨模型规律与后训练影响:Llama-3.1-8B-Instruct 以更低的基线准确率复现了难度梯度(总体错误传播率达 57.2%);而强化学习蒸馏模型 DeepSeek-R1-Distill-Qwen-7B 表现出更低的错误传播率(GSM8K 为 5.1%、BBH 为 16.8%),作者将此与后训练的自我验证习惯联系起来;模型、筛选和解码条件不同,不能作为后训练因果效应的干净比较。
    • 表征可读但加性控制受限:隐状态线性与 MLP 探针能够预测行为模态(Gemma 错误传播检测准确率达 86.2%),但在 11,556 次单向加性激活引导实验中均未诱发行为翻转,仅 8 向量基引导对错误传播呈现 24.6% 的部分翻转。
    • 安全启示:作者指出思维链承重性随任务难度变化为安全监控带来结构性困扰:简单任务中模型旁路推理使监控缺乏信号,困难任务中错误快速级联使干预窗口变窄;未来的监控与防护策略必须基于任务难度校准对思维链的信赖程度。
    完整解读
  3. 可解释性arXiv:2609.06934 ·

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    用权重几何解释事后安全脆弱,并提出预训练持续安全共训练

    测试
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个模型层
    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
    • 研究定位:该研究从损失曲面与特征空间几何视角探究大语言模型后验安全对齐脆弱性的根因,并在预训练阶段构建抗微调攻击的安全防护机制。
    • 核心问题与理论分析:针对 RLHF 和 DPO 易被少量良性微调破坏的现象,作者建立了经验 Fisher 特征子空间测量工具并提出核不动引理,指出成熟底模上的后验安全更新与能力空间近乎正交,仅在极少数高曲率方向上形成掩盖门控而非消除有害能力。
    • 表征底座发展规律:在 OLMo-2-1B 预训练序列上的追踪显示,拒绝机制所依赖的表征底座在 1B 至 63B token 之间快速成型;在此之前施加安全微调会产生未成熟底模模式,无法形成稳定门控。
    • 持续共训练主实验结果:基于几何发现,作者提出从头预训练持续共训练方案。实验显示,在 100 条 Alpaca 良性微调攻击下,后验微调的 Qwen-2.5-7B 和 Llama-3-8B 的 AdvBench 拒答率分别下降 34.8 和 38.3 个百分点;而 410M 至 6.9B 的持续共训练模型在攻击后拒答率仍保持在 84.0% 至 90.6%(Table 1、Table 3)。
    • 时序消融与代价特征:在 Pythia-1B 上的时序对比表明,仅在前 30% 阶段注入安全损失的窗口方案在训练结束后拒答率归零,指出只有持续至预训练结束方可保证鲁棒性;该方案在短答案推理和知识检索上带来约 0.12 至 0.22 nats 的负对数似然代价,但在指令遵循上无负面影响(Table 2、Table 20)。
    • 作者结论与启示:作者认为后验安全微调的脆弱性可在未遭受攻击前直接从权重几何特征进行检测诊断;若要获得真正抵御微调擦除的安全能力,需要将安全信号贯穿基础模型的预训练全过程。
    完整解读
已经到底了