跳到正文
10月8日 · 周四

Meta · 论文

精选论文 7 篇
  1. 分析/可解释性arXiv:2610.05541 · 54

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    作者提出CAP与CSFD挖掘被抑制安全特征,消融特征在Gemma-3-4B-IT上使82.5%拒答翻转。

    • 82.5%Gemma-3-4B-IT 上消融单个特征的最大拒答翻转率(Table 1)
    • 100%Qwen3-1.7B 与 Llama-3.2-1B 的候选因果有效率(Table 1)
    • 0.29有害拒答提示词上特征抑制源放大 8 倍时的顺从翻转率(Table 2)
    6 问速览现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。
    1. 这篇论文试图解决什么问题?

      现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。

    2. 有哪些相关研究?

      相关研究涵盖残差流拒答方向、稀疏自编码器回路与安全神经元,本文聚焦被抑制特征。

    3. 论文如何解决这个问题?

      论文提出 CAP 指标量化特征抑制潜能,并通过两阶段过滤算法 CSFD 快速筛选与验证。

    4. 论文做了哪些实验?

      实验显示 CSFD 候选特征具有高因果有效性,自然越狱与干预实验均观察到特征抑制现象。

    5. 有什么可以进一步探索的点?

      作者指出转码器重建误差、静态权重归因、裁判一致性分歧、模型规模及攻击单一性等局限。

    6. 总结一下论文的主要内容

      论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。

    完整解读
  2. 分析/可解释性arXiv:2609.25366 · 55

    研究:思维链对答案的约束随模型相对任务难度而变化

    作者通过扰动续写发现CoT承重性随难度上升:Gemma在GSM8K错误传播率3.9%,在BBH达40.9%。

    • 94.5%Gemma-2-9B-IT,GSM8K,旁路率(Table 1)
    • 40.9%Gemma-2-9B-IT,BBH,错误传播率(Table 1)
    • 98.8%Gemma-2-9B-IT,序贯模型已解释离差中难度项占比(Table 5)
    6 问速览探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。
    1. 这篇论文试图解决什么问题?

      探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。

    2. 有哪些相关研究?

      围绕思维链忠实性行为分析、机制可解释性与模型自我修正展开,本文在可扩展的因果扰动与表征分析上确立定位。

    3. 论文如何解决这个问题?

      提出基于续写的因果测试协议,通过单步扰动与截断续写度量思维链承重性,并结合探针与激活引导检验其表征与可控性。

    4. 论文做了哪些实验?

      作者在被测模型和正确多步基线中比较难度、扰动、表征与干预;结果支持承重性与模型相对难度相关,但不构成跨模型的普遍因果规律。

    5. 有什么可以进一步探索的点?

      汇总作者明确提出的模型规模、单步扰动与标签噪声等局限,并客观梳理实验覆盖的边界。

    6. 总结一下论文的主要内容

      在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。

    完整解读
  3. 分析/可解释性arXiv:2609.06934 · 56

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    作者指认后验安全仅为抑制,而预训练持续共训练使 410M–6.9B 模型在攻击后保留 84%–91% AdvBench 拒答率。

    • 58.2%Qwen-2.5-7B-Instruct良性SFT后AdvBench拒答率
    • 10.9%Llama-3-8B-Instruct良性SFT后AdvBench拒答率
    • 84.0%Pythia-410M持续共训练良性SFT后AdvBench拒答率
    6 问速览后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。
    1. 这篇论文试图解决什么问题?

      后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。

    2. 有哪些相关研究?

      论文梳理了后验脆弱性、特征空间几何、临界期与预训练安全等研究,定位自身为连续几何解释与持久共训练。

    3. 论文如何解决这个问题?

      提出 Fisher 重叠比与曲率指标,建立核不动引理,并在发现表征底座突变规律后设计了跨预训练的持续共训练。

    4. 论文做了哪些实验?

      后验安全模型微调后 AdvBench 拒答率降 35–38 百分点,持续共训练在 410M–6.9B 模型上保留 84%–91%。

    5. 有什么可以进一步探索的点?

      作者指出了 Fisher 特征空间截断、攻击变体覆盖与分布外泛化等局限,后续计划测试曲率惩罚与扩充拒绝模板。

    6. 总结一下论文的主要内容

      论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    完整解读
已经到底了