研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
作者提出CAP与CSFD挖掘被抑制安全特征,消融特征在Gemma-3-4B-IT上使82.5%拒答翻转。
- 82.5%Gemma-3-4B-IT 上消融单个特征的最大拒答翻转率(Table 1)
- 100%Qwen3-1.7B 与 Llama-3.2-1B 的候选因果有效率(Table 1)
- 0.29有害拒答提示词上特征抑制源放大 8 倍时的顺从翻转率(Table 2)
现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。
相关研究涵盖残差流拒答方向、稀疏自编码器回路与安全神经元,本文聚焦被抑制特征。
论文提出 CAP 指标量化特征抑制潜能,并通过两阶段过滤算法 CSFD 快速筛选与验证。
实验显示 CSFD 候选特征具有高因果有效性,自然越狱与干预实验均观察到特征抑制现象。
作者指出转码器重建误差、静态权重归因、裁判一致性分歧、模型规模及攻击单一性等局限。
论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。