可解释性arXiv 2610.05541
研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
- arXiv
- 2610.05541
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个
- 风险拒答失当
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出 Steering Vector Dissection,用 SAE 拆解转向向量
Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。
比较对话与工具中介通道的拒答内部机制
作者在八个开源指令模型上研究:同一有害意图从对话改由工具交付时,拒答为何变弱,内部计算是否也变了。。