可解释性arXiv 2609.06934
论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
- arXiv
- 2609.06934
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
用 SAE 定位后门触发机制并分离检测与因果控制
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。