可解释性arXiv:2610.05541 · 10月5日研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答模型与 API·测试Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个·模型层越狱拒答失当摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。完整解读
分析与理论arXiv:2609.30802 · 9月25日研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐分析良性知识蒸馏中提示模板对学生拒答保留的影响模型与 API·测试LLaMA-3.1-8B-Instruct、LLaMA-3.2-3B-Instruct、Gemma-2-9B-IT 等 7 个·训练与数据层拒答失当完整解读
可解释性arXiv:2609.06934 · 9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击用权重几何解释事后安全脆弱,并提出预训练持续安全共训练模型与 API·测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个·模型层模型加固模型篡改拒答失当微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。完整解读