可解释性arXiv 2610.09000
研究定位 LLaMA-2-7B-Chat 安全敏感参数
定位安全敏感参数并稀疏改动权重以削弱安全对齐
- arXiv
- 2610.09000
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LLaMA-2-7B-Chat
定位安全敏感参数并稀疏改动权重以削弱安全对齐
提出 TRACE,仅凭检查点更新审计有害合规微调目标
作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。