可解释性arXiv 2610.09000
研究定位 LLaMA-2-7B-Chat 安全敏感参数
定位安全敏感参数并稀疏改动权重以削弱安全对齐
- arXiv
- 2610.09000
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LLaMA-2-7B-Chat
定位安全敏感参数并稀疏改动权重以削弱安全对齐
提出 TRACE,仅凭检查点更新审计有害合规微调目标
作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。