可解释性arXiv 2610.09600
SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
- arXiv
- 2610.09600
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。