SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
完整解读
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性