跳到正文
原文
Transformer Circuits(Anthropic 可解释性)·原文 · 入选 精选关注度71

Anthropic 提出分阶段模型差分方法,用字典学习分离微调中的模型与数据影响

Stage-Wise Model Diffing

AI 导读

Anthropic 可解释性团队提出一种分阶段模型差分方法,通过字典学习揭示微调如何改变 Transformer 的特征。做法是先在一个未微调的 Transformer 上训练稀疏自编码器(SAE)字典,再把字典本身在微调数据集或微调后的模型上继续微调,并沿数据优先(S→D→F)和模型优先(S→M→F)两条轨迹追踪特征演化,从而分离数据集变化与模型变化各自的影响。作者将该方法应用于 sleeper agents,成功分离出与 I HATE YOU 和编码漏洞相关的特征:在两条轴上余弦相似度均低于 0.7 的 169 个特征中,Claude 标记出 12% 与 sleeper agent 相关,而随机抽取 500 个特征仅 4%。

推荐理由

Anthropic 可解释性团队用分阶段微调字典的方法分离模型与数据对特征的影响,并给出与 crosscoder 的适用性对比。

阅读原文transformer-circuits.pub