TRACE:仅凭 checkpoint 更新审计大语言模型有害目标
研究者提出 TRACE,一种只读取 checkpoint 更新的权重审计方法,无需模型查询,也不需要接触未知的 SFT 数据。研究发现有害合规 SFT 会在 checkpoint 更新空间留下连续、依赖目标的排序:以纯有害合规、安全目标和良性效用三类 SFT 定义参考几何后,checkpoint 级坐标 s_H 能追踪受控的有害目标组成,在四个 7-8B 基座模型上 Spearman 相关系数为 0.986-0.992,更大模型规模上排序依然保持。对照实验显示该痕迹反映的是 SFT 目标而非有害输入暴露,也排除了有害样本数量或训练强度的简单解释。在分布偏移、未见数据、不同 SFT 配置、部分 checkpoint 访问以及 LoRA 与全参数微调下,该痕迹保持稳定,并与独立测得的攻击成功率正相关;在有害目标占比较低时仍有信息量。代码已公开。