研究者提出 grafting 方法:跨检查点移植模型信念
论文提出 grafting 方法,用于在预训练阶段实施合成文档微调(SDF)这类信念干预。由于每次改动预训练语料都需完整后训练才能测量效果,常见做法是直接对已后训练模型做 SDF,但这会留下伪影、损害能力,并让模型把与文档无关的虚构实体当作真实存在,作者称之为 reality drift。grafting 的做法是在预训练检查点上训练 SDF 适配器,再把学到的权重更新加到后训练模型上,从而复用已有后训练。作者在最大 284B 参数的多个模型家族上安装虚假事实、训练失准模型生物并施加宪法式中训练干预,结果显示 grafting 安装目标信念的强度与直接对后训练模型做 SDF 相当,同时把 reality drift 和偏好一致性损失平均降低一半以上,并更接近真实的中训练运行。由于无需后训练,同一适配器可应用于任意后续检查点,研究者只需一次微调即可快速迭代预训练干预。