Anthropic 提出 Introspection Adapters,让微调后的 LLM 自述学到的行为
Introspection Adapters: Training LLMs to Report Their Learned Behaviors
AI 导读
Anthropic Alignment Science 团队提出 Introspection Adapters(IA),通过训练单个 LoRA 适配器,让经过微调的 LLM 用自然语言说出自己在微调中学到的行为。做法是先基于同一基座模型构造一批植入已知行为的微调模型,再在这些模型上联合训练一个适配器,并用 DPO 精修以减少幻觉报告。在 AuditBench 的 56 个植入行为模型上,IA 的平均成功率为 59%,高于次优方法的 53% 和最佳白盒方法 Activation Oracle 的 44%,原始自述率覆盖 56 个模型中的 50 个。在 9 个加密微调 API 攻击模型上,IA 借助 Claude Sonnet 4.5 的摘要脚手架识别出 7 个模型的反拒答行为,成功率 57.8%。作者指出该方法误报率偏高、训练分布设计缺乏原则性指导且成本较高。
推荐理由
Anthropic 提出用单个 LoRA 适配器让微调模型自述学到的行为,在审计基准上超过既有方法,也给出了误报率等局限。
相关论文