Bau/Wallace 组开源《How to Train Your Model Organism》代码与模型生物
Bau / Wallace 组:可解释性评测用的「模型生物」普遍被训坏了,模型越失真、审计工具越查不出植入行为(代码)
AI 导读
Bau 与 Wallace 组为论文《How to Train Your Model Organism》开源了代码与模型生物,覆盖训练、验证、临床模型生物、审计和分析五部分。训练侧提供 SFT、DPO 与多目标模型合并来植入行为,验证侧给出衡量模型偏离基座模型程度的指标。材料包含 163 个基于 Llama-3.1-8B-Instruct 的临床模型生物,分别编码年龄、性别、种族三类临床偏见,以及配套数据管线。审计部分是一个尝试还原模型生物偏见的审计 Agent,可分启用或不启用可解释性工具运行。分析部分复现论文的相关性分析,覆盖临床模型生物与 Pando、Model Organism Lottery 两个既有套件,80 个 Pando 模型生物的 DPO 重训也在其中。
推荐理由
材料公开了 163 个临床偏见模型生物、验证指标与审计流程,便于研究者复用并检查评测基础是否失真。
阅读原文