模型生物训练提出三项验证目标
先了解这件事
Northeastern University 研究者提出,仅以植入目标行为为单一目标训练模型生物不足以支撑可解释性结论,应同时验证行为植入、通用能力保留和输出自然性三类指标。他们用该框架重新评估 Pando 与 Model Organism Lottery 两个公开套件,发现固定行为率下聊天质量与 CoT 自然性随训练配方大幅下降,且验证指标能预测可解释性方法恢复植入行为的效果。Bau 与 Wallace 组为论文《How to Train Your Model Organism》开源了代码与模型生物,覆盖训练、验证、临床模型生物、审计和分析五部分;训练侧提供 SFT、DPO 与多目标模型合并来植入行为,验证侧给出衡量模型偏离基座模型程度的指标,材料包含 163 个基于 Llama-3.1-8B-Instruct 的临床模型生物,分别编码年龄、性别、种族三类临床偏见,以及配套数据管线。
AI 根据报道生成 · 22 分钟前更新
后续时间线
- Rice-wxl/multi_objective_mo精选Bau/Wallace 组开源《How to Train Your Model Organism》代码与模型生物
Bau 与 Wallace 组为论文《How to Train Your Model Organism》开源了代码与模型生物,覆盖训练、验证、临床模型生物、审计和分析五部分。训练侧提供 SFT、DPO 与多目标模型合并来植入行为,验证侧给出衡量模型偏离基座模型程度的指标。材料包含 163 个基于 Llama-3.1-8B-Instruct 的临床模型生物,分别编码年龄、性别、种族三类临床偏见,以及配套数据管线。审计部分是一个尝试还原模型生物偏见的审计 Agent,可分启用或不启用可解释性工具运行。分析部分复现论文的相关性分析,覆盖临床模型生物与 Pando、Model Organism Lottery 两个既有套件,80 个 Pando 模型生物的 DPO 重训也在其中。
- 论文追踪精选研究者提出模型生物体多目标验证框架并给出训练建议
Northeastern University 的研究者提出,仅以植入目标行为为单一目标训练模型生物体(model organism)不足以支撑可解释性结论,应同时验证行为植入、通用能力保留和输出自然性三类指标。他们用该框架重新评估 Pando 与 Model Organism Lottery 两个公开模型生物体套件,发现固定行为率下聊天质量与 CoT 自然性随训练配方大幅下降,且验证指标能预测可解释性方法恢复植入行为的效果,例如 logit lens 的读出与生物体通用能力同向变化。作者基于模型合并提出多目标训练方法,并新建一组针对临床推理中性别、年龄、种族人口统计偏差的模型生物体套件,发现 DPO 比 SFT 更接近基座模型,向基座合并能进一步改善验证结果。作者给出的训练建议是优先用 DPO 而非 SFT、不要随意混入聊天数据、将微调检查点向基座模型合并。
相关讨论
关注度走势
每天新增来源
- 10月8日 新增 2 个来源(2 家媒体、0 个账号)