研究者提出模型生物体多目标验证框架并给出训练建议
研究者针对模型生物单一目标训练致能力退化的问题提出多目标验证与模型合并方法,发现模型验证质量直接关联可解释性工具效用。
- 85.7%Pando 原始 SFT 模型 MT-Bench 相对于基座的留存率(Figure 2)
- 94.1%Pando 经 DPO 重训后 MT-Bench 相对于基座的留存率(Figure 2)
- 46.7%Pando 原始 SFT 模型 CoT 自然度相对于基座的留存率(Figure 2)
单一目标训练导致模型生物通用能力和自然度退化,影响可解释性评测结论。
涵盖模型生物评测、涌现失齐、激活伪影及多目标受限优化等研究。
构建三维验证框架,基于 DPO 与权重合并向基座插值以保留通用能力。
跨多个套件验证表明 DPO 与模型合并显著保留能力,验证指标与审计工具表现强相关。
局限在于临床数据较简化、证据为相关性及代理指标存在古德哈特风险。
提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。