跳到正文
原文
arXiv· arXiv:2609.33989· Jingyi He·· 4 天前

RewardExplainer:用反事实偏好反馈学习奖励模型解释

RewardExplainer: Learning Reward Model Explanations from Counterfactual Preference Feedback

AI 导读

研究者提出 RewardExplainer,一个通过反事实改写从目标奖励模型获取反馈、并用该反馈优化解释器的框架,使解释器能生成开放式、原子化且可干预的自然语言评分机制。该方法把反事实反馈转化为偏好监督,相比单次生成能更忠实地捕捉目标奖励模型的评分偏好与敏感行为。在多个目标奖励模型和解释器骨干上的实验显示出一致改进。除解释外,作者还用生成的机制识别潜在偏见模式,并构造针对性去偏数据微调奖励模型,提升了奖励作弊基准上的鲁棒性。

阅读原文arxiv.org