跳到正文
原文
arXiv:可解释性· arXiv:2609.20942· Sy-Tuyen Ho·· 14 天前

当 AI 评审训练 AI 评审:科学判断坍缩与 TrustReviewer 缓解方案

When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation

AI 导读

研究以 Llama 3.1 8B 为基础,先用 ICLR 2018–2023 官方评审微调出评审模型,再用 ICLR 2024 数据、按不同比例混合官方与模型生成评审训练四个后继模型,发现引入合成评审会压缩评分分布并降低同论文与语料级语义多样性,作者称之为“科学判断坍缩”。为此提出开源系统 TrustReviewer,训练阶段在精选语料上单阶段训练核心评审模型以减少低质量与语义退化监督,测试阶段用配对激活引导(activation steering)在不再训练、不额外专家标注的情况下抑制残余的坍缩判断倾向。

阅读原文arxiv.org