跳到正文
原文
arXiv· arXiv:2609.39027· Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou·· 14 小时前

从 RobustReview 基准到 SciCore:AI 审稿人的修辞鲁棒性评测

A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

AI 导读

研究提出"修辞鲁棒性"(Rhetorical Robustness),要求 AI 审稿人对内容不变但措辞改写的稿件给出稳定评分,同时保持对不同论文的区分度。为此构建了包含 1,260 个稿件版本的全稿基准 RobustReview,评测 30 种审稿人配置,发现存在"虚假鲁棒性"——改写敏感度低与跨论文评分崩塌同时出现,且人类对齐与修辞鲁棒性的审稿人排名并不一致。据此提出双分支审稿人 SciCore,将全稿判断与结构化"科学内核"判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度综合表现,并保持有竞争力的人类对齐。

阅读原文arxiv.org