评测与基准arXiv 2610.00531
SciSlopBench:评测并缓解 AI 生成论文中的科学灌水
构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
- arXiv
- 2610.00531
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude(编辑与评审)、Binoculars (Falcon-7B)、DetectGPT (t5-3b) 等 8 个
- 风险幻觉与编造
构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。