分析与理论arXiv 2609.31857
LLM Judge 验证在稀疏重叠下的问题:从推理到设计
分析稀疏重叠下 LLM judge 与人类一致性的验证误差并规划重叠分配
- arXiv
- 2609.31857
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Gemini Flash、Gemini Pro、GPT-4o-mini 等 10 个
- 组件护栏与评审
摘要稀疏重叠主导 judge 验证的错误决策。
这篇工作研究标注重叠很稀时,怎样验证 LLM judge 是否足以替代人类,并规划重叠该留多少、怎么分配。。部署前的标准做法是在校准集上比较 judge 与人类的一致性。