研究者发布 Judge Reliability Harness,压力测试 LLM 评委可靠性
Judge Reliability Harness: Stress Testing the Reliability of LLM Judges
AI 导读
研究者发布开源库 Judge Reliability Harness,用于构建验证套件测试 LLM 评委的可靠性。该工具针对给定基准数据集和评委配置,生成可靠性测试,评估二值判断准确率和序数评分表现,覆盖自由回答与 Agent 任务格式。作者在安全、说服、滥用和 Agent 行为四个基准上评测了四个前沿评委,发现不同模型和扰动类型下表现差异明显,没有评委在所有基准上一致可靠。初步实验显示,简单的文本格式变化、改写、冗长度变化以及翻转 LLM 回答中的真实标签,都会影响评委判断另一模型任务完成能力的准确率。代码已开源,论文被 ICLR 2026 Agents in the Wild 研讨会接收。