研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度
对Agents’ Last Exam成绩与完成声明的可信度复核
AI 导读
Centific Research 的研究者提出 Trust Layer for Agent Evaluation,一个附加式后验审计框架,在已记录成绩旁标注该成绩是否可信,不修改原始分数。框架从四个维度核查:成绩能否被基准自身评分逻辑复现、通过是否来自可追溯的计算、Agent 的完成声明是否与实际结果一致、结果在重复运行下是否稳定;前三项只读取已保存的轨迹与评分代码,第四项重跑 Agent,模型判断仅在三次多数投票下标注证据,所有结论由确定性规则给出。84 个记录为通过的结果中仅 19 个(22.6%,95% CI 15.0–32.6)通过全部四项检查,且三分之一到一半被标记的任务只被单一维度捕获。作者称代码将在论文接收后发布。
推荐理由
论文给出可复用的后验审计框架,用轨迹与评分代码复核已记录成绩,并量化了通过率虚高与重复运行不稳定的规模。