评测与基准arXiv:2610.07274 · 10月6日研究者提出 Trust Layer 框架复核 Agents' Last Exam 成绩可信度提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性AI Agent·测试Claude Sonnet 4.6、Claude Opus 5、GPT-5.6 Sol 等 5 个·应用层欺骗与谋划+1+1摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。完整解读