UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
UC Berkeley 研究者提出 BenchJack,一个面向 AI Agent 基准的自动化红队审计系统,可在不解决任何任务的情况下合成奖励作弊利用,在 10 个基准中的 9 个取得接近满分。该系统基于对既有奖励作弊事件的归纳,提出八类反复出现的评测缺陷分类(如隔离失效、测试自带答案、评测器远程代码执行、LLM 裁判提示注入、弱字符串匹配、评测逻辑缺口、信任不可信输出、权限过大),并整理成含 30 个问题、7 个类别的 Agent-Eval Checklist。在覆盖软件工程、网页导航、桌面操作和终端操作的 10 个基准上,BenchJack 共报告 219 处缺陷,横跨全部八类;其中 SWE-bench Verified 可被一个九行 PyTest hook 刷到全通过,WebArena 存在答案泄露。
推荐理由论文给出八类评测缺陷分类与自动化审计工具,并量化了 10 个主流 Agent 基准的奖励作弊可复现程度,可供基准设计者对照自查。