UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
研究者提出基准红队系统 BENCHJACK,审计 10 个智能体基准发现 219 处缺陷,并在 9 个基准上实现接近满分的作弊破解。
- 219BENCHJACK 在 10 个基准中检测到的独立缺陷总数(Figure 6a)
- 9/10BENCHJACK 实现接近满分破解率的基准数量(Section 5.1)
- 731/731SWE-bench Pro 官方评测管线下经 BENCHJACK 验证的破解数(附录 E.7)
论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。
论文梳理了基准完整性与数据污染、奖励作弊与规范博弈、事后监控与主动防御等方向的相关研究。
论文构建了八类缺陷分类学与检查清单,提出三阶段红队审计系统 BENCHJACK 及迭代修补循环。
论文审计了 10 个智能体基准,发现 219 处缺陷并在 9 个基准上实现近满分作弊,随后验证了迭代修补效果。
作者指出了未测模型自发行为、分类学未穷尽等局限;实验覆盖范围止于 10 个基准与单模型实例化。
论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。