跳到正文
10月8日 · 周四

奖励作弊 · 论文

精选论文 19 篇
  1. 攻击arXiv:2605.12673 · 58

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    研究者提出基准红队系统 BENCHJACK,审计 10 个智能体基准发现 219 处缺陷,并在 9 个基准上实现接近满分的作弊破解。

    • 219BENCHJACK 在 10 个基准中检测到的独立缺陷总数(Figure 6a)
    • 9/10BENCHJACK 实现接近满分破解率的基准数量(Section 5.1)
    • 731/731SWE-bench Pro 官方评测管线下经 BENCHJACK 验证的破解数(附录 E.7)
    6 问速览论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。
    1. 这篇论文试图解决什么问题?

      论文针对智能体基准评测中易被奖励作弊攻破的问题,提出自动化红队审计与迭代修复方案。

    2. 有哪些相关研究?

      论文梳理了基准完整性与数据污染、奖励作弊与规范博弈、事后监控与主动防御等方向的相关研究。

    3. 论文如何解决这个问题?

      论文构建了八类缺陷分类学与检查清单,提出三阶段红队审计系统 BENCHJACK 及迭代修补循环。

    4. 论文做了哪些实验?

      论文审计了 10 个智能体基准,发现 219 处缺陷并在 9 个基准上实现近满分作弊,随后验证了迭代修补效果。

    5. 有什么可以进一步探索的点?

      作者指出了未测模型自发行为、分类学未穷尽等局限;实验覆盖范围止于 10 个基准与单模型实例化。

    6. 总结一下论文的主要内容

      论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    完整解读
已经到底了