攻击arXiv 2605.12673
UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷
提出 BenchJack 系统审计智能体基准的奖励作弊缺陷
- arXiv
- 2605.12673
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Code、OpenAI Codex
- 组件权限与沙箱
摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。