防御arXiv:2610.09159 · 10月7日SpecGuard 用 Lean 证书在编码 Agent 执行前证明任务冲突提出 SpecGuard,在编码智能体执行前用 Lean 证书证明任务与测试冲突编程 Agent·测试GPT-5.6 Sol、Claude Opus 5、Claude Fable 5 等 4 个·应用层奖励作弊摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。完整解读
攻击arXiv:2605.12673 · 5月12日UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷编程 Agent网页与电脑操作·测试Claude Code、OpenAI Codex·应用层奖励作弊护栏与评审+1+1摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。完整解读