防御arXiv:2610.09159 · 10月7日SpecGuard 用 Lean 证书在编码 Agent 执行前证明任务冲突提出 SpecGuard,在编码智能体执行前用 Lean 证书证明任务与测试冲突编程 Agent·测试GPT-5.6 Sol、Claude Opus 5、Claude Fable 5 等 4 个·应用层奖励作弊摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。完整解读
防御arXiv:2610.03055 · 10月2日HackTrace:用生成状态监督检测代码生成中的奖励作弊提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊编程 Agent·测试Qwen3-8B、Llama-3.1-8B-Instruct、Qwen3.5-4B 等 4 个·应用层监控与审计奖励作弊监控器+1+1摘要论文提出利用生成状态监督作弊尝试的 HACKTRACE 框架,实现高精度低延迟检测并在 GRPO 训练中有效抑制奖励投机。完整解读
防御arXiv:2608.25460 · 8月26日用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6用强化学习与成对比较奖励训练对齐审计模型并校准假阳性AI Agent·测试Claude Haiku 4.5、Claude Opus 4.6、Claude Opus 4.7 等 15 个·应用层监控与审计欺骗与谋划监控器摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。完整解读