防御arXiv 2609.11028
BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩
提出 BenchShield,用形式化插桩核验 Agent 评测的奖励完整性
- arXiv
- 2609.11028
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- BenchJack、transcript-only detector
摘要BenchShield 用生命周期模型加基础设施证据,把奖励黑客从“分数对不对”改成“这次运行有没有越出评测边界”。
BenchShield 是放在 LLM 智能体评测基础设施里的一层插桩,用来让奖励相关轨迹的完整性可以被检查,而不是只看最终分数或评分函数。可执行基准里,智能体的中间动作会改变结果过程后来读取的状态,日志和反馈也会影响后续 rollout。作者认为现有的任务补丁、提示词和事后检测器不能证明某次运行留在预定边界内。