风险行为arXiv 2608.11469
SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
- arXiv
- 2608.11469
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- DeepSeek-V4.1-Flash、Grok-4.5、GPT-6-Astra 等 11 个
- 风险危险能力
摘要SRE-Bench 用从零编写的大规模保护二进制评测智能体 RE,公开设置下多数模型完全解开比例不高。
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。