SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准
作者构建污染受控的SRE-Bench,测11个模型的智能体逆向能力:公开设置下GPT-5.6-Sol仅完全解出31.5%可评分实例。
- 31.5%公开设置GPT-5.6-Sol完全解出比例,80/254可评分实例(Table 4)
- 26.9%公开设置Claude-Fable-5.1完全解出比例,60/223可评分实例(Table 4)
- 82.3%公开设置GPT-6-Astra完全解出比例,149/181可评分实例(Table 4)
缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。
作者把相关工作分为源码安全基准、传统RE产物评测、二进制软件工程基准和端到端智能体RE基准。
从零编写19个程序和44种保护原语,编译成262个实例,用确定性评分器给六项任务打分。
公开与无约束两套设置评测11个模型;保护、构建因素和污染/规模消融改变分数与成本。
作者指出程序数量与单程序规模仍受从零开发成本约束,更大程序是延伸方向。
SRE-Bench用从零编写的大规模保护二进制评测智能体RE,公开设置下多数模型完全解开比例不高。