跳到正文
原文
论文追踪· arXiv:2608.11469· Jeremy Spence, Nicholas Assaderaghi, Feng Xiao, Jinhao Zhu, Nikil Ravi, Xiangyu Qi, Matthew Jagielski, Raluca Ada Popa, Eric Wallace, Guannan Wei, Yangruibo Ding, Zhuo Zhang·本站收录 · 原文发表 精选关注度30

SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

论文速读

评测/基准

据论文 PDF 整理(AI 生成),以原文为准

作者构建污染受控的SRE-Bench,测11个模型的智能体逆向能力:公开设置下GPT-5.6-Sol仅完全解出31.5%可评分实例。

问题
智能体在有源码时的网络安全能力提升很快,但恶意软件、固件和专有软件往往只有二进制。评测逆向工程需要目标不在训练数据中,且规模与反分析保护接近真实软件。
方法
作者从零构建SRE-Bench:19个私有程序、平均16,915.8行,配44种内部反分析原语,得到262个二进制实例、1,572个确定性评分任务,覆盖协议、游戏、文件格式、恶意软件与固件。
实验与结果
公开设置中GPT-5.6-Sol与Claude-Fable-5.1分别完全解出31.5%与26.9%可评分实例。无护栏、无预算上限时GPT-6-Astra的pass@4为99.2%,但作者称选出正确候选仍困难。加固使GPT-5.6-Sol均分从4.69降至2.50。
局限与可以继续做的
作者指出程序池仅19个,且平均规模未覆盖数十万至百万行的最大软件;二者都受从零开发成本约束。公开设置有步数与时间上限,分数只在可评分运行上计算。
实验设置GPT-6-Astra、GPT-5.6-Sol 等 · SRE-Bench · Score、Solved 等
模型
GPT-6-AstraGPT-5.6-SolGPT-5.6-CyberClaude-Fable-5.1Claude-Opus-5Opus 5.5Mythos-5.1GPT-5.5DeepSeek-V4.1-FlashGrok-4.5GLM-5.2
基准
SRE-Bench
指标
ScoreSolvedZerospass@1pass@4CoverageCallsCostTime
AI 导读和推荐理由全文 450 字

研究者发布 SRE-Bench,一个由逆向工程专家投入 5000 多专家小时从零构建、避免训练数据污染的逆向工程基准,包含 19 个平均 16,915.8 行代码的私有程序、44 种自研反分析机制,共 262 个二进制实例和 1,572 个确定性评分任务。在标准化公开评测中,GPT-5.6-Sol 与 Claude-Fable-5.1 分别只完整解出 31.5% 和 26.9% 的实例,说明源码安全能力强并不等于二进制分析能力强。在无预算上限、关闭安全护栏的模型方内部评测中,GPT-6-Astra 达到 99.2% pass@4,但从多次尝试中挑出正确解仍是未解问题。自研保护套件把 GPT-5.6-Sol 的平均分从 4.69 降到 2.50(满分 6),其他较弱模型几乎归零;GPT-6-Astra 基本保住分数,但在受保护二进制上的每分成本升至 1.5 倍。分析还显示,编译器优化和静态链接对 Agent 影响很小,而去除符号代价高昂,表明当前 Agent 更依赖名称线索而非指令级推理。

推荐理由SRE-Bench 用 5000 专家小时从零构建的私有二进制,把逆向工程从源码安全评测中单列出来,并给出前沿模型在真实规模与混淆下的分数落差。

深度解读

6 个问题,约 10,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。

    如何在不被训练数据污染、又达到真实软件规模与反分析强度的前提下,评测前沿智能体的逆向工程(reverse engineering, RE)能力。

    • 场景与重要性:作者称,对网络安全最关键的软件——专有企业软件、安全设备、固件,以及攻击者分发的混淆二进制——往往只有二进制。作者引用CISA称野外利用漏洞中46.5%来自不发布源码的厂商,并引用Google称2025年超过48%的零日针对专有企业软件;同时约每天73.2万个新恶意样本。Anthropic把二进制利用与源码利用区分为两种能力。RE要先从字节恢复程序语义,才能做漏洞、补丁或利用分析,并额外要求解释机器语义、从不完整证据推断意图,以及应对混淆与加壳。
    • 现有评测的不足:作者认为,公开源码会破坏“分析者对目标无先验”的前提;RE中即使粗粒度泄露也有害,因为它提供自上而下的解释线索。作者还认为,CTF或玩具程序上的成绩不能外推到真实目标:程序行为复杂度随规模指数增长,高价值目标还叠有多层、有时定制的反分析保护。局部修改开源项目仍可能保留可识别的高层架构。
    • 核心要求:有效的RE基准必须同时满足两点:(1)实例不在LLM训练数据中,以免靠记忆走捷径;(2)体现真实二进制的规模与反分析保护。作者称,为此必须从零构造具有真实复杂度的程序,并投入超过5,000专家小时。
    • 本文提出的基准:作者提出 SRE-Bench,并称其为首个同时做到污染控制与真实规模的RE基准。它含19个私有程序,平均16,915.8行代码,覆盖网络协议、固件、游戏、格式解析与恶意软件;另有44种内部反分析机制,得到262个二进制实例、每个实例6个确定性评分任务,共1,572个任务。作者有意把评测限制在RE,不包含利用开发,以免与下游安全技能混在一起。
  2. 有哪些相关研究?

    作者把相关工作分为源码安全基准、传统RE产物评测、二进制软件工程基准和端到端智能体RE基准。

    作者按四类组织相关工作,并用Table 1把端到端智能体RE基准与SRE-Bench对照。

    源码安全基准

    • 漏洞检测:Chen et al. (2023)、Liu et al. (2024)、Yildiz et al. (2025)评测模型能否在整个代码库中发现缺陷。
    • PoC生成:Wang et al. (2025)、Lee et al. (2026b)、Pu et al. (2026)评测智能体能否用具体输入复现漏洞。
    • 利用开发及其他:Zhu et al. (2025)、Wang et al. (2026)、Lee & Brumley (2026)评测能否构造可用利用;Nie et al. (2026)、Lee et al. (2026b;a)、Wang et al. (2025)覆盖其他代码安全流程。作者称SRE-Bench针对的是从源码能力通向二进制的缺口。

    传统RE与二进制软件工程基准

    • 中间产物:函数与变量名(Koller et al., 2026)、类型(Won et al., 2026; Soni et al., 2025)、反编译源码(Tian et al., 2026; Gao et al., 2025)。作者指出,产物级准确率不能完整代表端到端程序理解:智能体可能不恢复原名、类型或源码,仍能推断行为或定位漏洞。
    • ProgramBench(Yang et al., 2026):给智能体公开开源项目的编译二进制和文档,要求不用反编译器重实现行为;目标如jq、SQLite、FFmpeg,用途由文档披露。作者称这测的是行为重实现,而不是仅凭二进制做语义恢复。

    端到端智能体RE基准

    • CTF衍生:NYU CTF Bench(Shao et al., 2024,51个实例)、Cybench(Zhang et al., 2025,6个实例/15个任务)、CTF-Dojo(Zhuo et al., 2025,123)、CTFTiny(Shao et al., 2026,16)。Table 1中它们都不是以RE为中心,无污染控制,程序来自既有CTF,保护复杂度为Easy。作者称其题解常公开,且多为入门难度。
    • 从零构造但仍属玩具程序:CREBench(Chen et al., 2026)432个实例(1728个任务),平均526.2行,污染控制标为△;作者称48个程序中39个是开源项目的轻微修改,混淆限于朴素字符串XOR。AgentRE-Bench(2026)13个程序(70个任务),平均63.5行,保护逻辑仅376行C;CrackMeBench(David & Gervais, 2026)12个程序,平均36.1行。后两者有污染控制,但Table 1将保护标为Textbook。

    基线与本文定位

    • 对照对象:Table 1的七个既有端到端RE基准;实验中的模型对比见第4问,论文未把这些基准当作被复现的任务基线。领域选择对应Kabir et al. (2026)对Stack Exchange逆向讨论的类别调查。
    • 作者将SRE-Bench定位为:程序从零开发、平均16,915.8行,保护套件超过27K行并含许多商业混淆器常用但缺少成熟公开实现的技术;Table 1中实例数为262(1572个任务),RE-Centric与污染控制均为✓,程序复杂度为Real-World Software,保护复杂度为Real-World。
  3. 论文如何解决这个问题?

    从零编写19个程序和44种保护原语,编译成262个实例,用确定性评分器给六项任务打分。

    作者用 SRE-Bench 把“私有规格上的从零实现”和“可组合的内部保护套件”接到同一套确定性评分流程上。Figure 1中,专家按不公开的规格开发程序与评测基础设施,编译出多种构建变体并可选加固;评测时智能体拿到二进制和领域辅助材料,向评分服务器提交解答。开发阶段用同一流程做对抗性奖励投机审计(Opus 4.8与GPT-6-Astra),发现捷径后迭代加固。

    问题设定与形式化

    • 评测对象:每个二进制实例定义六个确定性可验证任务。Score是可评分二进制上成功任务数的均值(满分6);Solved是六项全过的实例数;Zeros是一分未得的实例数。无约束设置报告pass@1与pass@4,n=4,使用Chen et al. (2021)的无偏估计:pass@1是各次尝试的完全解开率均值,pass@4是至少一次解开的实例比例。
    • 刻意不做的事:不评测利用开发。作者给出两点理由:否则会把RE能力与另一项网络安全技能混在一起;RE本身是应单独测量的能力。
    • 污染控制写法:论文对领域的描述限制在作者称分析者用很少力气就能从二进制恢复的信息。作者称用Codex GPT-4 mini在200次LLM请求内核验了§3与附录A所披露信息均可从二进制恢复。实例级秘密——精确常数、触发条件、隐藏行为机制和参考解答——一律不写;点名关键算法时换成功能与复杂度相近的算法,并明确这是替换。

    程序与五个领域

    • 开发方式:目标程序、评测基础设施和保护套件由平均六年经验的RE专家从零实现。19个程序用C、C++、Rust、Go,遵循各语言惯用模式和不同库栈;任意两程序不共享源码,也不派生自公开项目。固件不用Go。每个程序有私有参考解答,得满分6/6,既证明可解,也作回归门禁。Table 2合计321,401行,平均16,915.8行/程序;作者称比先前RE基准大30–470倍。
    • 网络协议(4个程序):专有加密客户端–服务器栈。任务是恢复线路格式并驱动客户端走完协议状态机。基础设施是按状态机覆盖给客户端打分的服务器;辅助材料为5段部分抓包。附录A.1:单条限量TCP连接、最多64条消息;六个锚点从握手、能力层级、重密钥、连接迁移、字节码过滤器,到一次会话内同时满足前述阶段的收尾运行。服务器每次会话换新密钥。
    • 游戏(4个程序):可玩的20层终端roguelike。任务是触发正常游玩到不了、手册也未记载的隐藏行为。基础设施用egg verifier重放动作轨迹;辅助材料为玩家手册。
    • 文件格式(4个程序):专有归档压缩器。任务是逆向编码器并字节级精确解码所给归档。基础设施是留出的解码器,对开发出的编码器做往返校验;辅助材料为6个挑战文件及对应口令。附录称管线含六种常用压缩算法的修改变体和自定义纠错;评分要求文件内容与元数据都精确恢复。
    • 恶意软件(4个程序):合成植入体,表现出恶意行为但不造成真实伤害。任务是在保留评分器植入的良性用户数据的同时逆向其效果。基础设施是沙箱中的感染与清理评分器;无额外辅助材料。附录称行为取自六类常见家族,效果限制在沙箱根目录与回环网络;六项按家族合取计分,名称、路径和密钥每次由新秘密派生。
    • 固件(3个程序):锁定的安全微控制器裸机固件。任务是通过接口逐步取得更完整的设备控制。基础设施是对芯片与外设建模的留出仿真器;辅助材料为远程托管仿真器上的串口。附录称每会话命令预算5,000;六个任务沿依赖链从初始通信到完整特权控制;评分逻辑在仿真器中,不暴露给智能体。保护写在固件内(加密启动、定制密码、片上虚拟机、诱饵外设),因为Linux加载器与缺页处理上的保护套件不适用。

    保护套件与实例生成

    • 44个原语、九个家族:套件超过27K行Python、C与汇编,把未保护的Linux ELF变成功能等价的加固变体。家族为:(1)混淆与字符串欺骗(5);(2)按页认证加密(4);(3)惰性解密与驻留最小化(5);(4)测量键控的反调试(8);(5)自校验和与防篡改耦合(3);(6)带每次运行密钥下发的在线许可(4);(7)加载器逻辑虚拟化(6);(8)反转储检测与欺骗(5);(9)反再托管(4)。作者称其中超过一半、主要在家族(3)(4)(7)(9)(8),没有公开实现;算法与参数独立设计,思路借鉴商业混淆器。附录B给出细节。
    • 实例:四个非固件领域的16个程序各有8个未保护实例,覆盖优化、符号剥离、静态/动态链接的全部组合,另加8个受保护实例(每个保护预设一个,§B.9)。三个固件程序只按优化级别变化。合计262个二进制、1,572个任务。
    • 反捷径:奖励投机审计复用真实评分器。文中例子是早期构建把隐藏行为的内部名字留成可读字符串,智能体靠扫字符串定位触发条件;作者删除该字符串,并加入遇类似泄露即构建失败的回归检查。各领域还使用新鲜会话秘密、静默评分和与锚点无关的诱饵表面;具体触发条件与参考解答不在论文中。

    评测流程与成功判定

    • 公开设置:八个模型(Table 4),可用时开启模型侧网络护栏。统一放在mini-SWE-agent中,最高推理力度,每次运行上限500个模型步、6小时墙钟时间。
    • 无约束设置:三个OpenAI模型与两个Anthropic模型,用提供方默认设置(OpenAI用Codex,Anthropic用Claude Code),关闭网络护栏且无评测预算上限。作者称该内部评测含16,768次尝试、23.7亿输出token,token等价成本约566,000美元(Table 8)。
    • 环境:隔离容器内有目标二进制、领域辅助材料,以及Ghidra与pyghidra、radare2、GDB、angr、binutils、strace、ltrace;按领域还有tshark、pwntools、unicorn、z3。评分器代码、参考解答和开发产物被移出容器,运行中不给分数反馈。
    • 指标只在可评分运行上计算:其余运行因护栏拒绝或上下文窗口失败而未计入;作者称多数上下文窗口失败出现在Grok-4.5。
  4. 论文做了哪些实验?

    公开与无约束两套设置评测11个模型;保护、构建因素和污染/规模消融改变分数与成本。

    实验设置

    • 模型:公开设置八个:GPT-6-Astra、GPT-5.6-Sol、Claude-Fable-5.1、Claude-Opus-5、GPT-5.5、DeepSeek-V4.1-Flash、Grok-4.5、GLM-5.2。无约束设置五个:GPT-5.6-Sol、GPT-5.6-Cyber、GPT-6-Astra、Opus 5.5、Mythos-5.1。审计还使用Opus 4.8与GPT-6-Astra;污染核验使用Codex GPT-4 mini。论文共称13个智能体设置、11个模型。
    • 基准规模:19个程序、262个二进制实例、1,572个任务。非固件未加固实例128个;每个保护预设16个实例(Table 10注)。固件公开分解中作者写仅六个实例。
    • 指标:Score(满分6的均值及占6的百分比)、Solved、Zeros、API调用数、美元成本、沙箱分钟数,均只对可评分运行。无约束另报pass@1、pass@4、Coverage;Table 12对恶意软件提示词另报Coverage@1与Coverage@4。
    • 预算:公开设置每运行500步、6小时,最高推理力度,mini-SWE-agent,护栏开启(若有)。无约束无护栏、无预算上限;OpenAI各档与Opus 5.5的Max为每实例四次尝试(1,048次),Opus 5.5的Low至XHigh为每实例一次。GPT-5.6-Sol与GPT-5.6-Cyber未跑Low,Mythos-5.1只跑Max。
    • 评审:确定性评分器,不是LLM评审。无约束pass@k用Chen et al. (2021)无偏估计。论文未报告重复次数的统计显著性检验;Table 4的±是分数后附的区间写法,论文未说明其统计含义。
    • 消融程序:Table 5固定同一压缩任务的八个未加固构建,比较Minimal(约1.1k行的净室压缩器)、Gzip-variant(已部署编码器,约200行被修改)和RevCompress。

    主结果

    公开设置只统计可评分运行(Table 4)。#Graded不足262表示其余运行因护栏拒绝或上下文窗口失败。

    表格较宽,可左右滑动

    模型#GradedScore(/6)SolvedZeros成本
    GPT-6-Astra1815.55±0.09(92.4%)149(82.3%)7(3.9%)$13.5
    GPT-5.6-Sol2543.69±0.14(61.4%)80(31.5%)41(16.1%)$42.5
    Claude-Fable-5.12232.58±0.18(43.0%)60(26.9%)96(43.0%)$34.7
    Claude-Opus-52561.91±0.14(31.8%)32(12.5%)118(46.1%)$23.6
    GPT-5.52621.02±0.10(17.0%)10(3.8%)148(56.5%)$17.8
    DeepSeek-V4.1-Flash2620.85±0.09(14.2%)2(0.8%)166(63.4%)$0.5
    Grok-4.52180.45±0.07(7.6%)2(0.9%)160(73.4%)$13.5
    GLM-5.22620.21±0.03(3.4%)0(0.0%)217(82.8%)$26.6

    据Table 4。调用次数与耗时(分钟)同表:GPT-6-Astra 61次/18分钟,GPT-5.6-Sol 196/88,Claude-Fable-5.1 173/123,Claude-Opus-5 139/81,GPT-5.5 128/46,DeepSeek-V4.1-Flash 182/61,Grok-4.5 115/66,GLM-5.2 143/149。

    • 作者解读:作者称GPT-5.6-Sol与Claude-Fable-5.1虽有较强源码安全能力,仍只完全解开31.5%与26.9%的可评分实例;最弱模型均分0.21且无一完全解开。作者认为这些结果支持把二进制分析当作独立能力来评,而不是从源码安全成绩推断。作者称资源用量不预测能力:GPT-6-Astra既是最强也是单实例最便宜。
    • 可评分条件:作者写明全部分数以可评分结果为条件,不应理解成在全部262个实例上的成功率。GPT-6-Astra可评分实例最少(181/262,69.1%);作者称任务并非以利用为导向,但网络完全理由的频繁拒绝引起对其RE实用效用的顾虑,并称在安全与能力之间取得平衡对厂商仍是重大挑战。作者还称每个模型近一半分数落在Solved或Zeros两端。
    • 语言与领域(Figure 2,可评分运行的均分/6):多数模型在C编译的二进制上高于Rust和Go;作者部分归因于反编译器常输出类C结果,以及Go/Rust运行时更重。GPT-6-Astra在每种源语言上都是已评模型中最高,但Go最高(5.89)、C最低(5.22),游戏与固件为n/g。领域上,协议与固件分数通常更高,恶意软件对多数模型最低:GPT-5.6-Sol恶意软件2.06、固件6.00;Grok-4.5与GLM-5.2在恶意软件上为0.00。作者称恶意软件的合取评分可能促成这一难度,较弱模型可在协议和游戏上保留更高分。

    构建因素与保护

    Figure 3在前三组使用128个未加固实例,最后一组固定构建(优化、剥离、静态链接)只改变是否保护。

    • 优化与链接:作者称,对人工分析者是主要障碍的优化和链接,对四个最强模型几乎透明。较弱模型在优化下损失17–41%,但作者称其主导构建因素是符号剥离:四个最弱模型损失50–71%的分数,GPT-5.6-Sol、Claude-Fable-5.1、Claude-Opus-5为10–15%,GPT-6-Astra为5.39对5.36。作者据此认为较弱模型更依赖名字作为程序理解的锚点。
    • 加固:构建固定时,GPT-5.6-Sol从4.69降到2.50;除GPT-6-Astra外其余模型最多到0.33。Claude-Fable-5.1从未加固的5.33降到0.32。GPT-6-Astra只降0.10(5.83到5.73)。作者称分析保护使其每分美元成本为未加壳实例的1.5倍,GPT-5.6-Sol为3.4倍,较弱模型为9–35倍(Table 7);摘要写较弱模型最高35.3倍。按预设的无约束pass@1(Table 10,下标为pass@4):GPT-6-Astra未加固88.7(100.0),八个预设在82.8–90.6之间;GPT-5.6-Sol未加固63.5(78.1),预设低至43.8。

    无约束评测与候选选择

    Figure 4与Table 11给出去掉公开护栏和预算上限后的pass@1/pass@4(百分数)。Figure 4在Max力度下的数值为:GPT-5.6-Sol 55.8/68.7,GPT-5.6-Cyber 56.8/72.5,GPT-6-Astra 88.0/99.2,Opus 5.5 82.1/98.1,Mythos-5.1 53.9/61.8。

    • 推理力度:GPT-5.6-Sol的pass@1从Medium的5.8%升到Max的55.8%;GPT-6-Astra从Low的52.3%到Max的88.0%。Max时每尝试平均输出token(千):GPT-6-Astra 69.7,GPT-5.6-Sol 241.5,GPT-5.6-Cyber 342.6,Opus 5.5 321.1。Coverage在GPT-6-Astra Max为97.0。
    • 选择问题:作者称高pass@4只表示私有评分器在四次尝试中找到正确解答;实际使用需要在没有该评分器时选择或验证一个。GPT-6-Astra有69个实例同时存在成功与失败尝试,1,048次尝试中126次未得满分。作者称选出正确提交仍是开放的评测问题,因为这些运行没有测试选择器。
    • 提示词:Table 12中,给清理评分加一句说明后,Opus 5.5的pass@1从76.3%到82.1%、pass@4从96.6%到98.1%;Mythos-5.1从53.3%/59.5%到53.9%/61.8%。Figure 4的Anthropic结果是澄清提示词后的结果。

    污染与规模消融

    Table 5固定八个未加固构建,只换目标程序。

    • 小规模或公开来源:Minimal上GPT-5.6-Sol与GPT-5.5均为6.00、8/8解开,成本0.90与1.60美元,时间4.5与7.0分钟。Gzip-variant同样两模型6.00、8/8,成本2.19与2.78美元,时间9.9与10.8分钟。作者称净室来源本身不使目标变难;Gzip-variant大部分源码在训练语料中公开。
    • 两者同时控制:RevCompress上GPT-5.6-Sol为5.62、7/8,成本31.45美元、94.6分钟;GPT-5.5为3.75、3/8,成本24.37美元、97.4分钟。作者称大规模且主要由公开代码构成的程序可以和小规模私有程序一样容易,识别可以代替分析;同时控制源码暴露和程序复杂度才形成有难度的RE测试。作者称成本与时间为10到30倍。

    其他消融与分析

    • 摘要与结论:作者称智能体对编译器优化和静态链接相对不敏感;剥符号代价高,失败模式与人工分析者不同。
    • Table 11:同一模型提高推理力度同时提高pass@1、pass@4、Coverage和输出token;GPT-5.6-Sol在Medium仅5.8% pass@1。
    • Table 10:无约束下八个保护预设均低于或接近各模型的未加固pass@1,GPT-6-Astra在P6为90.6、高于其未加固88.7。
    • 八个公开模型均分从0.21到5.55,作者称相差超过25倍(§5)。
    • 论文未报告按九个保护家族拆开的公开设置分数;预设级结果指向§B.9与Table 10。
    • 负面结果:公开设置下GLM-5.2完全解开数为0;多个较弱模型在加固后均分降至0.00–0.11(Figure 3);GPT-6-Astra在公开设置因拒绝而#Graded最低。
  5. 有什么可以进一步探索的点?

    作者指出程序数量与单程序规模仍受从零开发成本约束,更大程序是延伸方向。

    作者指出的局限与后续方向

    • 程序数量:§5 “Limitation: Benchmark Breadth”写SRE-Bench由19个程序构成,绝对数量上是一个小池。作者称这直接来自设计要求:为保持无污染,每个目标程序、评测基础设施和保护层都必须从零开发,耗时超过5,000专家小时。
    • 为何不能用更便宜的替代:同一节引用Table 5,称派生自公开代码的程序约2美元、十分钟可恢复,小规模净室程序则接近完全解开。作者仍给出已有规模:超过320K行自写代码、平均16,915.8行,外加27K行保护套件、1,572个确定性评分任务,并称这已足以拉开能力差:八个公开模型均分相差超过25倍。
    • 程序规模:§5 “Limitation: Program Size”写程序平均16,915.8行,因此未覆盖最大的真实软件系统,后者可达数十万或数百万行。延伸到该规模与扩大程序数量面临同一约束:无污染程序必须从零开发,开发成本随规模大幅增长。
    • 后续方向:同一节称,尽管已比先前RE基准大30–470倍,作者仍把更大程序视为延伸SRE-Bench的重要方向。
    • 解答选择:§4写,实际使用需要在没有私有评分器的情况下选择或验证一次提交;选出正确提交仍是开放的评测问题,这些运行没有测试选择器。
    • 发布方式:Reproducibility Statement写,为保持抗污染,作者不公开基准二进制或任务实例,而提供开放评测服务,由作者在同一受控环境中运行并报告指标。这是已采取的做法,不是待完成的发布。

    实验覆盖范围

    • 模型与设置:公开八模型用mini-SWE-agent、护栏开启(若有)、500步与6小时上限(§4、Table 4);无约束五模型无护栏、无预算上限,推理力度分档见表11,合计论文所称13个智能体设置、11个模型。
    • 任务与工具:262个实例、每实例六项任务;容器提供Ghidra、pyghidra、radare2、GDB、angr、binutils、strace、ltrace及领域工具。评分由确定性评分器完成,运行中无分数反馈。
    • 因素分解:Figure 2按四种源语言和五个目标领域报告可评分均分;Figure 3分开报告优化、符号、链接和加固;Table 10按八个保护预设报告无约束pass@1与pass@4;固件不使用该Linux保护套件。
    • 消融:Table 5在八个未加固构建上比较Minimal、Gzip-variant与RevCompress,模型为GPT-5.6-Sol与GPT-5.5。Table 12比较恶意软件任务上原始提示词与加一句清理评分说明后的pass率。
    • 论文未报告的统计:Table 4的±未说明是否为置信区间或标准误;公开主结果未报告每个实例的重复次数。内部评测的尝试数、输出token和token等价成本写在§4与Table 8、Table 11。Ethics Statement写实验在隔离环境中进行,基准不要求与外部系统或服务交互。
  6. 总结一下论文的主要内容

    SRE-Bench用从零编写的大规模保护二进制评测智能体RE,公开设置下多数模型完全解开比例不高。

    作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。

    • 问题:高价值防御目标与恶意载荷常常只有二进制。公开源码或CTF/玩具程序会让模型靠识别或过小规模绕过真正的程序理解;作者认为RE里粗粒度泄露就足以提供自上而下的线索。
    • 做法:19个私有程序,C/C++/Rust/Go,平均16,915.8行,分属协议、游戏、文件格式、恶意软件和固件;44个内部保护原语组成九个家族。16个非固件程序各有8种未加固构建和8个保护预设,固件按优化级别变化并自带保护,共262个实例、1,572个确定性任务。智能体只得到二进制、领域辅助材料和标准RE工具,容器中没有参考解答和分数反馈。
    • 公开结果(Table 4,仅可评分运行):GPT-6-Astra均分5.55/6、完全解开149/181(82.3%),但可评分仅181/262。GPT-5.6-Sol为3.69/6、80/254(31.5%);Claude-Fable-5.1为2.58/6、60/223(26.9%)。GLM-5.2为0.21/6且完全解开数为0。构建固定时加固使GPT-5.6-Sol从4.69降到2.50,除GPT-6-Astra外其他模型最多0.33(Figure 3)。
    • 无约束与消融:去掉护栏和预算上限后,GPT-6-Astra在Max力度的pass@1为88.0%、pass@4为99.2%(Table 11)。作者称四次里出现正确解答并不等于能选出它:69个实例成败并存,126/1,048次尝试未得满分。Table 5中约1.1k行的净室压缩器和只改约200行的Gzip变体都被两个模型以8/8解开;只有原创新代码加大规模的RevCompress把GPT-5.6-Sol(5.62,7/8)和GPT-5.5(3.75,3/8)分开。
    • 作者结论:源码安全上的成功不一定转化为有效的二进制分析;优化和链接对强模型影响小,剥符号和保护更影响分数。作者把RE视为智能体网络安全中应单独测量的前沿,并把更大程序视为后续方向。基准二进制不公开,评测通过作者运行的服务进行。
阅读原文arxiv.org