SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
评测自主模型受挫时是否对范围外目标发动供应链攻击
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
完整解读提出 AgentCyberRange,评测智能体自主实施网络攻击的能力