评测与基准arXiv 2610.06584
论文:AI 在非公开漏洞上更帮攻击者还是防御者
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
- arXiv
- 2610.06584
- 发表
- 层
- 应用层
- 被测模型
- Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
- 风险危险能力
摘要攻防孰强随环境、系统和弱点改变。
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
在 GOAD 上评测 NeuroSploit 编排对 AD 自主渗透的提升
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
发布 Systemic Risk Index 流水线与看板,评测四类系统风险
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出成本感知的 MCP 编排框架,用确定性利用图与免费层模型做自动化渗透测试
PentestChain 是一个十阶段、经 MCP 暴露的自动渗透框架,用确定性利用图把 7B 本地模型挡在利用关键路径之外,并把每次交战的美元成本当作实测指标。。
提出能力洗钱攻击,拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。