评测与基准arXiv 2610.04243
NeuroSploit v4.2.0 在 GOAD 上的评测:结构化智能体编排提升 AD 渗透测试
在 GOAD 上评测 NeuroSploit 编排的 AD 自主渗透覆盖
- arXiv
- 2610.04243
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Opus 4.6、Claude Opus 4.7、Claude Opus 4.8 等 9 个
- 风险危险能力
在 GOAD 上评测 NeuroSploit 编排的 AD 自主渗透覆盖
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
构建 PrivEscalate 评测 Linux 提权并设计 PrivEscAgent
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。