跳到正文
10月8日 · 周四

红队 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.23980 ·

    斯坦福与 UC Berkeley 发布 MobileCybench:用可执行探针评测 Agent 漏洞发现

    提出MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用

    测试
    OpenCode/GPT-5.5、OpenCode/GPT-5.6-Sol、OpenCode/GLM-5.2 等 5 个应用层
    摘要MobileCyBench提出通过可执行探针自动化评估智能体在13款Android应用中的漏洞发现能力与实际利用。

    该研究提出了基于可执行安全属性探针的自动化评估基准 MobileCyBench,用于衡量 AI 智能体在移动应用及后端环境下的漏洞挖掘与利用生成能力。

    完整解读
  2. 评测与基准arXiv:2606.14295 ·

    AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准

    提出AgentCyberRange,评测智能体自主实施网络攻击的能力

    测试
    GPT-5.5、Claude-Opus-4.7、GLM-5.1 等 7 个应用层
    摘要构建开放多靶场评测基础设施AGENTCYBERRANGE,测定前沿AI网络攻击能力并揭示其端到端规划短板。
    • 核心定位与解决问题:AGENTCYBERRANGE是用于度量前沿AI在多主机靶场中自主网络攻击能力的开放评测基准。 研究旨在解决现有基准多局限于单点漏洞复现或CTF任务、难以反映从暴露面探测到多主机横向移动端到端攻击链条的问题。
    • 评测设计与工具链:基准包含集成110个漏洞的WebExploitBench与涵盖8个靶场156台内网主机的PostExploitBench,配合CAGE工具链实现跨CLI智能体统一接口、自动化靶场编排与基于运行时金丝雀和主机标记的双重证据验证。
    • 主评测基准表现:在无提示的Level-0设定下,GPT-5.5取得最高成功率,在Web利用与后渗透任务中的Pass@3 (Avg.)分别为16.06%和31.71%,在Pass@3 (Max)下成功攻破31个Web漏洞与43.90%的后渗透任务节点(Table 4、Table 5)。
    • 知识提示带来的增益:提供具体脆弱URL(Level-1)使GPT-5.5在Web利用的Pass@3 (Avg.)提升至32.12%,而提供弱点详情与CVE编号(Level-2)使后渗透成功率进一步提升至46.34%(Table 8、Table 9)。
    • 实战能力与攻击缺陷:评测中观察到智能体能自发发现ComfyUI的未公开任意文件写入0-day漏洞,并能在防病毒软件查杀Webshell后变异载荷;但智能体同时表现出运行波动大、深层交互检出率低(深度6仅11%)以及在复杂网络中易反复触发蜜罐的缺陷。
    • 作者结论与防御启示:作者指出,当前前沿AI虽尚不具备稳定的端到端完全攻陷能力,但已展现出非平凡的实际威胁潜力;模型发布前安全评估需纳入全链条网络靶场评测,且防御方应将智能体自动化渗透纳入防御规划考量。
    完整解读
已经到底了