跳到正文
10月8日 · 周四

AI 与网络攻防 · 论文

精选论文 5 篇
  1. 评测/基准arXiv:2608.11469 · 53

    SRE-Bench:面向 Agent 逆向工程的无污染真实规模基准

    作者构建污染受控的SRE-Bench,测11个模型的智能体逆向能力:公开设置下GPT-5.6-Sol仅完全解出31.5%可评分实例。

    • 31.5%公开设置GPT-5.6-Sol完全解出比例,80/254可评分实例(Table 4)
    • 26.9%公开设置Claude-Fable-5.1完全解出比例,60/223可评分实例(Table 4)
    • 82.3%公开设置GPT-6-Astra完全解出比例,149/181可评分实例(Table 4)
    6 问速览缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。
    1. 这篇论文试图解决什么问题?

      缺少既防记忆捷径、又达到真实规模与保护强度的智能体逆向工程评测。

    2. 有哪些相关研究?

      作者把相关工作分为源码安全基准、传统RE产物评测、二进制软件工程基准和端到端智能体RE基准。

    3. 论文如何解决这个问题?

      从零编写19个程序和44种保护原语,编译成262个实例,用确定性评分器给六项任务打分。

    4. 论文做了哪些实验?

      公开与无约束两套设置评测11个模型;保护、构建因素和污染/规模消融改变分数与成本。

    5. 有什么可以进一步探索的点?

      作者指出程序数量与单程序规模仍受从零开发成本约束,更大程序是延伸方向。

    6. 总结一下论文的主要内容

      SRE-Bench用从零编写的大规模保护二进制评测智能体RE,公开设置下多数模型完全解开比例不高。

    完整解读
  2. 评测/基准arXiv:2607.18538 · 57

    CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现

    评估五款前沿模型在191个密码分析任务中的表现:Tier 1破解率为65.3%–85.7%,并发现SpoC等设计缺陷。

    • 85.7%Claude Mythos 5在Tier 1(42/49)基准下的破解成功率(Table 2)
    • 65.3%GLM-5.2在Tier 1(32/49)基准下的破解成功率(Table 2)
    • 35.7%Claude Mythos 5在Tier 2 Easy难度下的破解成功率(Table 2)
    6 问速览评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。
    1. 这篇论文试图解决什么问题?

      评估前沿模型能否自主分析并攻破真实密码原语,弥补自动化密码分析基准的空白。

    2. 有哪些相关研究?

      涵盖神经差分分析、LLM玩具解密及网络安全CTF,本文聚焦真实候选标准原语。

    3. 论文如何解决这个问题?

      构建三层级191个任务基准,依托Docker双容器博弈交互与脚本自动化重测验证。

    4. 论文做了哪些实验?

      五款模型在Tier 1达65%–86%成功率,发现SpoC等新缺陷,受制于求解器工程实现。

    5. 有什么可以进一步探索的点?

      作者指明资源限制、证明系统扩展与记忆干扰等局限,实际评测限定于特定资源与模型。

    6. 总结一下论文的主要内容

      提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。

    完整解读
  3. 评测/基准arXiv:2606.14295 · 57

    AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准

    评估六款前沿AI的靶场攻击能力,GPT-5.5在Level-0下Web利用达16.1%、后渗透达31.7%。

    • 16.06%GPT-5.5在WebExploit L0的Pass@3(Avg)
    • 28.18%GPT-5.5在WebExploit L0的Pass@3(Max)
    • 31.71%GPT-5.5在PostExploit L0的Pass@3(Avg)
    6 问速览当前网络安全基准缺乏开放可复现的多主机靶场,难以评估前沿AI端到端自主网络攻击能力。
    1. 这篇论文试图解决什么问题?

      当前网络安全基准缺乏开放可复现的多主机靶场,难以评估前沿AI端到端自主网络攻击能力。

    2. 有哪些相关研究?

      现有研究涵盖CTF基准、真实软件漏洞利用及渗透测试智能体,缺乏端到端多主机靶场评测。

    3. 论文如何解决这个问题?

      构建包含Web与后渗透双轨的AGENTCYBERRANGE靶场,并由CAGE工具链实现调度与验证。

    4. 论文做了哪些实验?

      评估六款前沿系统在双轨三级设置下的表现,GPT-5.5均领先但距完全攻陷仍有差距。

    5. 有什么可以进一步探索的点?

      作者指出当前基准未覆盖全部攻击面,后续可针对隐蔽操作与长链条规划展开改进。

    6. 总结一下论文的主要内容

      构建开放多靶场评测基础设施AGENTCYBERRANGE,测定前沿AI网络攻击能力并揭示其端到端规划短板。

    完整解读
已经到底了