论文:AI 在非公开漏洞上更帮攻击者还是防御者
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
- arXiv
- 2610.06584
- 发表
- 层
- 应用层
- 被测模型
- Opus 5、GPT-5.6 Sol、GPT-6 Sol 等 10 个
- 风险危险能力
摘要攻防孰强随环境、系统和弱点改变。
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
评测 coding agent 在非公开漏洞上的利用生成、修复与后续攻击
作者比较编程智能体在利用生成与漏洞修复上的自主表现,并检查修复之后还能不能被攻破。文中的 help 指自主完成任务,不是提升人类操作者。
提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次
SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出 CAVEAT 基准,评测激励失配市场中计算机使用 Agent 的购买决策退化
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 MobileCybench,用可执行探针评测 Agent 的漏洞发现能力
提出基准投毒攻击,使自修改编码 Agent 跨代写出含漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 SRE-Bench 评测智能体的真实规模二进制逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
用演化算法构造 mind virus 并测量其在多智能体中的传播
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
用 MisKnow-Agent 评测深度研究智能体是否采纳误导文档结论
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
用 CryptanalysisBench 评测大模型的端到端密码分析能力
摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。
构建真实网络靶场基准,评测 AI 的端到端自主攻击能力
摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。
提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点
SecureForge是一条只用 API 和静态分析、在推理时加固编码模型的流水线。