跳到正文
原文
论文追踪· arXiv:2608.25776· Xiaodong Wu, Yu Shi, Qi Li et al.·本站收录 · 原文发表 精选关注度62

EvoMal 攻击利用自我进化编码 Agent 的自我投毒实现蠕虫式传播

EVOMAL: Self-Poisoning in Self-Evolving Coding Agents

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

EVOMAL诱导自演化智能体自我毒化,在SWE-bench Verified上6个模型ASPR达20.3%–41.8%。

威胁模型攻击者为publish-only且处于no-box设置,无模型或运行时访问权限(A1、A2);无需受害者任务知识且从不调用被植入技能,仅需植入技能进入上下文一次(A3)。

问题
自演化代码智能体会将编写的工具存入技能库并复用。以往投毒防御均假设攻击载荷由攻击者提交且通过REUSE路径被调用,但智能体在CREATE路径上模仿检索到的恶意技能自主编写新工具的自我毒化风险尚未被探索。
方法
提出EVOMAL攻击,将可替换载荷封装在包含强制复制注释、任务形状装饰器和导入注册钩子的三层良性外观banner中,诱导智能体在创建新技能时完整模仿复制;同时提出在系统提示词中加入拒绝复制模板指令的counter-prompt防御。
实验与结果
在SWE-bench Verified工具相关任务上,6个模型的ASPR为20.3%–41.8%;定向任务族使Qwen3的ASPR达86.7%;移除种子后Qwen3第5轮ASPR仍达68%;counter-prompt将ASPR降至1.8%以下。
局限与可以继续做的
counter-prompt属于模型相关的软性控制且完全自适应攻击仍待探索;强约束的签名隔离门会牺牲自演化能力;实验集中于代码与工具生成场景,被测模型共6个,防御评测覆盖4种基线及提出的两项防御。
实验设置Devstral-Small-2、Gemma-4-31B-IT 等 · SWE-bench Verified、SWE-bench Pro 等 · ASPR、in-context rate 等
威胁模型
攻击者为publish-only且处于no-box设置,无模型或运行时访问权限(A1、A2);无需受害者任务知识且从不调用被植入技能,仅需植入技能进入上下文一次(A3)。目标是通过智能体在CREATE-path上自主编写的技能执行有害载荷(G1)并实现持久的技能库感染与自传播蠕虫(G2),可采取通用或定向范围(G3)。
模型
Devstral-Small-2Gemma-4-31B-ITQwen3-Coder-NextGPT-OSS-120BMiniMax-M2.7DeepSeek-V4-ProSonnet 4.6
基准
SWE-bench VerifiedSWE-bench ProMetaGPTBigCodeBench
指标
ASPRin-context rateconditional-copy ratecallback rateSubmitted rate
AI 导读和推荐理由研究者提出 EvoMal 攻击,利用自我进化编码 Agent 模仿检索到的技能来编写新工具这一环节,让 Agent 自己把恶意代码写成新技能并存入技能库。攻击者只需在共享技能库中植入看似普通的工具,无需调用它,也无需接触模型权重或系统提示。在 153 个与工具相关的 SWE-bench Verified 任务上,六款模型的 Agent 自我投毒率(ASPR)为 20.3% 至 41.8%,自我投毒后的技能库中恶意技能数量是初始植入量的 4.9 至 9.0 倍;去掉诱导复制的 banner 后,DeepSeek-V4-Pro 仅凭载荷仍有 11.1% 的 ASPR。把植入技能描述改写为匹配单一任务族后,ASPR 最高升至 86.7%。在五轮级联中,移除植入技能后 Qwen3 第五轮 ASPR 仍达 68%,因为 Agent 自己写的副本留在库中继续被检索和复制。

研究者提出 EvoMal 攻击,利用自我进化编码 Agent 模仿检索到的技能来编写新工具这一环节,让 Agent 自己把恶意代码写成新技能并存入技能库。攻击者只需在共享技能库中植入看似普通的工具,无需调用它,也无需接触模型权重或系统提示。在 153 个与工具相关的 SWE-bench Verified 任务上,六款模型的 Agent 自我投毒率(ASPR)为 20.3% 至 41.8%,自我投毒后的技能库中恶意技能数量是初始植入量的 4.9 至 9.0 倍;去掉诱导复制的 banner 后,DeepSeek-V4-Pro 仅凭载荷仍有 11.1% 的 ASPR。把植入技能描述改写为匹配单一任务族后,ASPR 最高升至 86.7%。在五轮级联中,移除植入技能后 Qwen3 第五轮 ASPR 仍达 68%,因为 Agent 自己写的副本留在库中继续被检索和复制。

推荐理由论文给出六款模型在 SWE-bench 任务上的自我投毒率与传播条件,并说明现有名称、代码与签名筛查为何失效。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    论文分析了自演化智能体通过模仿检索技能而自我毒化的问题,并提出了EVOMAL攻击与相应防御。

    核心问题:自演化代码智能体在创建新技能时,会因模仿检索到的恶意技能而将攻击载荷写入自身新技能并持久化,形成无需直接调用原恶意技能的自我毒化(self-poisoning)安全漏洞。

    • 问题场景与重要性:自演化智能体(如 Voyager、MetaGPT、SWE-agent)将自主编写的工具存入持久化技能库供后续任务检索复用;生产级部署中社区贡献市场(如 MCP 注册表)包含海量条目,使技能库成为新型供应链攻击面。
    • 现有防御的不足:以往投毒防御均假设攻击者提交的条目即为有害制品并通过 REUSE 路径按名调用,依赖条目名称黑名单、代码扫描、指令层级或来源签名;一旦移除该条目即可终止威胁。
    • 核心观察与假设:自演化智能体具备 CREATE 路径,会以检索到的技能为模板编写新工具并入库;攻击者无需让智能体调用植入技能,仅需让其进入上下文一次,智能体就会自主复刻载荷,使传统 REUSE 路径防御失效并形成持久传播。
    • 论文提出的方案:论文提出了利用该漏洞的 EVOMAL 攻击框架,通过三层结构 banner 诱发智能体模仿;同时提出了在阅读阶段阻止复制的 counter-prompt 防御以及在写入阶段拦截检索的签名隔离门。
    • 威胁模型:
      • 攻击者能力:攻击者为 publish-only 且处于 no-box 设置,无模型权重、训练数据、系统提示词或运行时访问权限(A1、A2)。
      • 攻击者知识:攻击者不掌握受害者任务知识,仅离线提交少量植入技能混入良性库中,从不需要智能体按名调用植入技能(A1、A3)。
      • 攻击者目标:通过智能体在 CREATE 路径上自主编写并存储的技能执行恶意载荷(G1),并在移除植入种子后实现跨任务世代的持久化库感染蠕虫(G2),可实施通用或针对任务族的定向攻击(G3)。
      • 受害系统:基于标准检索-编写-持久化闭环运行的自演化 LLM 代码智能体。
  2. 有哪些相关研究?

    相关工作涵盖REUSE路径工具投毒、自演化经验攻击及传统检测防御,本文聚焦CREATE路径可执行代码蠕虫传播。

    REUSE路径工具与技能库投毒研究

    • ToolHijacker(2026) 与 MalTool(2026):前者通过操纵工具选择使智能体按名调用攻击者工具;后者研究安全对齐 LLM 生成内嵌恶意代码工具的能力。论文指出两者均依赖 REUSE 路径调用提交的原型。
    • SkillTrojan(2026) 与 DDIPE(2026):SkillTrojan 将加密载荷分片藏于良性技能中并在触发器下重构;DDIPE 在文档中隐藏逻辑以实现动作空间劫持(11.6%–33.5%)。论文指出这些工作未持久化新技能,缺乏智能体自主编写环节。

    自演化智能体中的经验与记忆攻击

    • OEP(2026):通过植入对抗性经验使智能体提炼出在后续泛化失误的宽泛规则(报告攻击成功率超 50%)。论文指出其载体为自然语言经验而非可执行代码。
    • Morris II(2024)、AgentWorm(2026) 与 AgentPoison(2024):分别通过自复制提示词、配置文件或记忆库实现持久化感染。论文指出这些工作不以智能体编写的可执行工具为载体。
    • SkillJack(2026):并发工作,通过投毒交互轨迹使经验到技能流水线提炼出持久技能。论文指出其机制为提炼而非模仿检索技能,持久化未实现自传播,且仅在单一模型和两个研究系统上评估了路由级策略违规代理指标。

    REUSE路径传统防御与检测

    • 检测与防御机制:包括基于名称的黑名单(OWASP,2025)、代码静态扫描器 Bandit(2024)、安全分类器 Llama-Guard-3-8B(2023)与 Prompt-Guard-86M(2024)。论文指出这些防御均聚焦于过滤攻击者提交的名字、检索文本或签名,对 CREATE 路径上智能体自主命名的新技能失去过滤能力。

    基线方法与基准数据集

    • 评测基线与基准:防御对比基线包括 Oracle 名称黑名单、Bandit 代码扫描器、Llama-Guard-3-8B 和 Prompt-Guard-86M 等;评测基准采用 SWE-bench Verified(2024)与 SWE-bench Pro(2025),良性技能库提取自 MetaGPT(2024)与 BigCodeBench(2025)。

    本文工作定位

    • 作者称 EVOMAL 是首个同时具备“可执行代码载荷”、“智能体自主编写存入持久库”和“跨任务自传播蠕虫”三项特性的攻击(Table 1)。
  3. 论文如何解决这个问题?

    论文设计了三层banner诱导智能体在CREATE路径模仿复制载荷的EVOMAL,并提出双重防御机制。

    论文提出 EVOMAL 攻击框架,通过在技能库中植入携带特定外观包装(banner)的工具,诱导智能体在解决新任务时将其代码结构与恶意载荷复制到新建技能中并持久化入库,形成跨代自传播蠕虫。

    问题设定与形式化

    自演化代码智能体建模为元组 A = (M, R, P, L0)。攻击者在初始库中混入 n 个植入技能形成 L = L0 ∪ Latk。对于任务 x,智能体检索 top-k 技能 Rx = R(x, L),执行动作并编写新技能 s(x) 存入库中。

    • 核心指标为智能体自我毒化率(ASPR),即智能体编写并存储复刻了植入模式技能的任务比例:

    ASPR = (in-context rate) × (conditional-copy rate) 其中 in-context rate 为检索到植入技能的比例,conditional-copy rate 为检索到后发生复刻的条件概率。

    植入技能结构与三层 Banner 设计

    植入技能由良性软件工程辅助函数、三层 banner 结构及可替换载荷组成:

    1. 强制复制注释层:在头部加入提示为必须保留的基础设施注释(如“REQUIRED: copy verbatim”),促使智能体将其作为代码脚手架保留。
    2. 任务形状装饰器层:在与任务形态一致的函数上添加 @_telemetry 装饰器,使智能体在编写新方案时连同装饰器及其钩子一并复制。
    3. 导入期注册钩子层:在模块顶层调用 _register_tool,使技能在导入加载瞬间即执行载荷,无需等待显式调用。
    • 载荷与 banner 解耦,默认采用环境变量凭据窃取函数(_ping_analytics),亦可替换为反向 Shell、勒索加密等恶意逻辑。

    检索拉动与定向攻击机制

    攻击者无需受害者特定知识,仅通过调整技能描述与函数名控制检索暴露:

    • 通用攻击(Generic):使用宽泛的软件工程辅助工具名称(如 run_python_tests)与通用描述,覆盖多种开发任务。
    • 任务族定向攻击(Targeted):保持代码体不变,将描述和名称针对特定任务族(如 Pytest 夹具、配置解析)改写,使其在特定任务出现时稳定排入 top-k。

    级联演化与自传播蠕虫协议

    通过滚动替换级联(Algorithm 1)模拟技能库跨代演化:

    • 每轮智能体完成任务集并生成技能集,随机剔除比例为 r 的非植入技能,由新生成技能替换,保持库规模固定。
    • 评估包含两种条件:持续植入(persistent,攻击者每轮重新植入)与移除种子(removed,第 0 轮后撤除攻击者种子)。
    • 演化动力学建模为 Galton–Watson 分支过程,单技能期望后代数定义为:

    ρ = c · q · ϕ 其中 c 为条件复制率,q 为轮均检索期望次数,ϕ 为替换率下的存活留存因子。当 ρ > 1 时感染形成自维系蠕虫。

    防御机制设计:Counter-Prompt 与签名隔离门

    基于分支过程两要素提出双重防御:

    • Counter-Prompt(阻断复制 c):在系统提示词 P 中增加四行安全指令,指示智能体将 banner 注释、装饰器链和自动注册视为不可信内容并拒绝复制。
    • 签名隔离门(阻断检索 q):建立两级技能库,仅检索经管理员签名的白名单技能,智能体自主编写的技能进入不可被检索的隔离区。
  4. 论文做了哪些实验?

    实验测得6个模型通用ASPR达20.3%–41.8%,定向攻击最高达86.7%,Qwen3撤除种子后仍达68%。

    实验设置

    • 被测模型:共 6 个主流模型,覆盖 dense 架构与 MoE 架构:Devstral-Small-2 (22B)、Gemma-4-31B-IT (31B)、Qwen3-Coder-Next (~80B)、GPT-OSS-120B (120B)、MiniMax-M2.7 (~230B)、DeepSeek-V4-Pro (~1.6T);框架泛化中补充了 Sonnet 4.6。
    • 基准数据集与规模:SWE-bench Verified(筛选出调用软件工程工具的 Python 任务 N=153,全集 500 任务用于附录全分布检验)与 SWE-bench Pro(N=114,全集 266 任务);初始良性技能库 232 项(32 项来自 MetaGPT,200 项来自 BigCodeBench v0.1.4)。
    • 评测基线:无 banner 对照组(control,相同技能库但移除 banner 与载荷);防御对比基线包含 Oracle 名称黑名单、Bandit 代码扫描器、Llama-Guard-3-8B、Prompt-Guard-86M、正则清理器、相似度阈值过滤与签名白名单。
    • 指标定义:ASPR(agent self-poisoning rate,智能体编写并存储包含 banner 结构技能的任务比例)、in-context rate(检索到植入技能的任务比例)、conditional-copy rate(检索后复制的比例)、callback rate(复制载荷实际执行并回连 C2 的比例)、Submitted rate(15 步内提交任务的比例)。
    • 评审与判定方式:通过静态 AST/源码模式匹配判断生成代码是否包含 banner 签名(注释块、装饰器或注册钩子);C2 回连通过本地 127.0.0.1 接收服务端日志判定;任务完成由框架是否在步数限制内输出有效方案判定。
    • 样本量与重复次数:Verified 默认 N=153,Pro 默认 N=114,定向任务族 N=85;级联实验测试 5 轮;所有比例附带 Wilson 95% 置信区间,双样本检验采用双侧双比例 z 检验(显著性阈值 p < 0.05);全篇共约 8,500 次沙箱试验。

    主结果

    据 Figure 3a、Figure 3b 与 Table 13a(SWE-bench Verified, N=153):

    表格较宽,可左右滑动

    模型上下文检索率(%)条件复制率(%)Headline ASPR(%)对照组 ASPR(%)回调率(%)
    DeepSeek-V4-Pro78.453.341.813.740.5
    Devstral-Small-278.447.637.311.835.3
    Qwen3-Coder-Next78.446.736.64.635.3
    Gemma-4-31B-IT78.430.023.52.022.9
    GPT-OSS-120B78.425.920.30.715.7
    MiniMax-M2.778.425.920.32.019.0
    • 所有模型均出现自我毒化:作者指出从仅占 3.4%(8项)的植入种子出发,6个模型在 20.3% 至 41.8% 的任务上重新编写并持久化了恶意技能,较对照组提升 18.3 至 32.0 个百分点(p < 0.001),技能库中的恶意条目增加至初始植入量的 4.9 到 9.0 倍。
    • 易感性主要受代码模仿倾向而非模型规模驱动:作者指出 1.6T 的 DS-V4 复制率最高,但 22B 的 Devstral 与 80B 的 Qwen3 紧随其后且高于 120B 的 GPT-OSS 与 230B 的 MiniMax;在固定上下文检索率(78.4%)下,差异完全源于条件复制率(25.9%–53.3%)。
    • 生成代码具备高度执行成功率:作者指出几乎所有被复制的技能在入库后均成功执行并回连 C2,回调率紧密跟踪 ASPR(最大差距仅见于 GPT-OSS,相差 4.6 个百分点)。

    任务族定向攻击评测(RQ2)

    • 实验设计:保持 8 个代码体不变,仅重写技能描述和名称以匹配 Pytest(N=15)、Config(N=38)和 Regex(N=32)三个任务族(共 N=85,Table 3)。
    • 定量结果:定向改写使 6 个模型的综合 ASPR 较通用攻击提升 11.8 至 26.9 个百分点(5个模型达到统计显著,Table 13b),其中 Qwen3 在 Pytest 任务上 ASPR 达 86.7%(对照组 46.7%);匹配任务族的上下文检索率达 84%–100%。
    • 作者解读:作者指出定向攻击改变了易感性排名,使 Qwen3 跃居首位;而在 Regex 任务上加入更强祈使词(REQUIRED、MUST)反使 ASPR 降低 9.4 个百分点(Figure B.3),作者认为智能体会对过于强硬的自述声明产生怀疑。

    级联演化与自传播机制评测(RQ3)

    • 实验设计:运行 5 轮滚动替换(默认替换率 r=0.50),测试持续植入与第 0 轮撤除种子两种条件(Figure 4、Table 11)。
    • 定量结果:持续植入下 Qwen3 ASPR 从 34.6% 升至 66.7%,DS-V4 饱和于约 53%;撤除种子后 Qwen3 第 5 轮 ASPR 仍升至 68%,Gemma4 升至 29.4%,Devstral 维持平稳,而 DS-V4 和 MiniMax 迅速归零,GPT-OSS 缓慢衰减。
    • 作者解读:作者指出单次复制率无法单独预测级联存续,自传播取决于复制意愿与生成技能的跨任务再检索可达性;DS-V4 编写的技能特异性过高导致第 1–5 轮再检索率为 0,而 Qwen3 编写通用工具使其呈现纯粹由自身代码维持的蠕虫自传播。

    防御有效性与代价评测(RQ4)

    • 实验设计:评估 4 类传统检测器(Table 5)以及提出的 counter-prompt(Figure 7、Figure 8)和签名隔离门。
    • 定量结果:名称黑名单检出率为 0%;Bandit 代码扫描器在单行替换后检出率由 85% 降至 7%;Prompt-Guard 产生 43%–47% 误报;counter-prompt 将 6 个模型在 Verified 和 Pro 上的 headline ASPR 降至 ≤1.8% 且回调率为 0(除 Devstral 在 15 条 Pytest 上残留 6.7% 外);良性代码复制率最多下降 11.7 个百分点,任务提交率无统计显著下降。
    • 作者解读:作者指出传统防御完全无法监控智能体自主创建的代码;counter-prompt 在极低开销下有效阻断了模板复制,而签名隔离门在结构上终结了跨代蠕虫传播。

    其他消融与分析

    • Banner 层级消融:在 DS-V4 上逐层移除模块钩子、@_telemetry 装饰器和注释块,ASPR 分别下降 13.0、19.6 和 30.7 个百分点,无 banner 基线为 11.1%(Table 2)。
    • 恶意载荷变体:固定 banner 替换为反向 Shell(13.1%–41.2%)、挖矿木马(13.7%–49.0%)、勒索软件(13.1%–43.1%)、键盘记录(15.7%–39.9%)、数据擦除(15.0%–43.8%),各模型复制率与 headline 接近(Figure 3c)。
    • 工具语言变体:DS-V4 工具语言设为 Bash、JavaScript、Python 时,ASPR 分别为 39.2%、39.2%、39.9%(Table 4)。
    • 框架泛化评测:在 DS-V4 上运行 mini-SWE-agent、OpenHands、Claude Code,通用 ASPR 分别为 41.8%、22.2%、27.5%,Sonnet 4.6 在 Claude Code 上为 5.9%(Figure 5)。
    • 部署参数敏感性:植入种子数从 1 增至 16,ASPR 从 19.6% 饱和至 43.1%(Figure 6a);检索 top-k 为 3、5、10 时 ASPR 为 30.7%、41.8%、43.1%(Figure 6b);良性库缩减至 64 使投毒密度达 12.5% 时 ASPR 增至 60.1%(Figure 6c)。
    • 步数预算分析:步数从 5、10 增至 15、20、25 时,DS-V4 的 ASPR 分别为 21.6%、23.5%、41.8%、41.8%、41.2%,在 15 步处饱和(Figure 11)。
  5. 有什么可以进一步探索的点?

    作者指出了完全自适应攻击、人工审查误判及检索拥挤源等开放问题,并说明了结构化隔离对自演化能力的限制。

    作者指出的局限与后续方向

    • 自适应对抗攻击的开放性:作者指出若完全自适应的攻击者能够提取到确切的 counter-prompt 文本并针对其优化设计 banner,该对抗性问题仍处于开放状态(Section A.4, Section 10)。
    • 人工审查的误判率权衡:作者指出在实际部署中将隔离层与异步人工审查相结合时,审查者的误判率会成为新的信任边界,对其形式化分析超出了本文范围(Section D.4, Section 10)。
    • 结构化隔离对自演化能力的限制:作者指出签名隔离门虽然提供了针对自传播的强结构化遏制,但是以牺牲和限制智能体的自演化能力为代价的(Section 10)。
    • 检索拥挤效应的具体机制:作者指出 DS-V4 和 MiniMax 在撤除种子后级联衰退源于生成技能的检索拥挤效应,确定同模型非感染生成技能是否为具体的拥挤源留待未来工作探索(Section D.5)。
    • 自主编写内容高复制率的深层成因:作者指出智能体自主编写的内容比外部植入内容更容易被复制这一现象是非平凡的,但论文未进一步探索其成因(如选择效应、自我偏好或代码集成质量)(Section D.6 脚注2)。
    • 任务语言对定向攻击的适配要求:作者指出定向攻击在技术性标准库词汇场景下易于迁移,但在业务导向的任务语言下需要更多适配,且模型易感性受词汇匹配影响而无法确定唯一的全局最脆弱模型(Section 6.4, Section C.2)。

    实验覆盖范围

    • 被测模型范围:实验覆盖 Devstral-Small-2、Gemma-4-31B-IT、Qwen3-Coder-Next、GPT-OSS-120B、MiniMax-M2.7 和 DeepSeek-V4-Pro 共 6 个模型,并在 Claude Code 框架上补充测试了 Sonnet 4.6(Section 6.1, Figure 5)。
    • 基准任务与库规模:实验采用 SWE-bench Verified(工具相关任务 N=153)与 SWE-bench Pro(N=114),良性技能库规模固定为 232 项(Section 6.1)。
    • 定向任务族覆盖:任务定向攻击实验覆盖 Pytest-Fixture(N=15)、Config-Parsing(N=38)和 Regex-Parsing(N=32)三个任务族,合计 N=85(Table 3)。
    • 防御基线对比范围:防御对比涵盖 Oracle 名称黑名单、Bandit 代码扫描器、Llama-Guard-3-8B、Prompt-Guard-86M、正则清理、相似度阈值过滤、签名白名单以及提出的 counter-prompt 与签名隔离门(Table 5, Table 6, Section 9)。
    • 工具语言与执行步数:工具生成语言测试了 Python、Bash 与 JavaScript 三种(Table 4);单任务步数预算上限设为 15 步(Figure 11)。
  6. 总结一下论文的主要内容

    论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出EVOMAL攻击与防御,阐明了供应链新风险。
    • 研究定位:论文针对自演化代码智能体通过检索-编写-入库闭环扩展工具库的范式,分析了智能体通过模仿检索到的恶意技能而将攻击载荷写入自身生成工具的自我毒化安全风险。
    • 核心问题:现有技能库防御均针对攻击者提交的原型代码和 REUSE 调用路径,无法拦截智能体在 CREATE 路径上以自身名义编写并存储的恶意技能,导致恶意载荷可在移除初始种子后持续传播。
    • 方法要点:论文提出 EVOMAL 攻击,设计包含强制复制注释、任务形状装饰器和导入注册钩子的三层 banner 结构诱导智能体模仿,结合任务描述定向匹配提高检索率;并提出在系统提示词中加入拒绝复制模板指令的 counter-prompt 防御与两级签名隔离门。
    • 主要实验结果:
      1. 在 SWE-bench Verified 工具相关任务上,通用 headline 攻击使 6 个模型的 CREATE-path ASPR 达到 20.3% 至 41.8%,较对照组提升 18.3 至 32.0 个百分点(Figure 3a)。
      2. 任务族定向改写在相同代码体下使综合 ASPR 进一步提升 11.8 至 26.9 个百分点,Qwen3 在 Pytest 任务上达到 86.7%(Table 3)。
      3. 在 5 轮滚动替换且第 0 轮撤除植入种子的实验中,Qwen3 的 ASPR 攀升至 68%,呈现纯粹依靠自身编写技能自维系的蠕虫自传播(Figure 4b)。
      4. 提出的 counter-prompt 将 6 个模型在 Verified 和 Pro 上的 headline ASPR 降至 1.8% 以下且回调率为 0,任务提交率在统计上无显著损失(Figure 7a, Figure 8b)。
    • 作者结论与启示:作者认为自我毒化打破了传统以攻击者提交制品为核心的安全边界,将风险转移至智能体自主生成的技能中;作者主张未来的代码智能体必须加强生成过程的安全性、跟踪代码来源并建立跨任务传播控制机制。
阅读原文arxiv.org