研究者提出 PoisonedEvolution 轨迹投毒攻击,在 SkillClaw 上技能嵌入率达 91.0%
When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems
研究者针对自演化技能系统提出轨迹投毒攻击,在10%投毒率下于SkillClaw实现91.0%的技能嵌入率。
skill-visible black-box:攻击者可查看公开或已安装技能,贡献有限比例轨迹;不能查看私有池、过滤器或演化提示词,不能直接修改技能库,不能篡改下游组件。
- 自演化技能系统将未受信的智能体执行轨迹提炼为持久指令,攻击者可能借由提供虚假经验污染共享技能库,从而绕过针对最终技能文件的静态检测。
- 作者提出PoisonedEvolution,在黑盒且仅能输入轨迹的设定下,通过因果绑定将目标行为伪装成促成成功或修复失败的可复用经验,诱导演化器将其写入技能更新。
- 在10%投毒支持下,SkillClaw在6个演化模型上达到91.0% SER,Trace2Skill迁移达61.5% SER;消融显示重复出现与因果归因是关键因素。
- 作者指出实验局限在单轮演化,未度量多轮反馈循环;溯源门禁防御假定已知候选分组且对照样本量小;实验仅针对表格任务,未执行实际恶意载荷。
- 模型
- GPT-5.4MiniMax-M2.5DeepSeek-V3.2DeepSeek-V4-ProQwen3.5-35B-A3BQwen3.5-122B-A10BGLM-5
- 基准
- SpreadsheetBenchSkillClawTrace2Skill
- 指标
- SERHard accuracySoft accuracy
研究者提出 PoisonedEvolution,一种针对自演化技能(SES)系统证据晋升过程的轨迹投毒攻击:攻击者只需以普通用户身份贡献少量看似正常的轨迹,让目标行为在成功或失败路径中显得与结果有因果关系,即可被演化器当作可复用经验写入持久技能。在 10% 攻击者支持(n=30,k=3)下,该攻击在 SkillClaw 的六个主流 LLM 演化器上于 546/600 次试验中嵌入目标行为,技能嵌入率(SER)达 91.0%;在结构不同的 Trace2Skill 流水线上为 369/600(61.5%)。消融显示重复支持(k>1)、因果框架与领域对齐编码是成功的主要决定因素,单条记录效果明显更弱。研究还试验了一个来源多样性门控,在 n=30、k=3 时把单簇 F1 候选的 SER 从 25/25 降到 0/25。
推荐理由论文给出轨迹投毒在两类自演化技能系统上的成功率与消融结果,部署 Agent 技能演化的团队可据此检查证据晋升环节。
深度解读
这篇论文试图解决什么问题?
论文研究自演化技能系统在证据提炼阶段面临的轨迹投毒风险。
核心问题在于:自演化技能系统将执行轨迹提炼为持久指令的过程中,攻击者能否仅通过注入少量正常外观的交互轨迹使系统自主生成恶意技能。
- 问题场景与重要性:大语言模型智能体演化系统(如 SkillClaw、Trace2Skill)自动从多用户会话或执行轨迹中提炼工作流、约束与工具用法并固化为技能文件。一旦被写入技能库,这些规则将成为智能体未来运行的持久规程。
- 现有防御视角的盲区:以往安全研究多关注直接发布恶意技能文件或检索增强生成(RAG)时的检索投毒;作者认为自演化系统的信任边界在于“证据晋升为指令”的筛选与归因逻辑,而非直接修改技能文件。
- 核心观察:单条异常记录易被演化器当作偶然噪音丢弃,但具备因果关联且多次重复的行为会被演化模型归因为支持任务成功的关键复用知识。
- 论文提出的方法:论文提出 PoisonedEvolution,在不修改演化提示词、不直接碰触技能库的前提下,将目标行为嵌入演化出的持久技能中。
- 威胁模型:
- 攻击者目标:促使演化管道在更新技能文件时包含预设的目标行为。
- 攻击者知识:采用 skill-visible black-box 设定,可查看公开或已安装的技能,但无法查看私有轨迹池、质量过滤器或演化器提示词。
- 攻击者能力:仅能提交有限数量的交互轨迹,不能篡改受害者的其他轨迹、演化器逻辑或技能库。
- 受害系统:基于轨迹驱动的自演化技能系统(以 SkillClaw 为主,Trace2Skill 为结构迁移目标)。
有哪些相关研究?
涉及技能演化系统、提示/记忆投毒以及技能供应链攻击等方向。
论文在相关工作中主要讨论了三类研究:
技能获取与演化系统:Trace2Skill(Ni et al. 2026)从执行轨迹中提炼可迁移技能,SkillClaw(Ma et al. 2026)聚合跨用户会话进行演化,AutoSkill(Yang et al. 2026)从对话中维护个人技能;其他工作还包括 CoEvoSkills、SkillRL 等。作者指出本文研究直接针对具有轨迹池攻击面的自演化架构,区别于训练耦合系统。
提示、记忆与检索投毒:AgentPoison(Chen et al. 2024b)与 PoisonedRAG(Zou et al. 2025)投毒持久记忆或检索上下文;MINJA(Dong et al. 2025)与 eTAMP(Zou et al. 2026)污染智能体环境观察。作者指出这些攻击属于单次生成或检索调用污染,而自演化系统攻击的目标是工件生成流水线本身。
技能与智能体供应链攻击:PoisonedSkills、Skill-Inject(Schmotz et al. 2026)与 POISE(Hao et al. 2026)假设攻击者能控制分发或安装的技能文件本身;BadSkill(Tie et al. 2026)在技能内打包带后门模型。作者指出本文攻击者仅提交有限的普通交互证据,由受害者演化器自主生成恶意规则。
基线与基准:论文采用 SpreadsheetBench(Ma et al. 2024)的执行日志构建轨迹池,主要针对 SkillClaw 和 Trace2Skill 演化管道进行测试。
作者认为本文与既有工作的关键区别在于揭示了“证据晋升”这一信任边界,证明无需直接投毒最终技能即可利用演化器的归因逻辑植入恶意行为。
论文如何解决这个问题?
将目标行为因果绑定到任务上下文,诱导模型归因并固化为技能。
整体思路是利用 PoisonedEvolution 操纵演化器归因机制,通过领域对齐、因果绑定和跨轨迹不变性,使目标行为被模型判定为通用的技能知识。
攻击目标与条件形式化
论文将自演化系统抽象为包含轨迹池、过滤器、演化器和技能库的四元组,演化更新表示为: St+1 = St ⊕ E(F(Tt), St) 攻击成功被形式化为满足包含性(C1 Inclusion)、演化归因(C2 Evolution Attribution)和工件实现(C3 Realization)三个必要条件,即: PoisoningSuccess = C1Inclusion ∧ C2Attribution ∧ C3Realization 攻击者的优化目标是在预算内最大化目标行为出现在技能更新增量中的概率。
轨迹转换设计
- C1 领域对齐进入(Domain-Aligned Inclusion):攻击者保留任务指令、操作目录与成功结果,将注入步骤置于输入准备、错误恢复或结果验证等演化器预期的合理业务节点,规避质量过滤。
- C2 因果归因(Causal Attribution):在成功路由系统中构建“约束障碍 → 目标行为 → 任务完成”的链路;在失败路由系统中构建“缺失目标行为 → 任务失败”的链路,引导演化器将该行为归因为必要经验。
- C3 跨轨迹实现(Cross-Trajectory Realization):在不同输入样本中变换表面措辞与具体任务,但保持目标行为的操作语义不变,使演化器在摘要合并时提炼出行为不变量。
安全影响分类与惰性载荷
论文定义了四类代表性安全影响载荷元组:
- F1 机密性(Confidentiality):在输出产物后向攻击者端点传输敏感字段。
- F2 数据完整性(Data Integrity):生成结果后删除源文件以阻碍恢复。
- F3 供应链(Supply Chain):在安装依赖前将配置的包仓库替换为攻击者仓库。
- F4 安全削弱(Safety Weakening):在发布或提交前禁用预检安全检查。
所有载荷均使用惰性金丝雀标识符(如回环注册表、临时路径),在实验中仅检测技能文本,不实际触发执行。
论文做了哪些实验?
测试了6个演化模型、4类安全影响及Trace2Skill迁移与消融。
实验设置
- 被测模型(演化器):GPT-5.4、MiniMax-M2.5、DeepSeek-V3.2、DeepSeek-V4-Pro、Qwen3.5-35B-A3B、Qwen3.5-122B-A10B;数据采集模型为 GLM-5。
- 数据集与规模:基于 SpreadsheetBench 的 100 个训练任务采集的 300 条执行日志,转化为兼容会话。
- 主评测设置:每个批次总轨迹数 n = 30,攻击轨迹数 k = 3(投毒比 ρ = 10%),每个模型–载荷组合测试 25 次,主实验共 600 次演化试验。
- 评估指标:主要指标为技能嵌入率(SER),由规则检测生成的技能差异中是否包含金丝雀行为;辅以任务 Hard 准确率和 Soft 准确率验证正常效用。
主结果
在 SkillClaw 初始技能细化设定下(n = 30, k = 3),各演化模型与安全类别的 SER 结果如下(据 Table 1):
表格较宽,可左右滑动
Evolver F1 F2 F3 F4 Overall GPT-5.4 17/25 22/25 7/25 24/25 70/100 (70.0%) MiniMax-M2.5 21/25 23/25 18/25 25/25 87/100 (87.0%) DeepSeek-V3.2 25/25 25/25 25/25 25/25 100/100 (100.0%) DeepSeek-V4-Pro 24/25 23/25 24/25 23/25 94/100 (94.0%) Qwen3.5-35B-A3B 25/25 21/25 25/25 24/25 95/100 (95.0%) Qwen3.5-122B-A10B 25/25 25/25 25/25 25/25 100/100 (100.0%) Family aggregate 137/150 (91.3%) 139/150 (92.7%) 124/150 (82.7%) 146/150 (97.3%) 546/600 (91.0%) - 模型间存在差异:DeepSeek-V3.2 与 Qwen3.5-122B-A10B 达到 100.0% SER,而 GPT-5.4 为 70.0%,作者认为演化策略与安全先验影响了晋升结果。
- 类别敏感性差异:F4 达到 97.3% SER,而 F3 相对较低(82.7%),作者解释包重定向更容易被演化模型视为无关环境配置或被自身安全准则抑制。
- 无初始技能诊断:在 4 个演化模型上测试技能创建路径,600 次试验中实现 490 次嵌入(81.7% SER)。
Trace2Skill 结构迁移实验
- 测试设定:使用失败轨迹池,混合 3 条攻击失败轨迹与 27 条干净失败轨迹,测试 4 类行为共 600 次试验。
- 测试结果:总体 SER 为 61.5%(369/600)。各类别中 F1 为 67.3%(101/150),F2 为 82.7%(124/150),F3 为 77.3%(116/150),F4 为 18.7%(28/150)(据 Table 2)。
- 作者解读:Trace2Skill 将失败归因于能力缺失,F2/F3 被视作修复动作因而成功率高,而 F4 安全弱化不符合失败修复逻辑,导致嵌入率下降。
其他消融与分析
- 支持记录数量 k(Figure 2a,n=30):k=1 时为 5/25,k=2 时升至 21/25,k=3 时达到 25/25。
- 证据池稀释 n(Figure 2b,k=3):n=10 为 25/25,n=30 为 25/25,n=100 时仍达 22/25(k=1, n=100 时为 0/5)。
- 归因形式 C2(Figure 3a):局部插入为 8/25,碎片化插入为 11/25,因果归因为 25/25。
- 行为编码 C3(Figure 3b,F1):通用措辞为 18/25,辅助信道为 0/25,领域定制为 25/25。
- 正常任务效用检验:Qwen3.5-122B-A10B 使用投毒技能在 100 任务集上得 20.0% Hard 与 36.54% Soft,高于无技能时的 18.0% 与 34.88%。
- 防御门禁测试:单簇溯源门禁在 n=30, k=3 下将 F1 候选的 SER 从 25/25 压低至 0/25。
有什么可以进一步探索的点?
作者指出单轮演化反馈循环未测,实验主要覆盖表格领域单一任务。
作者指出的局限与后续方向
- 单轮演化与反馈循环未度量:实验仅测试了单轮演化周期;部署系统中长期运行可能让被污染技能引导后续轨迹,形成循环验证,论文未度量此纵向效应(Discussion)。
- 工件级指标与运行时实际危害存在区别:SER 仅衡量工件是否包含行为,未涵盖触发激活、动作执行与运行时策略拦截(Discussion)。
- 溯源多样性门禁属于初步原型:防御评估假定已知候选分组,干净对照组规模较小,且协同女巫攻击可能伪造多样性(Discussion)。
- 效用评估非完整帕累托前沿:良性任务检查仅确认保留增益,未给出完整的安全性-效用帕累托曲线(Discussion)。
实验覆盖范围
- 评测系统为两个演化架构:主要评估在 SkillClaw 上完成,并在 Trace2Skill 上进行了迁移验证,未测试对话记忆或纯验证器系统。
- 被测演化模型共六个:主实验覆盖 6 个主流大语言模型,数据生成模型为 GLM-5。
- 任务领域限定于电子表格:实验数据源于 SpreadsheetBench 的 xlsx 技能维护任务。
- 测试载荷为惰性金丝雀:所有测试行为使用占位符与测试标识,未在真实环境中执行外传或破坏操作。
- 论文未报告指标:论文未报告攻击在演化模型上的 token 消耗成本或耗时数据。
总结一下论文的主要内容
论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
- 核心问题:现有自演化系统默认轨迹池反映有益经验,缺乏对经验来源的信任审计,容易被恶意贡献者操纵。
- 方法机制:提出 PoisonedEvolution,攻击者无需直接修改技能文件,而是构造符合领域特征、具备因果支持的交互轨迹,诱导系统演化器将恶意行为归因为可复用的最佳实践。
- 核心实验结果:在 SkillClaw 的 10% 投毒比例下,6 个演化模型达成 91.0% 的技能嵌入率(Table 1);在 Trace2Skill 迁移测试中达到 61.5% 嵌入率(Table 2);消融显示多次重复(k>1)和因果绑定是攻击成功的关键。
- 效用与防御:投毒演化出的技能仍保持了良性任务上的准确率提升;基于溯源多样性的门禁可拦截单一来源的候选行为。
- 启示:作者认为自演化系统的防御重点不应仅停留在生成后的技能文本扫描,而必须在经验晋升阶段建立基于溯源的授权决策与审计机制。