研究者提出 PoisonedEvolution 轨迹投毒攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
- arXiv
- 2608.05563
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、MiniMax-M2.5、DeepSeek-V3.2 等 7 个
摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
另有 38 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出利用检查点回滚破坏智能体执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
提出 BPI 选点算法,增强去中心化联邦学习中的模型与数据投毒
作者把 DFL 中“破坏哪 m 个节点”写成攻击者在固定预算下的优化问题,并用 BPI 近似有限轮内诚实节点受到的拜占庭暴露。
提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。