研究者提出 PoisonedEvolution 轨迹投毒攻击
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
- arXiv
- 2608.05563
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.4、MiniMax-M2.5、DeepSeek-V3.2 等 7 个
摘要论文揭示自演化技能系统的证据晋升漏洞,提出并验证轨迹投毒攻击。
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
另有 257 篇论文还没打上分类标签,暂不在筛选结果里。
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统把恶意行为固化为技能
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 EVOMAL 攻击,诱导编码 Agent 自我投毒并蠕虫式传播技能
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
提出 TrustProbe,挖掘 skill 到敏感操作的非安全信任链
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出 APEX,在跨技能进度记录中夹带虚假授权以劫持 Agent
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出技能名称抢注攻击,利用智能体虚构技能名实施供应链劫持
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 SkillSentry,用自适应蜜罐世界在安装前审计 Agent 技能
SkillSentry 是安装前的动态技能审计,用来发现超出宣称功能的能力漂移。技能一旦安装,就能使用宿主的文件、shell、凭证和网络,而有害分支可能要等特定资源才出现。作者认为,源码或一次性语义判断既不能确认分支会执行,也不能把技能造成的效果与任务或基座智能体的动作分开。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击