SkillPoison:用成功经验投毒自进化 Agent 的技能形成
提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方LLM智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出两阶段框架A2M,优化MCP工具元数据与返回载荷以劫持智能体
论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。
提出APEX,用跨技能进度记录夹带虚假授权劫持智能体
论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。
系统分析智能体支付协议AP2,揭示合法签名无法阻止前置上下文操纵
本文针对Google智能体支付协议AP2 v0.2展开了系统性安全分析,揭示了密码学签名在智能体前置操作上下文遭到篡改时的安全局限。
提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
提出SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型
提出TrojanWorld,通过想象引导给世界模型智能体植入供应链后门