SkillPoison:用成功经验投毒自进化 Agent 的技能形成
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
另有 48 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出 TrustProbe,挖掘技能内容流向特权操作的信任链漏洞
完整解读提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
完整解读提出 APEX,用跨技能进度记录夹带虚假授权劫持智能体
完整解读提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
完整解读系统分析智能体支付协议 AP2,揭示合法签名无法阻止前置上下文操纵
完整解读提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出 HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令
完整解读提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型