研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
- arXiv
- 2606.04329
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 6 个
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 BenchJack 系统审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出 HARNESSSECURITY-BENCH 评测编码智能体框架的安全机制
提出利用检查点回滚破坏智能体执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 IntentCap,按任务意图与来源合成能力租约并在副作用前裁决
IntentCap 是把智能体能力绑到当前任务意图、并按上下文来源划分字段所有权的权限机制。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 ActGov,在工具执行前用确定性策略拦截间接提示注入
提出 MetaPermit,用元属性与固定策略挡住工具返回中的间接提示注入
MetaPermit 是面向工具使用 LLM 智能体的混合访问控制:LLM 描述候选调用,固定策略决定是否放行。
提出残余权限重放攻击,让长期 Agent 跨任务复用未失效授权