研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
- arXiv
- 2609.11757
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。
提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 ActGov,在工具执行前用确定性策略拦截间接提示注入
提出 MetaPermit,用元属性与固定策略挡住工具返回中的间接提示注入
MetaPermit 是面向工具使用 LLM 智能体的混合访问控制:LLM 描述候选调用,固定策略决定是否放行。
提出 Pictionary,将不可信文本渲染为图像以防御提示注入
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出 ToolFence 能力级授权,执行前编译蓝图并确定性拦截工具调用