研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
- arXiv
- 2609.11757
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
另有 608 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 STAR-Guard 双层防御,缓解长程智能体跨轮遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ActionGuard,在执行前拦截被投毒技能诱发的未授权工具调用
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 AgentFlow,用带标签的流与路径策略约束智能体数据流
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 FlowSeal,在工具边界用信息流控制阻断 Agent 隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出 CaMeLoT,在执行前用 CTL 静态验证 Agent 计划
CaMeLoT 是 CaMeL 的神经符号扩展:在工具调用之前,用模型检验判断受限 Python 计划是否满足时序安全策略和从提示词抽出的任务性质。
提出可安装护栏技能 SkillSonar,在运行时分流技能增强 Agent 的敏感动作
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness