研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
- arXiv
- 2609.11757
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
另有 39 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 PACE,用签名策略记录拦住 DeFi 智能体违规交易
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
提出基准 TRACE SAFE-BENCH 评测多步工具调用轨迹护栏
TRACE SAFE-BENCH 用固定的多步工具轨迹评护栏,问的是不安全动作到达环境之前能否被拦住,而不是智能体自己会不会拒绝。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
提出 MCPS EC,仅凭 MCP 工具元数据检测间接提示注入
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露