防御arXiv 2609.11757
研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
- arXiv
- 2609.11757
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- kimi-k3、gemini-2.5-flash-lite、gemini-3.1-flash-lite 等 15 个
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
另有 648 篇论文还没打上分类标签,暂不在筛选结果里。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出 Pictionary,将不可信文本渲染为图像以防御提示注入