跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 5 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  2. 防御arXiv:2610.06966 ·

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    提出APEX,在执行边界以授权契约拦截智能体间接提示注入

    测试
    DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个应用层
    场景
    AI Agent
    摘要APEX在执行边界基于预编译授权契约实施证据门控与欺骗探针,在多基准上达成近零ASR。

    APEX 针对集成 Tools、MCP 与 Skills 的 LLM 智能体面临的间接提示注入威胁,提出将防御收敛至动作与输出最终交付的执行边界。

    完整解读
  3. 防御arXiv:2605.17380 ·

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    提出企业级智能体检测系统ADR,检测提示注入与恶意MCP

    测试
    GPT-4o、Claude Sonnet 4、Llama Guard 3-8B 等 4 个应用层
    摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
    • 定位与目标:论文针对企业 MCP 智能体面临的未授权访问、数据外传等威胁,提出集成了端点遥测、分级在线检测与离线进化红队的防护系统 ADR。
    • 核心方法:通过端点 Sensor 解析本地缓存重建“提示词-思考-工具调用-环境”的完整因果链;在线采用轻量 LLM 进行 Tier 1 初筛并由 Tier 2 推理智能体结合源码与策略 MCP 进行深度调查;离线由 Explorer 进行进化式红队生成威胁情报并闭环反哺。
    • 主要实验结果:在包含 133 个 MCP 服务器的 ADR-Bench 上,ADR 实现 0 误报、0.667 召回率和 0.800 F1 值(基线 F1 仅 0.178–0.366);在 AgentDojo 上检出全部 38 个注入攻击,F1 达 0.962;单任务成本为 $0.024。
    • 生产落地验证:在 Uber 逾 7,200 台企业终端上部署超过 10 个月,并利用预执行 Hooks 拦截 206 处凭据外传风险(97.2% 精确率)。
    • 作者结论与启示:作者认为端点因果链遥测与分级上下文推理是应对智能体语义攻击的关键,并计划进一步探索网关层实时防护与多智能体协议适配。
    完整解读
  4. 防御arXiv:2609.12001 ·

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    提出OATS,用确定性解析器在运行时治理技能动作

    测试
    Claude Sonnet 5、GPT-5.5、gpt-5-mini 等 4 个应用层
    摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。
    • 定位与核心问题:本研究针对AI智能体技能生态中“发布时恶意检测”无法解决“具体机器上运行时权限许可”的问题,论证了动作级运行时控制的必要性并设计了轻量级防御系统。
    • 方法架构:作者设计了OATS运行时控制门,核心包含一个67.6 ms端到端延迟的确定性解析器(将shell命令映射到33个后果类,对无匹配项兜底拦截,决策路径无模型),一个基于(资源,后果类)二元组的分车道信任账本(13个高危类永不晋升),以及基于零失误二项分布反演的操作员风险容忍度晋升阈值模型。
    • 关键发现一:良性与许可的正交性:在ClawHub的66,192个技能中,29,257个被所有扫描器和法官评为clean的技能里,有705个技能(来自135家独立发布商)包含CIS Control 2.7等规范禁止的未授权或远程执行指令,人工审计显示其精确率为92.0%且无恶意意图标记。
    • 关键发现二:静态审查与动态执行脱节:在Claude Sonnet 5实机运行的39个clean技能中,仅1.4%的执行命令与文档字面完全一致,34.7%的命令后果类别从未在文档代码块中出现;在53个包含违规指令的clean技能中,智能体在23个技能里实际发起了违规操作,OATS对这23次动作实现了100%拦截或挂起。
    • 关键发现三:单命令防御的边界:在语义保持重写对抗基准上,解析器对包装与链式调用的识别率为100%,但在跨命令拆解、引号混淆等手段下整体宏平均解析率仅为52%,显示出无状态单命令匹配的局限。
    • 作者结论与启示:作者认为发布前制品扫描与运行时动作控制属于正交互补层,分别回答“制品是否恶意”与“操作是否许可”,任何一层均无法单独解决智能体安全问题;应将注册表扫描结果作为运行时账本的输入而非竞争替代品。
    完整解读
  5. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
已经到底了