跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 11 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    kimi-k3、gemini-2.5-flash-lite、gemini-3.1-flash-lite 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  2. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    Kimi-K2.5、GPT-4o、GPT-4o-mini 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  3. 攻击arXiv:2609.39065 ·

    TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞

    提出TrustProbe,挖掘技能内容流向特权操作的信任链漏洞

    测试
    Kimi Code CLI、deepseek-v4-flash、Qwen Code 等 5 个应用层
    摘要论文研究 skill 智能体的非安全信任链问题,提出 TrustProbe 工具并在 11 个开源智能体上验证了 104 个污点漏洞。
    • 论文定位:本研究系统探讨了基于 SKILL.md 的 LLM 智能体中存在的非安全信任链问题,即第三方不可信 skill 内容可跨越信任边界并滥用用户委托权限。
    • 核心问题:现存智能体框架自动将已安装 skill 注入执行上下文,但在从 skill 输入到敏感系统调用的传播路径上普遍缺乏内容过滤、来源跟踪与有效的执行层审批校验。
    • 方法要点:提出 TrustProbe 框架,通过静态提取 1,566 条 source-to-sink 路径构建种子,结合语义评分与调用图距离反馈指导灰盒模糊测试,并利用金丝雀标记与双重 bug oracle 验证真实危害。
    • 最重要的定量结果:在 11 个主流开源智能体上发现并证实了 104 个污点漏洞,ASR 达 100%;直接提示词重放仅能复现 31.7% 的漏洞;在 8 个开启最严格非交互审批的智能体中仍有 34.8%(31/89)的漏洞可被利用;对 633 个真实 skill 的测试中有 25.1% 触发漏洞路径,经微调有 15 个转化为完整攻击。
    • 作者结论与启示:作者认为,必须将第三方 skill 内容视为智能体执行安全边界的一部分,未来框架需在底层引入全链路来源标记、安装期能力声明,并在共享执行点实施细粒度的路径与参数级控制。
    完整解读
  4. 攻击arXiv:2609.26761 ·

    A2M:针对 MCP 生态的两阶段 Agent 劫持框架

    提出两阶段框架A2M,优化MCP工具元数据与返回载荷以劫持智能体

    测试
    Kimi-K2-0905、GLM-4.6、Qwen3-Max 等 5 个应用层
    场景
    AI Agent
    摘要A2M 揭示了 MCP 智能体语义供应链风险,通过两阶段优化实现高调用率与推理劫持,且工具调用迁移性强于攻击成功率。

    论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。

    • 问题背景:MCP 智能体自主从第三方服务匹配工具并信任执行返回,带来了语义元数据与输出载荷双重受控的供应链安全隐患,而现有攻击未能有效串联工具选择与调用后操纵。
    • 方法核心:A2M 将攻击解耦为吸引与操纵两阶段;前期运用五类说服策略迭代工具名称与描述,筛选高调用率精英元数据;后期依托分析器-优化器架构,根据执行轨迹的结构化诊断反馈定向精炼返回载荷。
    • 直接攻击结果:在 LiveMCPBench 上以 GLM-4.6 为目标模型,A2M 的平均恶意工具调用率达到 93.6%,C-DoS 加权 token 成本扩大至良性基线的 32.4 倍,IE、EIC 和 RD 的攻击成功率分别达到 65.9%、64.3% 和 92.9%(Table 1)。
    • 迁移攻击结果:将 GLM-4.6 上优化的工具直接迁移至 Qwen3-Max、DeepSeek-V3.1、Kimi-K2-0905 和 GPT-5 四个模型,平均调用率为 63.6%,C-DoS 平均成本为 2.7 倍,三个场景平均攻击成功率为 24.5%(Table 1)。
    • 高调用与成功断层:实验显示工具调用并不等同于攻击成功,如 GPT-5 在 64.9% 至 76.3% 的调用率下 IE 和 EIC 的成功率均为 0.0%(Table 1);未成功攻击中载荷被忽略为主要失效原因(Table 8)。
    • 防御与生态启示:评估显示困惑度检测与元数据释义难以完全阻断攻击,信息流控制虽能降低攻击成功率但仍存残余风险;作者呼吁 MCP 生态应建立更为严格的工具准入审查与运行时隔离机制。
    完整解读
  5. 攻击arXiv:2610.01564 ·

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    提出APEX,用跨技能进度记录夹带虚假授权劫持智能体

    测试
    Kimi K2.6、Claude Sonnet 5、DeepSeek V4 Flash 等 6 个应用层
    摘要APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。

    完整解读
  6. 攻击arXiv:2609.35576 ·

    研究提出跨 LLM 助手的记忆跳跃攻击,单个被投毒文件可传播至 60–100% 的助手

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    测试
    Kimi-K2.6、GPT-5.6 Luna、GPT-OSS-120B 等 6 个应用层
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    完整解读
  7. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念

    测试
    Kimi-K2.6、Minimax-M2.7、Deepseek-V4-Pro 等 5 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  8. 攻击arXiv:2609.03884 ·

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令

    测试
    Kimi-K2.6、Claude Sonnet 4.6、DeepSeek-V4-Pro 等 6 个应用层
    摘要论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
    完整解读
  9. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    Kimi-k3-104b、DeepSeek、GPT-4o 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  10. 攻击arXiv:2609.30383 ·

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    测试
    Kimi K2.5、GPT-5.4、GPT-5.4 Mini 等 10 个应用层
    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
    • 研究定位:该研究聚焦基于技能的大语言模型智能体生态,形式化并实证评估了将攻击目标分散于多个技能中的技能级联攻击威胁。
    • 核心问题:现代智能体通过共享上下文窗口跨技能传递数据,现有安全防御均基于单技能审查假设,无法发现单个技能看似正常但多技能协同产生危害的安全风险。
    • 方法架构:作者设计了由场景发现、攻击生成、隔离扫描、测试构造和沙箱裁决等 5 个智能体构成的闭环红队框架 SKILLCASCADE,构建并开源了包含 213 个测试用例的 SKILLCASCADE-BENCH 基准。
    • 关键实验结果:在 OpenClaw、Claude Code 与 Codex 配合 8 种骨干模型的 24 种配置下,级联攻击平均 ASR 达到 89.4%(Table 2);面对 5 款单技能扫描器,修改后技能的隐蔽率保持在 86.6% 以上(Table 3);面对 4 种运行时防御框架,平均逃逸率达 88.5%(Table 5);撤销三技能级联中任一修改,残余 ASR 降至 13–18%(Figure 4a)。
    • 作者结论与启示:作者认为组件级别的良性并不等同于系统整体的安全,现有多技能智能体系统在跨技能语义交互层面缺乏有效防护,呼吁安全研究从孤立的单技能审查转向跨技能交互分析与组合安全推理。
    完整解读
  11. 评测与基准arXiv:2609.35912 ·

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    构建多模态技能图像攻击基准MMSkillRisk并设计NCVA

    测试
    Kimi-K2.6、Kimi-K3、GPT-5.6-sol 等 6 个应用层
    摘要论文提出MMSkillRisk基准与NCVA攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
    1. 研究定位与核心问题:本研究针对多模态智能体技能中图像引导可能成为攻击跳板的安全风险,构建了首个可执行的端到端评测基准 MMSkillRisk,系统探究智能体在依赖视觉参考完成任务时能否防御图像潜藏的未授权指令。
    2. 攻击设计与基准构建:作者提出原生上下文视觉攻击(NCVA),将未授权操作伪装成教学图中的原生标注、弹窗或标签,并通过文本提供中立位置引导;基于 28 个多模态技能构建了包含 5 类攻击目标、36 个受污染变体及 108 个用例的评测集,在 Docker 沙箱中通过多模态 LLM 独立评估攻击与任务完成度。
    3. 图像载荷攻击的高有效性:在评估的 9 种模型与框架配置中,NCVA 均诱发了未授权操作,其汇聚 ASR 达到 43.1%,比对应文本匹配基线高出 16.4 个百分点;其中 Codex 搭配 GPT-5.6-sol 的 ASR 达到 81.5%,而 Claude Code 搭配 Claude Opus 4.6 表现出最低的 ASR(12.0%)。
    4. 攻击与良性任务高度共存:评测显示汇聚任务兼容攻击成功率(TC-ASR)达到 36.5%,在 Codex 搭配 GPT-5.6-sol 配置下更是高达 72.2%,作者指出这反映出智能体能够在顺利完成用户合法需求的同时提交危险操作,良性任务完成无法作为安全评判凭据。
    5. 行为转化链路与载体互补性:轨迹分析表明智能体对视觉材料的访问率接近 100%,识别载荷后的尝试操作几乎全部转化为攻击成功;消融实验显示仅保留文本引导时 ASR 归零,仅保留图像载荷时 ASR 降至 1.9%–7.4%,作者称消融结果反映出图像提供语义与文本提供流程权威性的协同机制。
    6. 现有防御盲区与研究启示:评测中 5 款主流技能扫描器对恶意包的检出率最高仅 11.1%,难以识别图像层面的未授权指令;作者认为必须针对多模态技能开发运行时防御机制,不能单纯依赖静态文本检测或任务完成状态来保障智能体安全。
    完整解读
已经到底了