跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 21 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    claude-opus-5、claude-sonnet-4.6、gemini-2.5-flash-lite 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  2. 攻击arXiv:2605.12673 ·

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    提出BENCHJACK,自动审计智能体基准的奖励作弊缺陷

    测试
    Claude Code、OpenAI Codex应用层
    摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。

    完整解读
  3. 攻击arXiv:2610.04195 ·

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    评估多租户智能体共享向量记忆的跨用户泄露与主动桥接

    测试
    Claude Sonnet 4.5、Gemini 2.5 Flash、all-MiniLM-L6-v2 等 5 个应用层
    场景
    AI Agent
    摘要论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。
    • 论文定位:论文研究企业多租户 AI 智能体共享向量记忆库时,由于嵌入空间语义接近而导致的跨用户记忆非对抗性泄漏与主动利用风险。
    • 要解决的问题:现有智能体记忆系统通常将用户数据混存在同一向量库中并通过软元数据过滤,作者指出这打破了多租户物理隔离,使得普通余弦相似度检索便可将他人的隐私记忆注入当前用户会话。
    • 方法核心:形式化跨用户可采纳性失效,构建覆盖 4 级组织距离(T0–T3)与 4 种敏感业务场景的基准集,对比被动泄漏与基于常识角色构造的主动桥接攻击,并评估多层缓解机制。
    • 核心实验结果:
      1. 在 MiniLM-L6-v2 池化检索下,同团队 T0 被动泄漏率为 70% [40%, 89%],同部门 T1 和跨部门 T2 达 90% [60%, 98%],而跨公司 T3 降至 10% [2%, 40%](Table 3)。
      2. 主动构造记忆在 MiniLM 下实现 90–100% 的 top-k 命中率,平均检索分数比有机基线提高 +0.416 至 +0.511(Table 2);在薪酬场景下仅需领域常识即达 90% 命中率,逼近逐字抄袭上限的 100%(Table 10)。
      3. 端到端检索生成导致 Gemini 2.5 Flash 回答污染度升至 5.00/5(满分 5 分,干净基准为 1.00),Claude Sonnet 4.5 达 4.67/5,且受污染回答被判定为同等或更有用(Table 5)。
      4. 后检索硬所有权门控(M3)将攻击命中率降至 0% 并将两款模型的回答污染度完全恢复至 1.00/5(Table 7、Table 8),平均检索延迟开销仅增加约 1.4 ms(Table 14)。
    • 作者结论与启示:作者认为在共享向量库中仅凭语义相似度无法界定数据访问权限,当共享范围扩大至恶意成员时元数据过滤亦会失效;系统设计者必须在向量存储、嵌入及检索后实施分层防御,并联合评估检索架构与下游模型。
    完整解读
  4. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude Opus 4 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  5. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    Claude Haiku 4.5、Sonnet 4.6、Opus 4.6 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  6. 攻击arXiv:2610.01564 ·

    APEX 用跨技能链劫持 LLM Agent,GPT-5.4 上攻击成功率达 84.3%

    提出APEX,用跨技能进度记录夹带虚假授权劫持智能体

    测试
    Claude Sonnet 5、DeepSeek V4 Flash、GPT-5.4 等 6 个应用层
    摘要APEX通过跨技能传递虚假授权实现74.2%的动作诱导率,揭示了多技能协同的安全风险。

    论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。

    完整解读
  7. 攻击arXiv:2607.12340 ·

    研究:LLM Agent 技能名幻觉率最高达 62%,可被抢注用于供应链攻击

    提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链

    测试
    Claude Sonnet 4.6、Claude Opus 4.7、Claude Code 等 10 个应用层
    摘要研究证实智能体虚构技能名具有高发生率与可预测性,现有防御难以兼顾安全与效用,亟需注册表结构性防护。

    本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。

    完整解读
  8. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    Claude Sonnet 4.6、Claude Sonnet 4.5、GPT-5.4 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  9. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    Claude-Sonnet-4.6、Claude-Opus-4.6、GPT-5.5 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  10. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念

    测试
    Claude Code、Minimax-M2.7、Kimi-K2.6 等 5 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  11. 评测与基准arXiv:2608.00677 ·

    OpenART 提出环境演化红队框架,在 75 个 Agent 配置上实现 85.0% 攻击成功率

    提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全

    测试
    Claude-Opus-4.8、GPT-5.5、GLM-5.2 等 5 个应用层
    摘要提出OpenART竞技场与EMHA攻击,75种配置下ASR达85.0%,揭示长跨度安全漂移。
    • 核心定位与问题:针对智能体在长跨度持久环境中状态累积易诱发安全失效、而现有静态基准难以跨运行时评估的问题,提出了基于受控环境演化的智能体红队竞技场 OpenART。
    • 环境与场景构建:从超过 50 万个 Tools、MCPs 和 Skills 中构建出覆盖 50 个领域的 10,513 个长跨度可执行场景,工作流中位数达 97 次工具调用,并通过轻量级适配器映射到 15 个智能体和 8 个原生环境向量。
    • EMHA 攻击方法:在保持良性任务目标和安全契约固定的前提下,提出黑盒参考攻击策略 EMHA,通过超图路径搜索、反馈引导的软 Q 学习和质量多样性图进化协调环境状态突变。
    • 核心实验发现:跨 75 种智能体-模型配置下 EMHA 取得 85.0% 的严格 ASR;在 DeepSeek-V4-Pro 下完整 EMHA 达到 94.7% ASR,高出仅指令演化 13.1 个百分点;在复杂场景中演化优势相对指令演化扩大至 17.6 个百分点(Figure 4a)。
    • 方差分解与架构影响:目标模型和智能体系统分别解释 73.6% 和 25.2% 的 ASR 方差;在控制模型与良性能力后,智能体身份仍能额外解释 7.6% 的方差。
    • 长跨度安全漂移启示:轨迹分析表明演化状态在产生不安全动作前平均潜伏 37 步,作者认为智能体安全不能仅依赖模型瞬间响应的静态评测,必须在动态演化环境中长跨度审视状态与决策的相互作用。
    完整解读
  12. 攻击arXiv:2609.03884 ·

    HookPry:利用插件生命周期钩子更新劫持 AI Agent 框架

    提出HOOKPRY,利用插件生命周期钩子更新劫持智能体框架执行命令

    测试
    Claude Sonnet 4.6、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个应用层
    摘要论文揭示了智能体框架钩子更新的供应链攻击面,提出了 HOOKPRY 框架并在测试中取得 77.0% 的成功率。
    • 论文定位:该研究揭示了现代 AI 智能体框架在插件生命周期钩子更新路径上的信任失效,提出了首个跨框架自动化的生命周期钩子供应链攻击框架 HOOKPRY。
    • 解决的问题:智能体框架将系统 Shell 命令绑定至运行时事件,且在框架底层独立派生子进程,绕过了大语言模型的推理闭环;框架在插件更新时继承既有信任,使攻击者可通过元数据和钩子配置更新静默植入并执行恶意命令。
    • 方法要点:HOOKPRY 串联三项机制:对抗清单优化(AMO)利用多意图代理目标提升良性插件检索概率;时间解耦(TD)利用良性探针定位低验证高权限的信任边界并实施条件激活;最小公共接口(LCI)提取通用能力规范并编译为目标框架的原生钩子配置。
    • 关键实验结果:
      • 在 7 个框架与 5 个后端的 1,000 次端到端测试中,HOOKPRY 微平均 E2E-ASR 达到 77.0%,在 Hermes 上达到 92.5%,在 Claude Code 上为 52.5%(Table 2)。
      • 在跨模型测试中,Codex CLI 的后端间标准差为 0.0 个百分点,Claude Code 为 2.5 个百分点,体现了事件触发后执行路径与模型的解耦特性(Figure 5)。
      • 在 50 个目标对比中,HOOKPRY 原生钩子的 E2E-ASR 为 92.0%,显著高于转换后 MCP 描述投毒的 56.0%(单侧二项检验 p = 7.09×10⁻¹²,Table 4)。
      • 在 40:40 静态测试中,Microsoft Defender 召回率为 0.0%,三款静态防御联合漏报率达到 47.5%(Table 6)。
    • 作者结论与启示:作者指出,模型层的内容安全过滤无法触及推理流之外的钩子执行;智能体安全必须将插件更新审查、钩子独立重新授权、子进程最小特权分配与运行时监控纳入全链路防护。
    完整解读
  13. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Claude Sonnet 4.5、Claude Code (Opus 4.8)、Qwen3.5-397B 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  14. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Claude-Opus-4.7、Claude-Opus-4.6、GPT-5.5 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  15. 攻击arXiv:2608.16465 ·

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示

    测试
    Claude Sonnet 4.6、GLM 5.2、DeepSeek-V4-Pro Preview 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出以可复用与持续演化技能为核心的红队框架,提升了预算受限下的攻击成功率并积累了可跨模型迁移的越狱规程。
    • 核心定位:论文提出了 JailbreakSkill,这是一个将自动化红队攻击方法表示为可复用且持续演化的智能体技能的黑盒越狱框架。
    • 解决的问题:传统红队方法往往将改写逻辑与具体工作流或提示词深度绑定,无法独立调用与修改,且历史攻击失败的经验难以转化为可复用的独立攻击能力。
    • 方法设计:将攻击能力划分为改写、失败分析与演化三类标准化技能;Stage 1 利用基于风险类别的 UCB 算法在有限查询预算内自适应调用初始技能并早停;Stage 2 聚合未解决的失败轨迹,通过失败分析技能诊断模式,驱动细化、组合或发现生成新技能,并经残差池验证后入库。
    • 关键定量结果:在 AdvBench 和 HarmBench 上,Stage 1 UCB 调度取得 72.0% 与 68.1% 的宏平均 ASR@10,平均查询次数为 4.14 与 4.63 次(Table 1, Table 2);Stage 2 演化使五类模型的宏平均 ASR 提升至 74.2% 与 67.9%,其中对 GPT-5.4 在 AdvBench 上的 ASR@30 提升至 62.5%(Table 3);演化出的部分技能在未见模型 DeepSeek-V4-Pro 上取得 40.6% 的平均 ASR(Table 4)。
    • 作者结论与启示:作者认为自动化红队应当从重复搜索孤立的对抗提示词,转向维护和积累可跨任务与跨模型复用的模块化攻击技能库。
    完整解读
  16. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    Claude 4.8 Opus、Claude Sonnet 5、DeepSeek 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  17. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Anthropic Claude Code CLI、Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  18. 攻击arXiv:2609.30383 ·

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测

    测试
    Claude Opus 4.6、Claude Sonnet 4.6、Claude Code 等 10 个应用层
    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
    • 研究定位:该研究聚焦基于技能的大语言模型智能体生态,形式化并实证评估了将攻击目标分散于多个技能中的技能级联攻击威胁。
    • 核心问题:现代智能体通过共享上下文窗口跨技能传递数据,现有安全防御均基于单技能审查假设,无法发现单个技能看似正常但多技能协同产生危害的安全风险。
    • 方法架构:作者设计了由场景发现、攻击生成、隔离扫描、测试构造和沙箱裁决等 5 个智能体构成的闭环红队框架 SKILLCASCADE,构建并开源了包含 213 个测试用例的 SKILLCASCADE-BENCH 基准。
    • 关键实验结果:在 OpenClaw、Claude Code 与 Codex 配合 8 种骨干模型的 24 种配置下,级联攻击平均 ASR 达到 89.4%(Table 2);面对 5 款单技能扫描器,修改后技能的隐蔽率保持在 86.6% 以上(Table 3);面对 4 种运行时防御框架,平均逃逸率达 88.5%(Table 5);撤销三技能级联中任一修改,残余 ASR 降至 13–18%(Figure 4a)。
    • 作者结论与启示:作者认为组件级别的良性并不等同于系统整体的安全,现有多技能智能体系统在跨技能语义交互层面缺乏有效防护,呼吁安全研究从孤立的单技能审查转向跨技能交互分析与组合安全推理。
    完整解读
  19. 攻击arXiv:2609.33910 ·

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    提出残余权限重放攻击,跨任务复用已批准授权绕过确认

    测试
    Claude-Sonnet-5、GPT-4.1、Gemini-3.1-Flash-Lite 等 9 个应用层
    摘要论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。
    • 研究定位:针对长生命周期智能体中用户批准持久化存储带来的安全隐患,论文提出了残余权限重放(Residual-Authority Replay)攻击框架。
    • 核心问题:传统权限控制存在时序盲区,用户在良性上下文中做出的单次批准被转化为长期生效的机器规则后,脱离了原有的任务背景,形成可被后续攻击无感复用的残余权限。
    • 方法设计:通过逆向分析智能体授权机制与代码实现,先推导出攻击目标所需的敏感操作权限,再利用良性交互诱导用户合法批准并持久化该权限,最后在对抗性上下文下触发目标动作并重放权限绕过确认。
    • 关键实验结果:在 508 个 AgentDojo 案例中,良性历史授权使受影响模型在 h=64 时的 ASR 达到 0.114–0.351(相比新鲜状态下的 0.000),其中 Gemini-3.1-Flash-Lite 增幅达 35.1 个百分点;在 55 个 Terminal-Bench 真实案例中,三款代码智能体的 ASR 平均增加 24.9 个百分点。
    • 细粒度与防御表现:将授权精确至具体资源时仍存在 0.012–0.039 的 ASR,而任务感知防御 Progent 将 ASR 压制在 0.009 以下,PAuth 与禁止重放策略可将 ASR 降为 0。
    • 结论与启示:作者指出持久化授权有损地编译了人类同意,单纯收紧匹配粒度无法根除授权与执行在时间上的脱节,未来的智能体授权机制需要在保留复用效率的同时对上下文环境绑定进行动态重新验证。
    完整解读
  20. 防御arXiv:2609.34518 ·

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击DART与预执行防御SAGE

    测试
    Claude Sonnet 5、GPT-5.6 Luna、GPT-5.6 Terra 等 8 个应用层
    场景
    AI Agent
    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
    • 论文定位:该研究从部分可观测状态控制视角研究基于工具调用的语言模型智能体安全,提出了状态控制形式化框架 SEAD 及相应的攻击方法 DART 与预执行防御方法 SAGE。
    • 面临的核心问题:在工具智能体中,攻击者可将危害拆解为看似良性的多步操作,危害最终体现为外部环境状态的持久改变;而各角色仅具有部分可观测性,缺乏环境状态证据导致无法区分合法准备操作与有害越界。
    • 核心方法设计:攻击方法 DART 在已执行前缀树上展开搜索,利用工具执行的真实环境反馈指导分支扩展;防御方法 SAGE 在待执行动作生效前介入,通过有限步私有只读环境查询获取状态证据,消除状态歧义后再做放行或拦截决策。
    • 关键实验结果:在 187 个恶意任务上,DART 在 4 个目标模型上的 Semantic ASR 达到 43.9%–73.3%,Hard ASR 达到 33.2%–54.7%,较对应最佳基线分别提升 18.8–35.9 和 8.1–17.9 个百分点(Table 2);在 75 任务子集的离线评测中,SAGE 取得 95.79% 的良性通过率与 34.55% 的精确闭环拦截率,综合指标 F1 达 50.78%、F2 达 72.86%(Table 3);在线防御中,SAGE 将 DART 对 GPT-5.6 Luna 的 Hard ASR 从 48.0% 降至 4.0%(Figure 3),并在未参与训练的 PostgreSQL 与 Web 任务中展现出跨领域防御能力(Table 5)。
    • 作者结论与启示:作者认为,工具调用将智能体安全转化为围绕关键状态转移的部分可观测控制问题;单纯依赖对话语义或孤立动作难以可靠判断危害,将环境状态证据与执行反馈纳入攻防闭环是提升智能体安全评估与防御能力的关键路径。
    完整解读