跳到正文
原文
论文追踪· arXiv:2606.14517· Yuguang Zhou, Xunguang Wang, Pingchuan Ma, Zhantong Xue, Zhaoyu Wang, Shuai Wang·本站收录 · 原文发表 精选关注度58

研究者披露针对 LLM Agent 护栏的推理扩展型拒绝服务攻击

From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者利用护栏的模式遵循特性诱发推理扩展 DoS,在 DeepSeek-V3.2 上取得最高 63.4× token 膨胀(Table 1)。

威胁模型黑盒威胁模型:攻击者仅向智能体正常抓取的第三方环境内容注入文本,无内部权重、提示词或状态访问权限,目标是通过膨胀护栏推理耗尽计算资源。

问题
基于大语言模型的智能体护栏为防御提示注入和越狱引入了深层推理开销,导致护栏成为每步操作关键路径上的计算瓶颈;攻击者可通过环境内容注入诱发护栏产生超长推理循环,造成拒绝服务并拖垮系统可用性。
方法
提出利用护栏自身的模式遵循(schema-following)特性诱发推理扩展 DoS。通过集束搜索优化框架构建拟合护栏分析结构的自然语言载荷,包含大模型建议器(LLM-as-Proposer)与机制感知突变(Mechanism-Aware)两种实现,并在端到端场景针对代码、多智能体、网页与桌面系统进行场景化适配。
实验与结果
在独立评估中,以 TS-Guard-8B 优化的载荷无缝迁移至 8 个主流模型,达成 13–63× 的 token 膨胀,显著高于既有 DoS 基线(仅 1.11–1.20×)。在 4 个真实智能体部署中,网页端、多智能体端最高测得 131× 与 148.2× 延迟膨胀,并在多智能体共享护栏中造成 23.3% 吞吐量下降。
局限与可以继续做的
作者在 Section 8 指出预推理过滤器和黑名单无法防范高自然语言流畅度载荷;硬性 token 截断在 fail-open 下导致安全绕过、在 fail-closed 下直接达成 DoS;更强推理模型因指令遵循能力更强反而产生更长循环。实验覆盖 8 个独立护栏模型、3 个基准以及 4 个端到端智能体系统。论文未报告防御自适应攻击、带有人工介入的混合审核环境、跨语种测试。
实验设置TS-Guard-8B、Qwen3.5-9B 等 · AgentDojo、ASB 等 · Attacked thinking length、Extension ratio 等
被测模型
TS-Guard-8BQwen3.5-9BDeepSeek-V3.2GLM-4.7Kimi-K2.5Claude-3.5-HaikuGPT-4o-miniGemini-3-FlashQwen3.5-FlashDeepSeek-R1-0528Qwen2.5-7B
基准
AgentDojoASBAgentHarmSWE-benchWebArenaOSWorld
指标
Attacked thinking lengthExtension ratioLatency amplificationToken amplificationRelative throughput
AI 导读和推荐理由香港科技大学等机构的研究者提出推理扩展型拒绝服务攻击,利用 LLM 护栏的模式遵循特性,用注入内容诱导其陷入无界推理循环。攻击通过束搜索优化框架生成自然语言载荷,在单一开源代理模型 TS-Guard-8B 上优化后可迁移至 Claude、GPT、Gemini、DeepSeek、Qwen 等 8 个模型,实现 13–63 倍 token 放大,而六种既有 DoS 方法仅 1.1–1.2 倍。在 OpenHands、LangGraph、BrowserGym、OSWorld 四类真实部署中,峰值延迟放大分别达 36.3 倍、148 倍、131 倍和 18 倍,LangGraph 还因共享护栏队头阻塞出现吞吐下降。研究者评估了预推理过滤、硬 token 预算等缓解措施,发现均无法直接解决该漏洞。

香港科技大学等机构的研究者提出推理扩展型拒绝服务攻击,利用 LLM 护栏的模式遵循特性,用注入内容诱导其陷入无界推理循环。攻击通过束搜索优化框架生成自然语言载荷,在单一开源代理模型 TS-Guard-8B 上优化后可迁移至 Claude、GPT、Gemini、DeepSeek、Qwen 等 8 个模型,实现 13–63 倍 token 放大,而六种既有 DoS 方法仅 1.1–1.2 倍。在 OpenHands、LangGraph、BrowserGym、OSWorld 四类真实部署中,峰值延迟放大分别达 36.3 倍、148 倍、131 倍和 18 倍,LangGraph 还因共享护栏队头阻塞出现吞吐下降。研究者评估了预推理过滤、硬 token 预算等缓解措施,发现均无法直接解决该漏洞。

推荐理由论文揭示 LLM 护栏的推理扩展型 DoS 漏洞,并给出跨 8 个模型与四类 Agent 部署的实测放大数据。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    揭示利用智能体推理护栏的模式遵循特性诱发推理扩展 DoS,将安全护盾反向转化为资源耗尽瓶颈。

    针对智能体护栏的推理扩展拒绝服务(reasoning-extension DoS),揭示其结构遵循特性如何被利用以耗尽计算资源并瘫痪系统可用性。

    • 问题场景与重要性:大语言模型(LLM)驱动的自主智能体(涵盖网页、桌面、代码及多智能体系统)广泛执行真实世界交互,使得运行时安全防护层必不可少。为应对复杂的间接提示注入与越狱,业界普遍在智能体每步动作的关键路径上部署基于 LLM 的推理护栏(LLM-based guardrail),但这一部署引入了严苛的可用性依赖。
    • 现有防御与攻击的不足:规则过滤和判别分类器无法处理开放式复杂上下文;而既有的 LLM DoS 攻击(如任务脱轨谜题、对抗字符、工具链扩展)大多试图转移模型任务焦点,在护栏高度受限的"安全评估"任务下被直接视为无关数据忽略,作者实测仅获 1.11–1.20× 膨胀。
    • 核心观察:护栏模型普遍具备强烈的模式遵循(schema-following)特性,即严格枚举风险类别、权衡证据并生成结构化分析。当环境中混入仿冒且扩展护栏自身分析框架的内容时,护栏会将其当作合法分析结构而忠实执行,引发注意力在模式头部自循环并陷入推理扩展。
    • 论文提出的方案:提出了基于集束搜索(beam-search)的载荷优化框架,包含基于大语言模型建议器(LLM-as-Proposer)和机制感知结构突变(Mechanism-Aware)两种实现,并针对四大真实场景提出对抗冲突、变换弹性等适配策略。
    • 威胁模型:
      • 攻击者目标:耗尽目标护栏的计算资源与服务容量,引发极高延迟或超时截断,达成智能体层面的可用性拒绝或安全绕过。
      • 攻击者知识:离线优化阶段对本地部署的开源代理护栏拥有完全白盒观测权;在线部署阶段对目标护栏为完全黑盒(black-box),不可知其权重、系统提示词、内部激活或 token 概率,仅可观测延迟和超时等外部表现。
      • 攻击者能力:仅能向智能体正常抓取或观察的第三方环境内容(如网页、代码仓库文件、对话消息)中注入自然语言文本,无主机特权、无法修改护栏配置或干预用户初始任务。
      • 受害系统:在动作执行前依赖基于 LLM 的独立或集成式推理护栏进行前置安全审查的自主智能体系统。
  2. 有哪些相关研究?

    系统梳理了提示注入、智能体护栏与既有 LLM DoS 工作,指出既有 DoS 方法在任务受限的护栏上失效。

    论文探讨了以下三组相关工作:

    提示注入与越狱攻击

    • Perez and Ribeiro (2022) 与 Greshake et al. (2023)——分别提出了直接提示注入与通过第三方环境内容(网页、文档)实施的间接提示注入。
    • Zou et al. (2023) 与 Wei et al. (2023)——前者利用基于梯度的优化寻找通用对抗后缀诱发有害输出,后者系统分类了利用竞争目标与安全泛化失配的越狱策略。

    基于大语言模型的智能体护栏

    • WebGuard (Liao et al., 2025)、ShieldAgent (Chen et al., 2025) 与 NeMo Guardrails (Rebedea et al., 2023)——分别针对网页智能体(对照可访问性树审查动作)、桌面智能体(执行定位、动作、状态三重独立验证)和多智能体系统(拦截输入输出轨道)构建安全防护。
    • LlamaFirewall (Chennabasappa et al., 2025)、ToolSafe (Mou et al., 2026)、TaskShield (Jia et al., 2025) 与 GuardAgent (Xiang et al., 2025)——提出了结合判别器与推理裁决、基于显式风险类别的结构化提示模板,以及基于知识检索生成可执行验证逻辑的护栏架构。

    大语言模型拒绝服务(DoS)攻击

    • ENGORGIO (Dong et al., 2025)、CRABS (Zhang et al., 2025)、OverThink (Kumar et al., 2026)、ReasoningBomb (Liu et al., 2026)、RECUR (Wang et al., 2026) 与 ThinkTrap (Li et al., 2026)——分别采用抑制 EOS、进化搜索、注入耗时数学/逻辑谜题诱导冗长自指推理,以及在嵌入空间优化高困惑度对抗提示词等方式制造过量输出。论文指出这些方法假定目标模型会执行脱轨任务,在受到任务严格约束的安全护栏上无法奏效,且对抗字符易被困惑度检测发现。
    • Zhou et al. (2026)——通过串联工具调用扩大智能体动作循环以消耗资源;论文指出该方法要求控制智能体工具注册表,攻击者权限显著高于单纯的环境文本注入。

    对比基线与基准

    • 基线方法:对比了 ENGORGIO、OverThink、CRABS、ReasoningBomb、RECUR 与 ThinkTrap 共 6 种既有 DoS 方案。
    • 评测基准:评估了 AgentDojo、ASB、AgentHarm、SWE-bench、WebArena 以及 OSWorld。

    与既有工作的定位区别:作者指出以往防御研究仅关注护栏是否输出正确安全判定而忽视其本身的可用性开销;本文不试图将模型从安全评估任务中引开,而是顺应并反向利用护栏自身的指令遵循与安全分析模式,使其在自身任务内部产生病态膨胀。

  3. 论文如何解决这个问题?

    通过集束搜索框架与大模型/机制感知变异,构造仿冒护栏分析结构的自然语言载荷,诱导注意力自循环。

    论文提出利用护栏自身的结构化分析模式遵循(schema-following)特性,通过集束搜索(beam-search)优化生成高自然语言流畅度的载荷,诱使护栏陷入深度推理循环。

    核心观察与机制发现

    • 注意力循环(Attention Cycling):作者发现有效载荷会改变模型的注意力模式,生成阶段的响应 token 会以高于基线 9.6 倍的注意力权重重新聚焦于模型自身输出的模式头部(schema headers),形成不断自指生成的闭环。
    • 熵坍缩(Entropy Collapse):进入循环状态后,模型的 token 预测不确定性明显降低(平均香农熵由正常生成的 0.264 bits 骤降至 0.132 bits),表明模型已脱离真实逻辑推演,转入机械化的模版填充。

    集束搜索优化框架

    优化目标为最大化在上下文分布下代理护栏 Gs 的推理输出长度: p∗ = argmaxp ∈ P 𝔼c ∼ C [|Φ(Gs(T(c[p])))|] 其中 Φ(·) 提取推理部分内容,|·| 计算字符长度。集束维护 k=5 个候选载荷,每轮变异展开 b=5 个子代,采用 SequenceMatcher 设定多样性阈值 δ=0.9 防止多样性坍缩,早停容忍轮数 P=5。

    两种框架实现形式

    • 大模型建议器(LLM-as-Proposer):采用 GPT-5.2 等大模型作为建议器。建议器接收父代载荷、护栏生成的完整思考过程,以及累积超过 100 种模式策略的策略库(Strategy Bank,按指数移动平均更新权重,选取 Top-10 策略注入提示词),迭代生成变异载荷。
    • 机制感知优化(Mechanism-Aware Optimization):摆脱大模型建议器,将载荷抽象为包含 6 个具名槽位的模板状态向量(包含类别列表 s1、枚举深度 s2、分析章节 s3、防简略子句 s4、多档位校准 s5、假设数量 s6)。通过增删类别、调整枚举层级、添加防聚合子句(如要求缺失必须从头重启)等操作符进行突变,结合注意力循环得分评分与早停熵过滤,显著降低离线搜索开销。

    真实部署场景适配

    • 代码智能体(集成式护栏):针对动作生成与安全审查并行的单体架构,采用冲突因素构造两难选择,迫使模型在执行有效操作与多重潜在合规冲突间反复权衡。
    • 多智能体系统(变换弹性优化):针对载荷经过前序智能体改写会被剥离安全元术语的问题,设计包含数值表格、章节头及实体事实的结构,并使用加权适度目标引导优化:

    ftransform = α · ∑i=1N wi · think(G(stagei(x))) 其中权重序列 w = [0.5, 1.0, 1.5, 2.0, …] 随管线深度递增,确保跨阶段存活与逆向膨胀。

  4. 论文做了哪些实验?

    涵盖 8 个模型与 4 大真实场景,实现最高 63.4× token 膨胀与 148.2× 延迟放大,显著超越既有基线。

    实验设置

    • 被测模型:开源模型包括 TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2、GLM-4.7、Kimi-K2.5;闭源模型包括 Claude-3.5-Haiku、GPT-4o-mini、Gemini-3-Flash;端到端阶段另测试了 Qwen3.5-Flash、DeepSeek-R1-0528、Qwen2.5-7B。
    • 数据集与基准:AgentDojo、ASB、AgentHarm;端到端测试覆盖 SWE-bench(20 个任务)、LangGraph 多智能体套件(5 个领域共 25 个任务)、WebArena(10 个购物任务)、OSWorld(20 个桌面场景)。
    • 基线方法:ENGORGIO、OverThink、CRABS、ReasoningBomb、RECUR、ThinkTrap。
    • 指标定义:受攻击思考长度(字符数)、扩展倍数(对比等长良性输入的比值)、适应度得分。
    • 评审与优化设置:离线优化统一以 TS-Guard-8B 为代理模型;建议器主要使用 GPT-5.2;未设额外评分分类器,直接衡量生成思考长度。

    主结果

    在 ToolSafe 模板与不同测试基准下,以 TS-Guard-8B 优化的载荷迁移测试各护栏模型(取自 Table 1):

    表格较宽,可左右滑动

    护栏模型AgentDojo (Inst. I)AgentDojo (Inst. II)ASB (Inst. I)ASB (Inst. II)AgentHarm (Inst. I)AgentHarm (Inst. II)
    TS-Guard-8B* (代理模型)42,959* / 45.2×47,736* / 50.2×45,818* / 49.6×36,851* / 39.9×47,589* / 46.5×45,235* / 44.2×
    Qwen3.5-9B482,344* / 23.1×395,562* / 19.0×521,697* / 26.3×489,350* / 24.7×437,976* / 23.0×413,220* / 21.7×
    DeepSeek-V3.280,803* / 59.2×66,335* / 48.6×77,176* / 63.4×48,082 / 39.5×52,154 / 43.8×49,181 / 41.3×
    GLM-4.738,644 / 24.0×24,838 / 15.4×32,656 / 21.0×36,855 / 23.7×35,234 / 21.2×32,076 / 19.3×
    Kimi-K2.536,066 / 25.2×18,892 / 13.2×56,117* / 33.8×49,974* / 30.1×31,615 / 21.1×28,168 / 18.8×
    Claude-3.5-Haiku61,981* / 27.7×36,921 / 16.5×54,415* / 26.3×42,622 / 20.6×49,130* / 23.6×46,424 / 22.3×
    GPT-4o-mini14,103 / 20.6×13,008 / 19.0×17,857 / 21.8×19,987 / 24.4×13,381 / 17.4×14,515 / 18.8×
    Gemini-3-Flash28,872 / 22.1×28,218 / 21.6×26,943 / 23.9×22,885 / 20.3×21,077 / 19.1×19,642 / 17.8×
    • 黑盒迁移性:作者报告仅凭开源代理模型优化的载荷即可对各大主流闭源模型实现 17–27× 扩展,最高在 DeepSeek-V3.2 上达 63.4×(带 * 标注表示触发大于 10 次重复的持续循环)。
    • 基线对比悬殊:据 Table 2,在 Claude-3.5-Haiku 上既有 DoS 基线最高仅达 1.20×(ReasoningBomb),而本文方法达 27.7×(思考长度 61,981 字符)。

    端到端场景测试

    • 代码智能体(OpenHands):README 注入取得平均 25.9×、峰值 36.3× 的 token 膨胀(Table 8),单任务安全审查耗时从 138 秒拉长至 59 分钟以上;配置文件注入亦取得 11.9× 均值。
    • 多智能体级联瘫痪(LangGraph + NeMo):智能体间消息注入达到最高 115.2× 的 token 膨胀与 148.2× 的延迟放大(单步耗时达 730.8 秒,Table 9);在主管架构下造成共享护栏头阻阻塞,使得未受污染工作节点的系统吞吐量下降 23.3%(Figure 7)。
    • 网页智能体(BrowserGym + WebGuard):通过隐藏 DOM 注入使结账任务达成 131× 延迟放大(15 步耗时 1310.8 秒);在 30 秒超时强制放行下产生 10 次超时直通,任务成功率反升至 6/10 但安全失守(Table 11)。
    • 桌面智能体(OSWorld + ShieldAgent):微调分类护栏在三重验证(定位、动作、状态)下产生乘数效应,单步生成由 504 扩展至 9,284 tokens,延迟放大 14.4×(Table 13)。

    其他消融与分析

    • 集束搜索贪婪退化(k=1)导致适应度从 59,182 降至 7,220,降幅达 88%(Table 3)。
    • 移除防简略子句导致适应度下降 83.0%,降至 5,776(Table 5)。
    • 移除 S1–S9 类别枚举导致适应度下降 74.2%,降至 8,760(Table 5)。
    • 枚举深度压减至 1 导致适应度下降 81.1%,降至 6,424(Table 5)。
    • 跨提示模板迁移(TaskShield 与 MELON)测试中各模型仍维持超过 20× 放大(Table 6)。
  5. 有什么可以进一步探索的点?

    作者指出强化学习去模式顺从与成本边界护栏是未来方向;实验覆盖了 8 个模型与 4 类系统环境。

    作者指出的局限与后续方向

    • 启发式模式防御设计(Section 8):作者指出模型指令遵循能力越强反而产生越长循环,未来研究可探索结合定向强化学习(directed RL)技术与高质量数据集,降低护栏模型对载荷中归纳性模式结构的顺从性。
    • 截断策略的双向两难(Section 8):作者指出单纯设置硬性 token 阈值无法根除风险,仅是将计算耗尽转化为安全绕过(fail-open)或可用性拒绝(fail-closed),亟需设计兼顾成本边界与推理鲁棒性的新型护栏。

    实验覆盖范围

    • 被测护栏模型:独立实验覆盖 TS-Guard-8B、Qwen3.5-9B、DeepSeek-V3.2、GLM-4.7、Kimi-K2.5、Claude-3.5-Haiku、GPT-4o-mini、Gemini-3-Flash 共 8 个模型。
    • 环境部署框架:端到端评测覆盖 OpenHands、LangGraph、BrowserGym、OSWorld 共 4 种智能体框架。
    • 防御机制评测:防御评测涵盖 DeBERTa 提示注入分类器、硬性 token 截断配额以及部署更强推理模型这 3 种缓解方案。
    • 论文未报告指标:论文未报告该攻击面对针对性自适应防御算法时的持续有效性表现;未报告跨多语言(非英语环境)下的对抗表现;未报告具备人工协同接入环境下的中断缓解效果。
  6. 总结一下论文的主要内容

    论文揭示智能体推理护栏易受模式遵循 DoS 攻击,单点污染即可诱发成百倍延迟放大并瘫痪共享系统。
    • 研究定位:针对自主智能体在执行动作前普遍依赖的大语言模型安全护栏,揭示其因推理与模式遵循特性而产生的推理扩展拒绝服务(reasoning-extension DoS)安全漏洞。
    • 核心问题:现有护栏必须全量分析动作上下文与外部环境输入,攻击者无需攻击模型本体或获取系统特权,仅需向智能体抓取的第三方数据中植入仿冒分析框架的载荷,即可诱发护栏产生病态冗长的推理分析,造成严重的计算与延迟放大。
    • 方法要点:提出基于集束搜索的对抗优化框架,分为基于大模型建议器(LLM-as-Proposer)和机制感知轻量级结构突变(Mechanism-Aware)两种形态;利用注意力自循环和低熵模式填充特性,结合针对代码、多智能体等部署环境的冲突决策与变换弹性适配策略。
    • 主要实验结果:
      • 独立测试中,以开源 TS-Guard-8B 优化的载荷零样本迁移至 8 个主流模型,达成 13–63× 的 token 膨胀(DeepSeek-V3.2 达 63.4×,Qwen3.5-9B 达 521,697 字符),而 6 种既有 DoS 基线仅获 1.11–1.20×(Table 1, Table 2)。
      • 在 OpenHands、LangGraph、BrowserGym 和 OSWorld 中,分别测得 36.3×、148.2×、131× 和 18.42× 的峰值延迟或 token 膨胀。
      • 在多智能体架构中引发共享护栏头阻阻塞,致使未受攻击的良性工作节点吞吐量下降 23.3%(Figure 7)。
    • 作者结论与启示:作者认为护栏越具备强大的指令遵循与深度推理能力,对虚假模式的执行依从性越高;预过滤检测与硬性预算截断在面临自然语言流畅载荷时暴露出安全与可用性两难,呼吁学术界与工业界构建有严格成本边界且具备推理鲁棒性的新一代安全护栏体系。
阅读原文arxiv.org