跳到正文
原文
论文追踪· arXiv:2608.04565· Xuebin Li, Hanqing Zhao, Siyuan Liang et al.·本站收录 · 原文发表 精选关注度58

研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

Breadcrumbing Search Agents

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

研究者针对搜索智能体提出工具中间人攻击ACH与策略演化TGSE,在SafeSearch上对Qwen3达71.4% ASR。

威胁模型受限工具中间人(constrained tool-intermediary)。

问题
现代搜索智能体具备多步检索与交叉验证能力,单次静态网页注入易被稀释或舍弃。论文研究在受限工具中间人威胁下,攻击者如何通过动态操纵观测通道实现长程目标劫持。
方法
构建包含轨迹记忆与规划器的有状态攻击运行时,提出权威链劫持(ACH)策略协同跨轮次检索与访问证据,并利用执行轨迹通过TGSE归档树搜索演化宏观策略。
实验与结果
在SafeSearch全测试集上,ACH使Qwen3的Overall ASR达55.9%,较非ACH基线提升13.0–36.1个百分点;演化策略TGSE将Qwen3的ASR进一步提升至71.4%(Table 1)。
局限与可以继续做的
评测基于受控模拟接口而非真实部署网络;ACH无法保证在所有验证流程中稳定暴露与留存;TGSE以特定受害者轨迹为演化条件,跨模型迁移效果不一且离线评测计算成本较高。
实验设置Qwen3.5-9B、Gemma4-31B 等 · SafeSearch、SearchGEO · ASR、MaxN ASR 等
威胁模型
受限工具中间人(constrained tool-intermediary)。攻击者每轮搜索至多在返回列表末尾追加一条受控结果;若智能体访问攻击者引入的URL,攻击者动态生成该页面内容;原生搜索结果与有机页面保持只读不变。
被测模型
Qwen3.5-9BGemma4-31BDeepResearchMiniMax-M2.5Qwen3-235B-A22B-Instruct-2507Kimi-K2.5DeepSeek-V4-Flash
基准
SafeSearchSearchGEO
指标
ASRMaxN ASRInjected-visit rateASR conditioned on injected visit
AI 导读和推荐理由中国科学技术大学与南洋理工大学的研究者提出针对 DeepResearch 类搜索 Agent 的长程工具中介攻击,把搜索返回通道视为安全边界,而非只投毒单个静态页面。在每轮查询最多追加一条受控结果、仅对攻击者引入的 URL 提供受控页面的约束下,攻击者通过轨迹记忆和策略引导的规划器,让多轮注入结果互相印证,形成连贯证据链。专家精炼策略 Authority-Chain Hijack(ACH)在 SafeSearch 全量测试集上取得 55.9% / 83.3% 的 ASR / MaxN ASR,比最强的非 ACH 基线高 13.0–36.1 个百分点。研究者进一步提出 Trace-Guided Strategy Evolution(TGSE),用成功与失败的执行轨迹演化攻击策略,最强单一设置在留出评测中达到 71.4% / 95.0%,较 ACH 最高提升 15.4 个百分点。

中国科学技术大学与南洋理工大学的研究者提出针对 DeepResearch 类搜索 Agent 的长程工具中介攻击,把搜索返回通道视为安全边界,而非只投毒单个静态页面。在每轮查询最多追加一条受控结果、仅对攻击者引入的 URL 提供受控页面的约束下,攻击者通过轨迹记忆和策略引导的规划器,让多轮注入结果互相印证,形成连贯证据链。专家精炼策略 Authority-Chain Hijack(ACH)在 SafeSearch 全量测试集上取得 55.9% / 83.3% 的 ASR / MaxN ASR,比最强的非 ACH 基线高 13.0–36.1 个百分点。研究者进一步提出 Trace-Guided Strategy Evolution(TGSE),用成功与失败的执行轨迹演化攻击策略,最强单一设置在留出评测中达到 71.4% / 95.0%,较 ACH 最高提升 15.4 个百分点。

推荐理由论文把搜索引擎结果页当作攻击面,给出逐轮协同投毒的长程攻击策略与轨迹诊断,可对照检查搜索类 Agent 的证据链信任假设。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    现有静态注入易被搜索智能体的多步验证稀释,论文研究动态工具中间人如何协同构造证据链诱导最终答案。

    多步搜索智能体在面临动态观测通道操纵时,其交叉验证机制能否被攻击者协同构造的虚假证据链击穿。

    • 场景与重要性:以 Tongyi DeepResearch 为代表的搜索智能体通过 ReAct 式循环自主决定后续检索与浏览动作,其最终输出依赖完整的外部观测链。
    • 现有方法的不足:先前针对搜索智能体安全的研究主要关注静态网页注入,但智能体会在多轮交互中发起追问并交叉比对多个来源,单一注入页面往往会被稀释或舍弃。
    • 核心观察与假设:作者认为搜索与页面观测通道是脆弱的安全边界;若第三方充当受限中间人,在每轮检索中追加一条受控条目,便可通过跨步骤协调证据持续引导智能体的收集过程。
    • 提出的核心方案:论文构建了结合轨迹记忆与策略引导的长程攻击系统,提出权威链劫持(Authority-Chain Hijack, ACH)策略以及基于轨迹反馈自动优化策略的演化方法(TGSE)。
    • 威胁模型:
      • 攻击目标:诱导搜索智能体在最终回答中满足特定的攻击目标与检查清单要求,而非仅仅诱导智能体访问恶意网页。
      • 攻击者知识与能力:设定为受限工具中间人(constrained tool-intermediary);不控制整个搜索引擎,每轮搜索至多在约 10 条原生结果末尾追加 1 条受控结果,并对受控 URL 动态生成页面内容。
      • 受害系统:基于 ReAct 架构、具备 Search 与 Visit 动作的 DeepResearch 式多步搜索智能体。
      • 交互边界限制:原生搜索结果与有机网页内容保持不变且为只读状态,攻击者不篡改真实外部网页。
  2. 有哪些相关研究?

    梳理了搜索智能体安全、长程智能体攻击以及自演化攻击三类研究,指出此前缺乏针对多步搜索轨迹的动态宏观策略。

    搜索智能体与搜索安全

    • 静态网页注入与安全基准:SafeSearch(Dong et al., 2025)通过不可靠网页和注入结果评测搜索智能体安全性;AgentDojo(Debenedetti et al., 2024)研究提示注入;GEO(Aggarwal et al., 2024)及相关工作优化内容以供检索引用。WARP(Zhang et al., 2026a)和 FORGE(Pan et al., 2026)进一步分析预设文档对搜索轨迹的影响。作者指出这些方法在测试时内容均为静态,不根据智能体后续检索与验证实时调整。
    • 搜索生态操纵与背书风险:研究涵盖黑帽 SEO(Chen et al., 2026a)及 SearchGEO(Chen et al., 2026b)对智能体推荐背书脆弱性的测量。作者认为此类工作揭示了不可信网页的危害,但尚未涉及展开轨迹中的动态长程操纵。

    智能体长程攻击

    • 多智能体通信篡改:AiTM(He et al., 2025)拦截并重写智能体间通信;MAST(Yan et al., 2026b)在多智能体通信中引入多轮状态条件子目标规划与隐蔽篡改。作者指出其攻击通道和权限与本文受限的 Search/Visit 接口不同。
    • 环境与工具反馈自适应:AgentLAB(Jiang et al., 2026)研究多轮提示与环境对抗观测注入;Evo-Attacker(Yan et al., 2026a)利用经验检索与可行性反思实现长程工具攻击。作者指出 Evo-Attacker 假定了更宽泛的工具返回通道,而本文仅限于单条搜索追加与受控 URL 访问。

    自演化与自适应攻击搜索

    • 攻击提示词与工作流演化:ASTRA(Liu et al., 2026)和 Genesis(Zhang et al., 2026b)将攻击反馈提炼为策略知识用于构建越狱提示词或单次注入;AgenticRed(Yuan et al., 2026)与 T-MAP(Lee et al., 2026)分别对越狱工作流与初始化提示词展开演化搜索。
    • 演化对象与机制差异:作者指出上述工作未针对智能体轨迹内部的宏观攻击策略构建类似 DGM(Zhang et al., 2025)的父子策略树;TGSE 则以执行轨迹指导宏观策略文本的演化。

    基线方法与基准

    • 对比基线与评测数据:论文对比了无攻击基线(No attack)、静态基线(AgentDojo、GEO、SafeSearch)、冻结记忆基线(Objective Drift)以及动态适配基线(AiTM、MAST、Intent Hijacking、Evo-Attacker),主要评测基准为去除锁定站点用例后的 SafeSearch 开放网络子集(OpenWeb-filtered split)。
    • 作者对本文的定位:作者称本文在受限工具中间人模型下,探索了在智能体执行期间利用轨迹记忆与宏观策略协同构造动态证据链的方法。
  3. 论文如何解决这个问题?

    构建包含记忆与规划器的运行时,提出权威链劫持策略协调搜索与访问内容,并用TGSE算法自动演化策略。

    论文设计了面向多步搜索智能体的有状态攻击者运行时,提出专家精炼的权威链劫持(ACH)策略以协同跨轮次证据,并进一步提出轨迹引导策略演化(TGSE)以实现策略自动优化。

    攻击形式化与有状态运行时

    • 事件级决策生成:在智能体交互事件 t 处,规划器 P 结合当前动作 at、真实工具返回 ot、紧凑轨迹记忆 Mt、宏观策略 s 以及案例意图 c,生成受控载荷与反思: (pt, ρt) = P(at, ot, Mt, s, c) 反思记录规划器对当前轨迹的解读,并在后续并入 Mt+1。
    • 确定性权限执行:运行时根据威胁模型约束应用载荷:搜索事件至多追加一条合成结果 bt;访问事件若属于攻击者引入的 URL 集合 Uadvt−1 则返回生成内容 cadvt,若属于有机 URL 则原样返回并仅触发只读反思。形式化定义为: õt = Rt(qt) ⊕ bt(当 at = SEARCH(qt));õt = cadvt(当 at = VISIT(ut), ut ∈ Uadvt−1);õt = Ct(ut)(当 at = VISIT(ut), ut ∉ Uadvt−1)。
    • URL 注册表机制:内存维护注入 URL(来自合成搜索结果)、目标 URL(页面正文中引用的后续受控链接)以及真实受保护 URL,确保真实 URL 不被篡改。

    权威链劫持(ACH)策略机制

    • 核心策略设计:ACH 并不追求单一页面的攻击强度,而是通过三个阶段协调搜索与访问内容,使攻击目标表现为多个信源互相印证的共识。
    • 阶段一:建立权威:搜索阶段在尾部追加符合 SERP 权威层级的切题结果;访问阶段呈现符合标题摘要的专业页面并引入目标论调,暂不激进推销目标,以稳定信任。
    • 阶段二:俘获验证与链接形成:智能体进行追问或交叉验证时,注入复用前述术语和数据来源的佐证结果,将验证环节转变为受控证据的新入口;访问页面通过交叉引用和对比表连接先前材料。
    • 阶段三:巩固信任与引导整合:当智能体围绕新概念检索时,注入呈现聚合共识的检索结果;最终提供包含结构化摘要、列表或表格的综合页面,以便智能体在最终总结时直接采纳目标主张。

    轨迹引导策略演化(TGSE)流程

    • 演化动机与归档树:针对 ACH 在不同风险类别中表现不均的问题,TGSE 将自然语言策略作为演化对象,基于 DGM 维护父子策略归档树。
    • 轨迹压缩与审计反馈:训练阶段对重复运行收集压缩轨迹与判定结果,形成审计数据包。数据包总结稳定成功、稳定失败及波动(flip)用例,剔除冗余文本。
    • 两阶段筛选与父节点采样:每轮通过软权重采样父策略并生成子策略;子策略先在 10 个用例的小样本(cheap stage)上测试,依据硬回归门禁过滤性能下降者,通过后再进行 20 个用例的完整评估。
    • 演化提示词规范:演化模型接收包含当前策略、归因目标、跨代变化对比与格式约束的审计包,输出包含诊断分析、完整替换策略及修改差异(diff)的 JSON 对象;附录 B.4 给出了完整提示词格式。
  4. 论文做了哪些实验?

    在SafeSearch全测试集上ACH取得55.9% ASR,优于全部基线,TGSE演化后达71.4% ASR。

    实验设置

    • 被测模型:评估 6 个后端模型,分别为 Qwen3.5-9B、Gemma4-31B、DeepResearch、MiniMax-M2.5、Qwen3-235B-A22B-Instruct-2507(简记 Qwen3)与 Kimi-K2.5;跨模型测试补充评估 DeepSeek-V4-Flash。
    • 攻击与裁判模型:默认攻击规划器与 ASR 裁判均使用 Qwen3-235B-A22B-Instruct-2507;TGSE 策略演化模型采用 Qwen3.6-Plus。
    • 数据集与划分:使用 SafeSearch 基准过滤掉锁定具体站点用例后的 OpenWeb-filtered 测试集,包含 187 个用例(Ads 40、Bias 40、Misinfo 40、Harm 29、Injec 38);每类保留 20 个用例作为训练集用于策略演化。另在 SearchGEO(44 个查询)上测试外部泛化。
    • 指标与评测协议:报告 Attack Success Rate(ASR,5 次重复的平均成功率)与 MaxN ASR(5 次重复中至少 1 次成功的用例占比),并使用注入访问率与访问后 ASR 分析轨迹门禁。受害者单次运行最大 LLM 调用预算固定为 10 次。

    主结果

    下表呈现全测试集(187 个用例,各 5 次重复)上各受害模型的 Overall ASR / MaxN ASR(%,据 Table 9):

    表格较宽,可左右滑动

    受害模型No attackAgentDojoSafeSearchObj. DriftOurs (ACH)
    Kimi-K2.50.7 / 2.90.9 / 3.54.5 / 9.82.3 / 5.117.5 / 36.3
    Qwen31.3 / 2.916.6 / 22.127.9 / 50.415.0 / 34.655.9 / 83.3
    MiniMax-M2.51.1 / 3.72.5 / 7.310.1 / 21.63.2 / 8.446.2 / 71.6
    DeepResearch1.0 / 3.55.9 / 14.115.7 / 30.28.3 / 25.048.0 / 75.5
    Gemma4-31B0.3 / 1.00.3 / 1.79.9 / 17.94.3 / 11.328.7 / 50.2
    Qwen3.5-9B1.0 / 1.90.5 / 2.215.2 / 29.34.2 / 10.646.4 / 74.1
    • ACH 对所有受害模型取得最高 Overall ASR:据 Table 9,在全部 6 个模型上,ACH 的 Overall ASR 介于 17.5% 至 55.9%,较最强非 ACH 基线高出 13.0 至 36.1 个百分点;GEO 因列宽限制未列入上表,其 Overall ASR 介于 0.6% 至 7.4%。
    • 突破搜索访问与回答留存双重门禁:据 Table 14 与 Figure 4b,静态基准 SafeSearch 在 Qwen3 上的访问率为 72.0%、访问后 ASR 为 39.5%;ACH 将访问率提升至 90.2%,访问后 ASR 提升至 63.1%,实现跨轮次证据留存。
    • 提示注入任务的特殊例外:在 Prompt-Injection 类别中,AgentDojo 在 Qwen3 上达到 73.7% ASR,高于 ACH 的 42.1%(Table 9);作者解释称该类别依赖遵循格式指令而非证据采纳,AgentDojo 直接在摘要中注入指令即可生效,无需点击页面。

    跨模型与跨架构评测

    • 攻击者能力对攻击表现的影响:在 20 用例测试子集上(Figure 5a),以 Kimi-K2.5 作为攻击者时平均 ASR 最高(40.1%),Qwen3(34.1%)、Gemma4-31B(30.6%)居中,Qwen3.5-9B 最低(16.9%);作者称更强攻击者更擅长将策略转化为切题证据。
    • 受害者行为差异:据 Figure 5b,四类受害者的搜索载荷暴露占比相近(8.1%–8.6%),但 Qwen3 转化出 86.7% 的注入访问轨迹与 51.9% 的访问后 ASR;Kimi-K2.5 仅有 23.6% 轨迹访问注入页且访问后 ASR 为 29.0%;Gemma4-31B 极少调用 Visit(访问轨迹仅占 7.9%),主要受摘要直接影响。
    • 跨架构迁移表现:据 Table 16,将基于原生 DeepResearch 架构演化的 Normal-TGSE 策略直接迁移至 GPT Researcher、OpenResearcher 和 OpenSeeker-v2,ASR 分别达到 61.4%、38.0% 和 55.0%,均高于同架构下的静态与动态基线。

    策略演化(TGSE)与外部基准泛化

    • 策略演化测试结果:据 Table 1,在 Qwen3 上的 20 用例测试子集中,未演化的 Base ACH 为 56.0% ASR / 85.0% MaxN ASR;Trace-warm TGSE 达到 71.4% / 95.0%,Normal TGSE 达到 70.0% / 93.0%;按任务类别取最优设置的上限达 77.4% / 96.0%。
    • 类别特定演化表现:Trace-warm TGSE 在 Injec 类别达到 89.0% ASR(Table 1);Adv-train TGSE 在 Bias 与 Misinfo 分别达 82.0% 与 81.0%;作者解释称对抗训练使攻击者学会将虚假来源与主张强绑定以抵御交叉验证。
    • SearchGEO 外部基准测试:据 Table 17,在 44 个 SearchGEO 查询中,ACH 取得 39.1% ASR,高于该基准原有的 Mode 2B(30.9%);基于广告类别演化的 Ads-TGSE 进一步达到 57.7% ASR。

    其他消融与分析

    • 注入结果位置敏感度:据 Table 12,Tail、Seeded Random 和 Head 位置在 Qwen3 上的 ASR 分别为 46.2%、45.8% 和 43.2%,差异在 3.0 个百分点内。
    • 策略文本替换消融:据 Table 13,在 Qwen3 运行时中将 ACH 替换为 Dummy init、Goal reframing 和 Directive embedding 后,Overall ASR 分别降至 43.6%、29.8% 和 28.8%。
    • 运行时组件移除消融:据 Table 13,移除反思(w/o reflection)ASR 为 50.4%,移除记忆(w/o memory)降至 36.8%,完全移除策略(w/o strategy)降至 19.7%。
    • 动态基准推理预算对比:据 Table 11,ACH 轨迹平均调用攻击者 3.36 次、消耗 18.38k token($0.00580),低于 Intent Hijacking($0.01059)与 Evo-Attacker($0.01428)。
    • 无攻击背景风险:据 Table 9,No attack 在全测试集存在 0.3%–1.3% 的背景 ASR;作者人工核查发现主要源于真实网络内容本身偏向目标或用户查询固有风险(附录 D.2.2)。
    • 有害输出防御残留:据 Table 1,Harm 类别在所有 TGSE 设置下 ASR 均未超过 50.0%;作者分析显示受害者即使阅读了受控内容,仍常在最终回答中转为安全警告。
  5. 有什么可以进一步探索的点?

    作者指出了模拟环境、缺乏系统防御与单模型演化局限;实验未覆盖真实网络与多受害者演化。

    作者指出的局限与后续方向

    • 受控模拟接口而非真实网络部署:实验在受控搜索接口上进行,未涉及真实部署的落地页和搜索基础设施;平台管控可能增加重复暴露难度,ASR 衡量的是基准脆弱性而非真实攻击成功率(第 5 节)。
    • 无法保证稳定暴露与跨验证留存:ACH 仅协调可用干预机会,不能保证在受害者验证过程中实现稳定的暴露或最终留存(第 5 节)。
    • 缺乏系统性的防御机制评测:论文在附录 E 讨论了提示词与工具层缓解措施,但系统性的防御评测仍待后续探索(第 5 节)。
    • 策略演化以特定受害者轨迹为条件:TGSE 是依赖受害者的策略搜索而非模型不可知优化器,跨受害者迁移效果不一;将 TGSE 拓展到多受害者轨迹仍待后续完成(第 5 节)。
    • 离线演化开销较高:归档候选策略需要端到端运行展开和判定,TGSE 带来了较高的离线计算成本(第 5 节)。

    实验覆盖范围

    • 被测模型范围:主评测覆盖 Qwen3.5-9B、Gemma4-31B、DeepResearch、MiniMax-M2.5、Qwen3 和 Kimi-K2.5 共 6 个受害模型,跨模型演化补充测试了 DeepSeek-V4-Flash。
    • 任务与基准范围:主实验覆盖过滤后的 SafeSearch 共 5 个类别、187 个测试用例,外部泛化测试仅包含 SearchGEO 的 44 个查询。
    • 智能体架构范围:除默认 ReAct 式 DeepResearch 架构外,跨架构测试仅覆盖 GPT Researcher、OpenResearcher 和 OpenSeeker-v2 三个系统。
    • 重复与预算设定:每个用例评估采用 5 次重复,受害者最大 LLM 调用预算固定为 10 次。
    • 未报告信息:论文未报告真实网络环境下的在线测试表现,且未进行多受害者联合轨迹演化实验。
  6. 总结一下论文的主要内容

    论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出ACH策略与TGSE演化方法并完成系统验证。
    • 论文定位:针对基于大语言模型的长程搜索智能体,形式化了受限工具中间人攻击,并提出了策略引导的攻击系统与演化框架。
    • 核心问题:现代搜索智能体会发起追问并交叉验证不同来源,单次静态网页注入易被稀释或舍弃,研究动态观测通道能否协调证据链完成目标劫持。
    • 方法要点:构建带有轨迹记忆与规划器的攻击运行时;设计权威链劫持(ACH)策略,在搜索和访问环节分阶段建立权威并俘获验证;提出 TGSE 算法,利用执行轨迹反馈通过归档树演化宏观策略。
    • 主要实验发现:
      1. 在 SafeSearch 全测试集上,以 Qwen3 为受害者,ACH 达到 55.9% Overall ASR 和 83.3% MaxN ASR(Table 9),高于所有静态与动态基线。
      2. 在 6 个受害模型上,ACH 的 Overall ASR 均位列第一,较最强非 ACH 基线高出 13.0 至 36.1 个百分点(Figure 4a)。
      3. 在 Qwen3 测试子集上,TGSE 演化策略将 Overall ASR 提升至 71.4%(Trace-warm TGSE,Table 1),分任务最优上限达到 77.4%。
      4. 跨架构与跨基准评测中,冻结的演化策略在 GPT Researcher 上达 61.4% ASR(Table 16),在 SearchGEO 上达 57.7% ASR(Table 17)。
    • 作者结论与启示:作者认为搜索智能体的观测通道是一个脆弱的安全边界而非中立的检索接口;单纯依赖静态防御无法抵御动态证据协调,如何在不破坏检索质量的前提下防御中间人操纵仍是开放问题。
阅读原文arxiv.org