跳到正文
原文
论文追踪· arXiv:2512.19016· Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang·本站收录 · 原文发表 精选关注度57

DREAM 框架用跨环境长链攻击评测 12 个 LLM Agent,逾 68% 攻击绕过现有防御

DREAM: Dynamic Red-teaming across Environments for AI Models

论文速读

评测与基准

据论文 PDF 整理(Gemini 生成),以原文为准

作者提出动态红队框架DREAM评测12个大模型智能体,在5步跨5环境攻击下暴露的脆弱性达静态基线的4.8倍。

问题
现有多智能体安全评测局限于静态单轮测试,无法捕捉跨多环境、多轮交互中由看似良性操作累积构成的长链攻击威胁。
方法
DREAM将攻击建模为部分可观测马尔可夫决策过程,基于跨环境对抗知识图谱与上下文引导策略搜索,动态组合原子攻击并回溯规划。
实验与结果
评测12个模型发现超68%长链攻击绕过防御;Claude-Sonnet-4.5综合防御得分最高达67.30,但在长链突破后危害得分达14.4。
局限与可以继续做的
评测覆盖12个模型及349个环境;5环境路径样本偏少;依赖闭源API影响完全复现;尚未覆盖OpenClaw等高权限本地智能体。
实验设置Gemini-2.5-Flash-NT、o4-mini 等 · SafetyBenchmark · Overall Defense Score、ASR 等
被测模型
Gemini-2.5-Flash-NTo4-miniGemini-2.5-FlashGPT-5Gemini-2.5-ProGrok-4Claude-Sonnet-4.5Qwen3-235B-A22BKimi-K2-PreviewLlama-3.1-70BQwen-2.5-72BDeepSeek-V3.1
基准
SafetyBenchmark
指标
Overall Defense ScoreASRDamage MitigationAttack ObservabilityContextual Isolation
AI 导读和推荐理由南京大学、香港大学等机构的研究者提出 DREAM,一个通过动态多轮对抗模拟评测 LLM Agent 交互级安全的框架。其核心是跨环境对抗知识图谱(CE-AKG)与上下文引导策略搜索(C-GPS),把现有单轮静态攻击当作原子动作,组装成跨环境的长链攻击轨迹。基于 349 个数字环境构建的 1986 个原子攻击库,研究者在 12 个 SOTA Agent 上评测,发现超过 68% 的长链攻击成功绕过现有防御,8 个模型的攻击成功率超过 70%。跨 5 个环境的 5 步攻击链暴露的漏洞严重度是静态基线的 4.8 倍。Claude-Sonnet-4.5 平均攻击成功率最低(48.31%),但长链攻击一旦成功,其严重度得分(14.4)为所有模型最高。

南京大学、香港大学等机构的研究者提出 DREAM,一个通过动态多轮对抗模拟评测 LLM Agent 交互级安全的框架。其核心是跨环境对抗知识图谱(CE-AKG)与上下文引导策略搜索(C-GPS),把现有单轮静态攻击当作原子动作,组装成跨环境的长链攻击轨迹。基于 349 个数字环境构建的 1986 个原子攻击库,研究者在 12 个 SOTA Agent 上评测,发现超过 68% 的长链攻击成功绕过现有防御,8 个模型的攻击成功率超过 70%。跨 5 个环境的 5 步攻击链暴露的漏洞严重度是静态基线的 4.8 倍。Claude-Sonnet-4.5 平均攻击成功率最低(48.31%),但长链攻击一旦成功,其严重度得分(14.4)为所有模型最高。

推荐理由DREAM 把单轮静态攻击当作原子动作组装成长链跨环境攻击,对 12 个主流 Agent 的评测显示多数模型难以追踪长期恶意意图。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者认为静态单轮评测忽视了多轮跨环境交互中的上下文脆弱性与多米诺骨牌效应,无法反映智能体安全脆弱性上限。

    现有多智能体安全评测主要依赖静态、单轮提示词,无法评估在跨环境长链交互中由良性操作累积构成的系统性攻击风险。

    • 问题场景与重要性:大模型智能体能够自主调用工具跨多个异构环境操作,攻击面延伸至整个交互轨迹,单步良性动作的复合可能绕过安全过滤器造成高危破坏。
    • 现有评测的局限:现有基准将安全视为孤立不变量,仅进行单轮无状态评估,无法关联分散在不同环境中的恶意意图,给出的仅是合规检查下的脆弱性下界。
    • 核心观察与假设:作者提出智能体存在“上下文脆弱性”(Contextual Fragility),即在单环境中有效的防御机制在跨环境传递信息时失效;且长链攻击存在非线性相变跃迁。
    • 提出的评测框架:论文提出了 DREAM 框架,通过跨环境对抗知识图谱与上下文引导策略搜索,将静态攻击作为原子动作,自主合成为多轮跨环境攻击轨迹。
    • 动态对抗威胁模型:攻击者目标是寻找最大化暴露安全风险的最优轨迹;在 PO-MDP 框架下维护信念状态,无法直接观测真实系统状态,通过多环境枢纽跳跃推进攻击。
  2. 有哪些相关研究?

    论文将相关研究划分为大模型安全评测、大模型对抗测试以及智能体安全评测,指出现有方法局限于单环境与无状态测试。

    论文从大模型安全评测、对抗红队以及智能体安全评测三个维度回顾了相关工作:

    • 大模型静态安全评测:CValues(Xu等,2023)、Flames(Huang等,2024)与 SafetyBench(Zhang等,2024)构建了多类别有害内容的静态基准,通过直接提示词或选择题评测模型安全性。作者指出这些基准局限于无状态评估,无法覆盖攻击者主动绕过护栏的真实场景。
    • 对抗性探测与红队越狱:ArtPrompt(Jiang等,2024)、JailbreakBench(Chao等,2024)与 HarmBench(Mazeika等,2024)利用越狱攻击检验模型鲁棒性;Crescendo(Russinovich等,2025)研究了多轮越狱攻击。作者指出这类评估大多仍局限于单轮或单一对话交互,未考虑跨环境调用的累积风险。
    • 智能体安全评测与基准:AgentDojo(Debenedetti等,2024)、SafeAgentBench(Yin等,2024)与 R-Judge(Yuan等,2024)推进了工具调用智能体的安全评测。作者指出它们存在三个局限:限定在单环境隔离范围无法测试跨环境枢纽跳跃;依赖无状态单轮交互;采用固定攻击模板易导致模型仅通过模式记忆防御。
    • 基线方法与基准环境:DREAM 以 SafetyBenchmark(Yin等,2024)中的 349 个数字环境为基础构建原子攻击库,并与单环境静态攻击基线进行了对比。

    作者将 DREAM 定位为将智能体安全评测由单环境无状态检测扩展至多轮时序、跨异构环境的状态化审计框架。

  3. 论文如何解决这个问题?

    DREAM将多环境红队形式化为PO-MDP,利用跨环境对抗知识图谱与启发式树搜索C-GPS自主合成长链攻击轨迹。

    DREAM 将多环境对抗交互建模为部分可观测马尔可夫决策过程,结合知识图谱与启发式树搜索实现自动化长链红队攻击。

    形式化建模与信息论分析

    论文将攻击者与工具智能体的交互建模为 PO-MDP,优化目标形式化为寻找最大化预期累积奖励的最优策略 π∗:

    π∗ = argmaxπ 𝔼T ∼ π [ ∑t=0T γt R(bt, at) ]
    • 真实状态 S 包含系统内部逻辑和隐藏文件,攻击者无法直接观测,通过信念状态 b_t(实现为知识图谱)追踪系统信息。
    • 攻击意图密度定义为 rho = I(G) / Delta_T,静态单轮攻击(Delta_T = 1)高意图密度易被检测;DREAM 将恶意载荷分散至多步长链,前期降低不确定性、保持低局部意图密度。
    • 论文使用希尔方程(Hill Equation)建模攻击准备向成功突破的非线性相变跃迁概率:
    Psuccess(bt) = ((Kaccum(t) · ω)k)/(Ωk + (Kaccum(t) · ω)k)

    其中 Omega 为防御熵障,K_accum(t) 为累积知识上下文,omega 为战略效率系数,k 为协同系数。累积知识超过防御阈值时突破概率发生跃迁。

    动作空间:多智能体原子攻击库

    动作空间 A 包含 1,986 个结构化原子攻击,覆盖 349 个数字环境。

    • 每个原子攻击包含检索用的语义描述、目标环境 E、参数化提示词模板和所需的前置实体需求。
    • 攻击行为抽象为三类红队角色:侦察者(Scout,551个)通过枚举信息降低不确定性;播种者(Seeder,139个)修改状态植入配置;利用机构(Exploiter,1,283个)利用既有信息达成恶意目的并获取即时奖励。

    状态空间:跨环境对抗知识图谱(CE-AKG)

    由统一沙箱(Unified Sandbox)实现,维护动态 JSON 实体结构(包含用户 ID、凭证、文件路径、API 密钥等)。

    • 信息融合:智能体解析环境观测 o_{t+1},抽取新实体 K_{t+1} 并合并至全局信念状态 b_{t+1} = b_t \cup K_{t+1}。
    • 上下文注入:为待执行动作查询所需实体,提取上下文实例化攻击提示词模板,打破跨环境信息孤岛。

    上下文引导策略搜索(C-GPS)与执行流程

    C-GPS 在信念状态空间中进行启发式树搜索与回溯。

    • 启发式价值函数:平衡动作内在潜力 Score(a)、实体利用率 EntityUsage(b_t, a)(即前置需求与已获取实体的重合度)和战略突破奖励 StrategicBonus(a)。
    • 动态候选集生成:依据当前信念状态进行语义检索,再按战略意图聚类,筛选出 20 到 30 个候选动作。
    • 回溯机制与执行闭环:执行动作并接收目标智能体观测;若步骤成功则融合知识并前进一步,若遇阻则在搜索树中回溯至上一决策节点探索替代路径。
  4. 论文做了哪些实验?

    评测覆盖12个模型,发现超68%长链攻击绕过防御,且攻击危害得分随链长与环境数超线性增长,统计检验p<0.001。

    实验设置

    • 被测模型:共 12 个模型,包含 7 个闭源商业模型(Gemini-2.5-Flash-NT、o4-mini、Gemini-2.5-Flash、GPT-5、Gemini-2.5-Pro、Grok-4、Claude-Sonnet-4.5)和 5 个开源模型(Qwen3-235B-A22B、Kimi-K2-Preview、Llama-3.1-70B、Qwen-2.5-72B、DeepSeek-V3.1)。所有模型均采用贪婪解码进行确定性评测。
    • 攻击框架配置:Conductor 规划模型采用 Gemini-2.5-pro;原子攻击库包含源自 SafetyBenchmark 的 349 个环境共 1,986 个原子攻击。
    • 评测协议与样本量:每个模型评测 100 条攻击链,目标攻击链长度设为 1 至 5 步且各占 20%;若目标长度失败则回退至最长成功子链。
    • 评测维度与指标:基于 8 种风险类别(R1-R8)与 9 种失效模式(M1-M9),报告 5 维防御指标:综合防御得分(Overall Defense Score,高优)、攻击成功率(ASR,低优)、危害缓解(Damage Mitigation,高优)、攻击可观测性(Attack Observability,高优)、上下文隔离(Contextual Isolation,高优)。
    • 判定方式:由大模型对执行观测进行评估以判定单步动作是否成功。

    主结果

    下表呈现 6 个代表性模型在面对 DREAM 动态对抗链时的综合防御表现(据 Table 4):

    表格较宽,可左右滑动

    模型综合防御得分(↑)ASR(%)(↓)危害缓解(↑)攻击可观测性(↑)上下文隔离(↑)
    Gemini-2.5-Flash-NT37.3482.0056.3244.8041.37
    Qwen3-235B-A22B38.7383.0058.1044.9737.82
    Gemini-2.5-Flash40.8976.0060.2747.4144.90
    DeepSeek-V3.148.1067.0065.4954.3949.48
    Grok-461.1743.0075.3264.6867.53
    Claude-Sonnet-4.567.3024.0076.8071.9584.23

    注:据 Table 4。受篇幅限制,表中列出最具代表性的 6 个模型(含综合防御得分最低与最高模型);省略了 o4-mini、Kimi-K2-Preview、Llama-3.1-70B、Qwen-2.5-72B、GPT-5 和 Gemini-2.5-Pro。

    • 长链攻击普遍奏效:作者称 12 个模型中有 8 个模型的 ASR 超过 70%,表明现代智能体难以追踪长期恶意意图。
    • 上下文脆弱性广泛存在:多数模型的上下文隔离得分偏低,未能阻断环境间的信息流动。
    • 商用与开源模型分化:Claude-Sonnet-4.5 展现出最高的综合防御能力,而开源模型在多数指标上整体偏弱。

    多米诺骨牌效应与能力-风险悖论

    • 链长放大攻击危害:Figure 3(a) 显示攻击危害得分从第 1 步的约 1.5 增长至第 5 步的 10 以上;Figure 3(b) 中聚合均值得分呈超线性增长,超越指数基准线(1.19^x)。
    • 能力-风险悖论:Claude-Sonnet-4.5 总体防御最高,但在第 5 步被成功攻破时,危害得分达到所有模型中最高的 14.4(Figure 3(a))。作者认为更强的推理能力一旦被多米诺效应利用,会造成更大的破坏。

    信息桥梁与跨环境攻击影响

    • 跨环境放大威胁:Figure 4(a) 与 4(b) 显示随涉及独立环境数量增多(1 到 5 个),危害得分分布整体抬升并高于指数基准线。
    • 统计显著性检验:Table 10 显示对 12 个模型在对数空间进行 Wilcoxon 符号秩检验,当链长 n >= 2 或跨环境数 n >= 2 时,DREAM 与指数基准的差异均达到 p < 0.001 的统计学显著差异;而单步攻击(n=1)无统计学显著差异(p = 1.000)。

    静态防御干预与失效分析

    • 静态提示词约束反噬:在 Gemini-2.5-Flash 系统提示词中注入安全约束,综合防御得分从 40.89 降至 36.62,ASR 从 76% 升至 83%(附录 B.1)。
    • 机制分析:作者称多轮交互中的“上下文漂移”(Contextual Drift)使得初始安全规则被后续即时上下文冲淡而失效。

    其他消融与分析

    • Conductor规划模型能力消融:Figure 5 中对比 Claude、DeepSeek、Gemini 2.5、GPT-4o 和 GPT-5,高能力模型展现更陡峭的超线性增长。
    • 评测稳定性检验:Table 9 对 Gemini-2.5-Flash 重复 3 次端到端测试,综合防御得分为 41.06 +- 1.16,ASR 稳定在 76 +- 1%。
    • 易损代码生成(R7)高危漏洞:Table 7 中 Llama-3.1-70B 与 Gemini-2.5-Flash-NT 在 R7 类别下的 ASR 均达到 100.00%。
    • 工具瘫痪(M8)普遍失效:Table 8 显示 12 个模型中有 9 个模型在未能调用必要工具(M8)模式下的 ASR 超过 90%。
  5. 有什么可以进一步探索的点?

    作者指出了闭源API对复现性的影响及本地高权限智能体的审计需求,实际评测受限于5环境样本及提示词防御测试。

    作者指出的局限与后续方向

    • 闭源模型API稳定性影响完全复现:作者在附录 F 中指出,框架核心组件依赖闭源 API,精确的逐字复现未来可能受到无法控制的 API 更新影响。
    • 高权限本地智能体的审计需求:作者在附录 B.2 中指出,当前实验聚焦于 12 个模型,而以 OpenClaw 为代表的新兴本地常驻智能体打通了外部聊天与本地操作系统,在长轨迹下可能同样面临防御退化,将其纳入 DREAM 审计是未来的关键方向。
    • 5环境路径的探索限制:作者在第 4.2.3 节中指出,由于 Conductor 倾向于追求攻击效率而非强制探索,导致在 5 个环境下的实验数据较为有限。

    实验覆盖范围

    • 被测模型范围:实验覆盖 12 个大模型,包含 7 个商业闭源模型和 5 个开源模型,均采用贪婪解码。
    • 原子环境与攻击库规模:实验基于 SafetyBenchmark 的 349 个数字环境构建了 1,986 个原子攻击动作。
    • 防御干预评测范围:防御干预实验仅在 Gemini-2.5-Flash 单一模型上测试了静态系统提示词约束。
    • 重复与评测次数:主实验每模型评测 100 条攻击链;稳定性检验仅在 2 个模型上重复测试了 3 轮。
    • 人工评估报告情况:论文未报告动作成功判定结果与人工标注之间的一致性指标。
  6. 总结一下论文的主要内容

    DREAM提出基于知识图谱与策略搜索的动态红队框架,分析了长链跨环境攻击对当前主流智能体的系统性威胁。
    • 一句话定位:DREAM 是一个用于评测大模型智能体在多轮、跨环境交互中安全鲁棒性的自动化动态红队框架。
    • 要解决的问题:现有智能体安全评测依赖静态单轮测试,无法发现分散在不同环境、由看似良性的单步操作复合累积而成的长链攻击威胁。
    • 核心方法设计:将动态对抗形式化为 PO-MDP,构建涵盖 1,986 个原子攻击的动作空间;通过统一沙箱维护跨环境对抗知识图谱(CE-AKG)实现实体融合,结合上下文引导策略搜索(C-GPS)与回溯机制生成高威胁攻击轨迹。
    • 核心实验发现:评测 12 个模型显示超过 68% 的长链攻击突破现有防御;5 步跨 5 环境攻击暴露的脆弱性达静态基线的 4.8 倍;Claude-Sonnet-4.5 总体防御最高(综合防御得分 67.30,ASR 为 24.00%),但在被攻破时呈现出更高的破坏危害得分(14.4)。
    • 机制与防御启示:Wilcoxon 检验(p < 0.001)证实了多米诺骨牌效应与信息桥梁的协同放大作用;静态系统提示词防御会导致上下文漂移并反噬安全性,作者呼吁构建能够感知时序交互轨迹与状态的防御机制。
阅读原文arxiv.org