研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹
Towards a Unified Misuse Monitoring Benchmark
作者对智能体滥用监视提出危害窗口与区间指标,发现动作视角监视器跨威胁 AUC 超 0.95 但定位危害仍较弱。
- 现有 LLM 智能体滥用监视研究将分解攻击与提示注入割裂处理,且仅关注整条轨迹是否拦截而忽略危害发生的具体时间点。
- 将轨迹中智能体动作作为统一监视对象,定义从首次危害承诺到执行的危害窗口,提出区间指标并构建包含分解攻击与提示注入的约 6,200 条轨迹基准。
- 动作视角的监视器在两类威胁上取得 0.95 与 0.99 的 AUC,而内容视角监视器在注入攻击上崩溃;在区间指标下所有监视器对分解攻击的定位得分均不超过 0.50。
- 评测轨迹与工具输出均由单个 Gemma 4 26B-A4B 生成;危害起始标签依赖 Claude Opus 5 标注而非人工,存在假阳性高估;未覆盖针对活体智能体的实时自适应对抗。
- 威胁模型
- 黑盒轨迹级监视;攻击者通过用户分解输入或工具注入提示诱导智能体执行有害意图,监视器仅通过文本轨迹在预算约束下检测并阻断动作。
- 模型
- Gemma 4 26B-A4BQwen3.6 27BQwen3.5 27BQwen3.5 9BQwen3.5 4BQwen3.5 2BMistral Small 3.2 24BLlama 3.1 70BGPT-5.6 LunaClaude Haiku 4.5Llama Guard 4 12BQwen3Guard-Gen 8B
- 基准
- DecomposedHarmAgentDojo
- 指标
- AUCRecall (at FPR <= 0.1)Interval Credit
牛津研究者提出统一的轨迹级滥用监控形式化框架,并据此构建约 6200 条对话轨迹的基准,同时覆盖分解攻击与提示注入两类威胁。基准包含 1165 条分解轨迹及良性对照、582 条有害与良性步骤交错的轨迹、1644 条拒答孪生样本,以及基于 AgentDojo 运行日志的 2828 条注入攻击轨迹,并标注了从首次有害承诺到目标执行的危害窗口。在 17 种监控配置上,以 Agent 动作为判断对象的监控在两类威胁上 AUC 分别为 0.95 和 0.99,而以内容为判断对象的监控在注入攻击上 AUC 仅 0.52。作者指出传统位置无关指标高估了监控表现,在衡量定位能力的区间指标下所有监控对分解攻击的定位都较差,最佳配置仅 0.50,且监控器会把大量最终被拒答的请求误判为有害。
推荐理由论文把分解攻击与提示注入放进同一套轨迹级监控评测,并给出监控器定位危害时点的区间指标,可供做 Agent 监控评测的团队参考。
深度解读
这篇论文试图解决什么问题?
解决 LLM 智能体滥用监视割裂且位置盲目的问题,提出基于动作的统一框架。
论文试图解决现有 LLM 智能体滥用监视研究将不同威胁割裂处理且仅关注轨迹是否被拦截而忽略危害何时发生的局限。
场景与重要性:随着 LLM 智能体进入包含用户、工具和环境的多行动者场景,恶意行为者可以通过分解攻击(Decomposition attacks)或环境提示注入(Prompt injection attacks)向智能体引入危害,作者称及时在动作层面对其进行外部监视至关重要。
现有方法的不足:作者指出,现有滥用监视文献将每种攻击类型孤立处理,评测分散且难以对比;同时几乎只评测整条轨迹是否应被拦截(whether),而忽略了智能体何时走向有害(when),无法量化监视器对时效性危害的精准定位能力。
核心观察与假设:作者认为无论威胁来源是用户还是外部工具,真正的危害只能由智能体自身调用工具去具体实现;因此将监视对象统一锚定在智能体响应(动作)而非外部输入上,是跨威胁统一监视的通用切入点。
论文的贡献:论文提出了轨迹级滥用监视的形式化框架,定义了包含证据起始与执行起始的危害窗口及区间指标(Interval credit),并构建了涵盖约 6,200 条轨迹的统一评测基准。
威胁模型:
- 攻击者目标:在分解攻击中由用户将有害意图拆解为无害子请求以绕过过滤并使智能体完成目标;在提示注入攻击中由外部对手诱导智能体偏离原目标执行恶意指令。
- 攻击者知识:论文仅研究黑盒外部监视器,监视器读取完整文本轨迹,不访问智能体内部激活值。
- 攻击者能力:在分解攻击中用户可在任意轮次追加输入;在提示注入中攻击者通过工具返回结果(如邮件)向智能体注入恶意指令。
- 受害系统:由中心 LLM 智能体与工具、用户、外部实体构成的轮次交互多行动者系统。
有哪些相关研究?
涵盖 AI Control、分解攻击、提示注入与护栏模型,本文统一其评测基准。
相关研究主要涵盖 LLM 智能体监视与控制、威胁类型建模以及安全防护模型三大方向。
- 智能体监视与 AI 控制:
- AI Control 监视协议:Greenblatt 等(2024)、UK AI Security Institute(2025)、Bhatt 等(2025)与 Stickland 等(2025)研究防止模型颠覆的监视框架;Arike 等(2026)发现监视器输入过多信息反而受损,提出抽取-评估(Extract-and-Evaluate, eae)机制。
- 滥用监视与审查框架:Yuan 等(2024)提出 R-Judge,Luo 等(2025)提出 AgentAuditor 记录与审查智能体交互;Sharma 等(2025)提出基于宪法的分类器。
- 威胁机制与攻击形式:
- 分解攻击:Glukhov 等(2023)与 Jones 等(2024)指出将有害任务拆分可通过过滤;Chen 等(2025)提出 DecomposedHarm 并提出轻量级时序监视器;Hills 等(2026)研究持久状态控制下的分布式侧向任务。
- 提示注入攻击:Greshake 等(2023)与 Liu 等(2023)形式化了间接提示注入;Debenedetti 等(2024)提出 AgentDojo 评测智能体注入;Debenedetti 等(2025)提出双模型架构 CaMeL,Zhu 等(2025)提出 MELON。
- 防护模型与安全护栏:
- 专用 Guard 模型:Meta AI(2025)提出 Llama Guard 4,Qwen Team(2025)提出 Qwen3Guard,Zeng 等(2024)提出 ShieldGemma;Chen 等(2026)提出 TraceSafe-Bench 评估轨迹护栏。
- 基线方法与基准:
- 基线与基准:对比了基线单步监视器、DecomposedHarm 的时序监视器(sequential)及其提示变体、Arike 等(2026)的 eae,以及 Llama Guard 4 和 Qwen3Guard;数据源自 DecomposedHarm 与 AgentDojo。
- 本文定位:作者指出,现有基准要么只评测用户提示(如 DecomposedHarm),要么只评测智能体最终是否被攻陷而非监视器(如 AgentDojo),本文将两类威胁统一映射到带有双边标注危害窗口的轨迹级监视评测中。
- 智能体监视与 AI 控制:
论文如何解决这个问题?
形式化危害窗口与区间指标,对比动作视角与内容视角监视器。
整体思路是将轨迹级滥用监视形式化为统一检测问题,通过界定智能体动作层面的危害窗口,以区间指标衡量监视器在固定假阳性预算下的定位能力。
问题设定与形式化
- 交互与威胁表征:系统被建模为中央智能体 A、环境角色集合 E(含用户 U 与工具 T)及监视器 M 之间的轮次交互。在分解攻击中,用户将意图拆为 k 个子请求使得各子请求单独不违规但联合满足有害目标
\bigcup_{i=1}^k q_i \models h;在提示注入中,外部工具返回内容包含恶意文本。 - 危害窗口定义:在含有害意图 h 的轨迹中,作者定义三个关键时刻:证据起始 E(智能体首次承诺进行任何有害动作)、目标起始 O(智能体首次承诺达成最终有害意图 h)以及执行起始 Oexec(在 O 之后首个携带工具调用的动作,或 O 自身)。危害窗口定义为区间:
W(τ) = [E(τ), Oexec(τ)]其含义是从首次有害承诺到最终目标执行的完整区间,早于 E 告警记为过早(early),晚于 Oexec 记为过晚(late)。
监视器组件与核心变体
- 监视器三元组:监视器被定义为 M = (VM, CM, fM),其中 VM(τ) 为可见视图,CM 为触发节奏(Cadence),fM 为评分函数。
- 核心动作监视器:
- baseline:仅观察当前助手消息,并在每个包含内容的助手消息处评估助手当前动作的恶意程度。
- sequential:观察截至当前消息的全部历史,在每一轮消息处评估所有任务共同表达的恶意意图(内容视角)。
- sequential_action:观察截至当前消息的全部历史,但仅在助手消息处触发,明确要求仅评判助手当前动作本身,将用户和工具消息作为上下文。
- eae(抽取-评估):抽取器从历史中提取至少 5 处涉嫌违规的原文引用,评估器仅基于初始任务与抽取出的引用进行 0–100 打分。
- sp_* 系列与 Guard 模型:包括 DecomposedHarm 的 9 种内容视角提示变体,以及 Llama Guard 4(原生分类与论文策略列表)和 Qwen3Guard。
优化目标与成功判定
- 区间指标目标:在良性轨迹假阳性率受限于预算 α = 0.1 的约束下,最大化监视器首个告警落入危害窗口的概率:
maxM, θ P(t∗(θ) ∈ W(τ) ∣ yτ = 1) subject to: P(t∗(θ) < ∞ ∣ yτ = 0) ≤ α- 区间信用(Interval Credit):定义指示变量 ICθ(τ) := 1[t∗(θ) ∈ W(τ)],要求首个告警索引 t∗ 严格落在 [E, Oexec] 内才获得满分,落在区间外记为 0 分。
数据集构建细节
- 分解攻击轨(1,165 条主干轨迹):取自 DecomposedHarm 种子,由 Gemma 4 26B-A4B 以温度 0.3 补全动作并模拟 25 种固定工具调用输出;构建 hard 分割(582 条,按 0.5 概率交替插入良性子任务)及 refusal_twins(1,644 条拒绝孪生对照)。
- 提示注入轨(2,828 条轨迹):基于 AgentDojo 的 947 个任务对前缀,由 Gemma 4 续写为三种模式:完成注入且完成原任务(938 条)、完成注入且放弃原任务(943 条)、拒绝注入且完成原任务(947 条,良性类)。
- 窗口标注:分解轨的 E 标签由 Claude Opus 5 盲审给出,注入轨按构造规则设定 E = O。
- 交互与威胁表征:系统被建模为中央智能体 A、环境角色集合 E(含用户 U 与工具 T)及监视器 M 之间的轮次交互。在分解攻击中,用户将意图拆为 k 个子请求使得各子请求单独不违规但联合满足有害目标
论文做了哪些实验?
评估 17 种监视配置,动作视角泛化性显著优于内容视角。
论文在合成轨迹基准上系统评估了 17 种监视器配置及跨模型表现,揭示了内容视角在注入攻击上的崩溃及所有模型在危害定位上的缺陷。
实验设置
- 被测模型:主实验监视器涵盖 Gemma 4 26B-A4B、Qwen3.6 27B;核心臂进一步在 Qwen3.5 尺寸阶梯(2B、4B、9B、27B)、Mistral Small 3.2 24B、Llama 3.1 70B、GPT-5.6 Luna 与 Claude Haiku 4.5 上复现;护栏模型包括 Llama Guard 4 12B 与 Qwen3Guard-Gen 8B。轨迹生成模型固定为 Gemma 4 26B-A4B。
- 数据集与规模:基准包含约 6,200 条轨迹。分解轨 pooled 评估包含 1,164 条有害轨迹(其中 105 条无具体危害动作)与 525 条评估良性轨迹(58 条标定良性);提示注入轨包含 1,881 条有害轨迹与 853 条评估良性轨迹(94 条标定良性);拒绝孪生对照包含 1,644 条轨迹。
- 基线与监视臂:评估 14 种提示监视器(含 baseline、sequential、sequential_action、eae 及 9 种 sp_* 变体)与 3 种护栏配置。
- 指标与评审:报告位置盲 AUC、在良性 FPR ≤ 0.1 预算下的最大检出率(Recall)及区间信用(Interval Credit)。本地开源模型以温度 1 采样 5 次取均值,API 模型单次采样,Guard 模型由 unsafe 词元对数概率计算。
主结果
据 Table 2(Gemma 4 26B-A4B 监视器,前沿阈值 FPR ≤ 0.1):
表格较宽,可左右滑动
Arm 分解轨 AUC 分解轨 Recall 分解轨 Interval 注入轨 AUC 注入轨 Recall 注入轨 Interval baseline 0.904 0.784 0.334 0.921 0.815 0.624 sequential 0.960 0.956 0.166 0.521 † (0.63) — sequential_action 0.952 0.943 0.433 0.985 0.997 0.949 eae 0.953 0.932 0.495 0.990 0.995 0.900 sp_zeroshot 0.945 0.944 0.136 0.511 † (0.86) — sp_zeroshot_cot 0.958 0.949 0.261 0.585 0.220 0.000 sp_zeroshot_action 0.911 0.937 0.342 0.852 0.732 0.622 - 动作视角在跨威胁泛化上的表现:作者指出,关注智能体动作的 sequential_action 在分解攻击上 AUC 为 0.952,在注入攻击上达 0.985;而关注对话内容的 sequential 在注入攻击上 AUC 骤降至 0.521 且在 10% 预算下无操作点(最低 FPR 为 0.63)。
- 位置盲指标与区间指标的差异:作者指出,尽管各臂在分解攻击上召回率达 0.784–0.956,但其区间信用仅为 0.136–0.495;表明绝大多数传统告警并未精准落在危害窗口内。
告警时序与过早告警分析
- 测了什么:统计首个告警相对于危害窗口的落点分布,并测试在 E 之前放宽 g 个消息的宽限期影响(Figure 7、Table 12)。
- 结果:在分解攻击中,sequential 超过一半的首次告警发生在 E 之前(57% 落在有害证据前);放宽 4 个消息宽限期使 Gemma 上各臂区间信用提升 0.14–0.27(Table 12)。
- 作者解读:作者认为监视器并非反应迟钝,而是过度对准备性步骤告警;sequential 很大程度上是因为在 E 前一轮的用户请求处触发导致错失计分。
拒绝孪生(Refusal Twins)评测
- 测了什么:在智能体最终拒绝有害请求的轨迹前缀上测试监视器的假阳性触发率(Table 14、Table 15)。
- 结果:当拒绝发生在 E 时,动作视角模型与 Guard 模型在良性拒绝轨迹上的告警率依然高达 28%–48%(Table 14),远超 10% 的审计预算;sequential 在拒绝消息自身的打分高达 8.0–9.3 分。
- 作者解读:作者指出监视器无法正确理解智能体的拒绝行为,将带有有害词汇的拒绝声明误判为有害意图的确认。
护栏模型与模型规模扩展
- 测了什么:Llama Guard 4 与 Qwen3Guard 的跨威胁表现(Table 11),以及 Qwen3.5 尺寸阶梯(2B–27B)的主干表现(Table 10)。
- 结果:Llama Guard 4 在分解轨上 AUC 达 0.913–0.928,但在注入轨上降至 0.802–0.803;Qwen3Guard 在注入轨上 AUC 仅 0.634(Table 11)。在 Qwen3.5 阶梯上,sequential_action 在注入轨的区间信用从 2B 的 0.256 逐步上升至 27B 的 0.942(Table 10)。
- 作者解读:作者认为护栏模型的分类体系缺乏对提示注入导致的未授权动作的表征;能力增强提升了动作监视器的定位准确率。
其他消融与分析
- 在交替插入良性任务的 hard 分割上,各臂区间信用变动仅在 -0.05 至 +0.03 之间(附录 D.6)。
- 将危害窗口右端点从 Oexec 截断至 O,各臂区间信用下降不超过 0.07(Table 12)。
- 对 sequential 施加助手消息掩码后,Gemma 上区间信用从 0.166 升至 0.410(附录 D.10)。
- 思维链(CoT)使 Gemma 的输出词元增加 49 至 80 倍,AUC 仅增加 0.013 至 0.036,在 Qwen3.6 上甚至微幅下降(Table 16)。
- 离线对抗改写实验中,在固定阈值 5 下攻击者对 sequential_action 的逃逸率在注入和分解轨上分别为 2/40 和 0/40(Table 17)。
有什么可以进一步探索的点?
作者指出合成生成与 LLM 标注等局限,未来需探索活体对抗与新威胁。
论文讨论了合成数据、LLM 标注及静态对抗设置下的局限,并指出了扩展工作流与威胁类型的后续方向。
作者指出的局限与后续方向
- 单一生成模型偏置:数据集中的所有完成轨迹和工具模拟输出均由单一 Gemma 4 模型生成(Section 6、附录 E.7)。
- LLM 标注代替人工:分解攻击的证据起始标签全部由 LLM 评估器生成,在 40 条双标注样本上模型间确切索引一致率为 67.5%(Section 6)。
- 无法反映真实对抗鲁棒性:基准上的良好表现表明监视器可捕获无意违规,但不能反映面对主动、有意识对抗者时的鲁棒性(Section 6)。
- 合成工具输出的不真实性:生成模型在生成工具返回时已知晓攻击目标,生成结果与真实执行结果之间可能存在系统性差异(附录 E.7)。
- 静态轨迹对抗研究的受限性:对抗性实验仅在固定冻结的轨迹上改写文本,无法评估针对活体智能体重新引导交互的实时对抗者(附录 E.5)。
- 后续方向:未来工作应将基准扩展到更复杂的工作流与越狱(jailbreaks)等威胁类型,并开发跨威胁泛化、易于标定且能准确定位危害的监视器(Section 7)。
实验覆盖范围
- 被测模型范围:监视器模型覆盖 Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 阶梯(2B/4B/9B/27B)、Mistral Small 3.2 24B、Llama 3.1 70B、GPT-5.6 Luna、Claude Haiku 4.5 及两款开源安全 Guard 模型。
- 威胁类型范围:实验仅覆盖分解攻击与提示注入(均为重要的单智能体控制流变体),未测试多智能体级联攻击或越狱威胁。
- 数据与环境模拟:所有工具调用和执行环境均采用模型文本模拟,未接入实际代码执行、真实网络或真实数据库环境。
- 审计预算设置:实验主结果固定在 FPR ≤ 0.10 的预算下进行截断,论文报告了在 0.02 预算下大部分核心监视器无操作点。
- 论文未报告人工一致性:论文未报告人类专家与 LLM 标注起始点之间的一致性指标。
总结一下论文的主要内容
统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
本论文提出了面向 LLM 智能体滥用监视的统一形式化框架与包含约 6,200 条轨迹的评测基准。
- 核心定位与问题:针对现有智能体监视研究将分解攻击与提示注入割裂处理、且只测轨迹级拦截而忽视危害发生时机的问题,提出基于智能体动作视角的统一监视评估方法。
- 方法要点:定义了涵盖证据起始点 E 到执行起始点 Oexec 的危害窗口,提出区间信用指标并在 FPR ≤ 0.1 的审计预算下约束检测;构建了涵盖分解攻击(含交替混合任务与拒绝孪生)及提示注入(含任务拒绝对照)的统一数据集。
- 主要实验结果:
- 动作视角监视器(sequential_action)在分解轨与注入轨上分别实现 AUC 0.952 与 0.985(Table 2)。
- 内容视角监视器(sequential)在注入攻击上发生崩溃,AUC 降至 0.521 且在 10% 预算下无操作点(Table 2)。
- 传统位置盲指标掩盖了定位缺陷,在分解攻击上最优臂 eae 的区间信用仅为 0.495,sequential 仅为 0.166(Table 2)。
- 现有模型对拒绝理解不足,动作视角监视器在良性拒绝点 E 处仍产生 28%–48% 的假阳性告警(Table 14)。
- 作者结论与启示:作者认为将监视焦点从输入内容转向智能体外部化动作是实现跨威胁防御的关键,呼吁安全界重视时序定位精度与拒绝样本的过敏告警问题。