Janus:面向长时程智能体安全的前瞻性潜在风险预测框架
JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
Janus 用多智能体仿真与 CoAA-RL 训练前瞻守卫 Vanguard,在四个智能体安全基准上把平均 ASR 降到 0.071,并提高良性任务完成率。
运行时守卫在工具调用执行前介入。风险可来自用户指令、环境工件(间接提示注入等)或智能体自身;守卫只看到轨迹前缀,须在有害动作执行前拦截。
- 工具型智能体的伤害常在多步之后才出现,事后审查来不及阻止删文件、泄密或破坏环境。长程安全需要在有害动作执行前,从轨迹前缀预判延迟风险。
- Janus 用多智能体仿真合成用户、环境和智能体来源的轨迹,再用 CoAA-RL 联合训练前瞻与裁决:前瞻摘要既要贴近真实后续,也要提高下游安全判断。推理时 Vanguard 先预测未来摘要,再给出安全标签并在执行前拦截。
- Table 1 中 Vanguard 在四个基准上 ASR 均为最低,平均 ASR 为 0.071,平均保护率比六个守卫基线高 15.9 个百分点;AgentDojo 良性 Utility 为 0.680,比守卫基线均值高 5.1 个百分点。去掉前瞻或解耦奖励后 ASR 上升。
- 训练轨迹来自仿真而非已部署系统,未必覆盖真实工具反馈与用户交互。评测限于固定的智能体骨干、工具环境和基准风险场景,对未见工具、新的对抗适应和差异很大的安全策略的泛化未充分刻画。
- 威胁模型
- 运行时守卫在工具调用执行前介入。风险可来自用户指令、环境工件(间接提示注入等)或智能体自身;守卫只看到轨迹前缀,须在有害动作执行前拦截。评测含对抗提示注入与自适应长程攻击。
- 模型
- VanguardQwen3-8BLlama-Guard-3-8BQwen3Guard-Gen-8BTS-GuardSandwich DefenseLlamaFirewallQwen3-32B
- 基准
- AgentDojoAgent-SafetyBenchAgentLABLPS-Bench
- 指标
- ASRUtilityprotection rate (1−ASR)
研究者提出 Janus,一个面向长时程智能体安全的前瞻性框架,通过多智能体模拟合成多样化轨迹,训练护栏模型从部分轨迹中预判延迟风险。Janus 联合优化风险预判与安全裁决两项任务,采用 CoAA-RL 以预判对下游安全判断的效用作为奖励。所得护栏模型 Vanguard 可在动作执行前拦截不安全行为,在四个智能体安全基准上平均防护能力较基线护栏提升 15.9 个百分点,同时良性任务完成率提升 5.1 个百分点。
深度解读
这篇论文试图解决什么问题?
长程智能体的风险往往延迟出现,守卫需要在有害动作执行前从轨迹前缀预判并拦截。
长程工具型智能体的不安全动作往往很晚才显现,现有守卫多在伤害发生时或之后才判定,无法及时阻止。
- 场景与重要性:作者认为,OpenClaw、Codex、Claude Code 等智能体可改代码、调用工具、访问文件并与外部系统交互,失败是操作性的:一次不安全动作就可能删除文件、泄露隐私、破坏环境或中断生产服务。运行时监督必要,但执行之后的监督常常太晚。核心挑战是在有害动作发生之前识别不安全执行状态。
- 现有方法的不足:LlamaFirewall 检查智能体工作流中的安全威胁,ShieldAgent 在执行轨迹上验证安全策略,说明安全要覆盖中间状态、工具调用和环境观察。作者认为多数方法仍是反应式的(Chen et al. 2026b; Huang et al. 2025; Mou et al. 2026):它们评估轨迹里已经出现的行为,而长程任务中早期信号可能要很多步之后才升级为伤害。
- 核心观察:作者以“软件包修改必须留在虚拟环境内、但智能体后来改了全局 Python 环境”为例,认为风险动作出现得很晚,约束却更早出现。因此守卫要把早期上下文和延迟后果连起来。语言世界模型(Qwen-AgentWorld)可预测未来状态,作者据此把前瞻专门用于安全。
- 论文提出什么:作者提出 Janus,用多智能体仿真合成涵盖用户、环境、智能体来源风险的长程轨迹,并以 CoAA-RL 联合训练前瞻任务与裁决任务。得到的守卫模型 Vanguard 在推理时做两阶段预测判断,在不安全动作执行前拦截。
- 威胁模型:
- 受害系统:采用 ReAct 式执行循环的工具型 LLM 智能体;守卫在每个轨迹步骤、候选动作执行前被查询。
- 攻击者目标与风险来源:阻止三类风险变成已执行的有害动作。用户来源指指令本身编码有害目标;环境来源指不安全目标出现在工具输出、检索文件或邮件等外部工件中(含间接提示注入等);智能体来源指在含糊或不完美指令下,即使没有恶意意图也会产生不安全动作。
- 知识与能力:评测沿用各基准设定。AgentDojo 使用 important_instructions 攻击;AgentLAB 含 tool_chaining 与 memory_poisoning 两类自适应长程攻击,规划器、攻击者与评审按官方默认设置。论文未把守卫的部署知识写成 white-box、black-box 或 gray-box。
- 成功判定:守卫从用户指令和已观察轨迹前缀预测安全标签;拦截发生在动作执行之前。攻击成功按各基准的 ASR 定义,例如到达基准定义的不安全状态,或在守卫介入前执行了不安全动作。
有哪些相关研究?
相关工作分为智能体守卫与面向推理和对齐的强化学习;Janus 用群体相对强化学习把前瞻绑到步骤级安全裁决上。
智能体守卫与风险评测
- 基准:AgentDojo、InjecAgent、AgentHarm 评测间接提示注入、不安全工具输出和有害多步任务(Debenedetti et al. 2024; Zhan et al. 2024; Andriushchenko et al. 2025)。引言还提到指令层级攻击(Wallace et al. 2024)、工具使用导向与数据外泄(Debenedetti et al. 2024),以及记忆/上下文投毒和资源耗尽(Zhang et al. 2025)。
- 框架级防御:LlamaFirewall、GuardAgent、ShieldAgent、AGrail 提供检测攻击、检查对齐或把策略翻译成可执行约束的守卫框架(Chennabasappa et al. 2025; Xiang et al. 2024; Chen, Kang, and Li 2025; Luo et al. 2025)。另有方法在执行中检查计划、轨迹或工具调用(Huang et al. 2025; Luo et al. 2026; Liu et al. 2026a; Mou et al. 2026)。
- 预测式监控:SafePred 通过世界模型为计算机使用智能体预测未来风险(Chen et al. 2026b)。Qwen-AgentWorld 建模智能体–环境动态以预测未来状态(Zuo et al. 2026)。作者称,与这些往往依赖预定义规则、完整轨迹、候选动作或特定环境的方法不同,本文学习哪些未来延续对步骤级安全干预有用。
面向推理与安全的强化学习
- 偏好对齐:RLHF 用人类偏好比较学到的奖励优化遵循指令的模型(Ouyang et al. 2022);Constitutional AI 用原则引导的 AI 反馈做 RLAIF 式对齐(Bai et al. 2022);DPO 把偏好对齐写成直接优化目标,训练时不做在线强化学习采样(Rafailov et al. 2023)。
- 群体相对与过程奖励:GRPO 在同一问题组内比较多个采样解,DeepSeekMath 用它改进数学推理(Shao et al. 2024)。Stable Adaptive Thinking 用优势整形和长度感知的梯度调节来稳定推理长度优化(Xu et al. 2026)。TabSieve 联合优化表内证据选择与预测正确性(Wang et al. 2026a)。作者称 Janus 与这些方法不同:它把群体相对强化学习用于预测式守卫,把前瞻奖励和裁决奖励耦合,使未来摘要只在能改善有害动作执行前的安全决策时得到优化。
数据合成与智能体自身风险
- 仿真合成:作者用基于仿真的多智能体流水线合成高风险轨迹(Li et al. 2023; Tang et al. 2025; Zheng et al. 2023),执行循环采用 ReAct 风格(Yao et al. 2022)。用户来源风险按伤害领域组织(Ghosh et al. 2025),并引用 HarmBench(Mazeika et al. 2024)与 AgentHarm。智能体来源的典型失败包括忽视潜在依赖、过于拘泥字面指令、依据错误假设行动和生成低效计划(Zhang et al. 2024; Chen et al. 2026a; Liu et al. 2026a)。
基线方法与基准
- 基线方法:守卫模型为 Qwen3-8B、Llama-Guard-3-8B、Qwen3Guard-Gen-8B、TS-Guard,检测到不安全行为即终止执行;框架级防御为 Sandwich Defense 与 LlamaFirewall,使用各自默认干预机制;另有 no-guard 参照。
- 基准/数据集:AgentDojo、Agent-SafetyBench、AgentLAB、LPS-Bench。消融另在 AgentDojo、AgentLAB、LPS-Bench 上进行。
作者把预测式守卫定位为长程智能体安全的核心需求:风险来自延迟后果而不是即时的有害意图;Janus 把仿真长程轨迹与 CoAA-RL 结合起来训练 Vanguard。
论文如何解决这个问题?
Janus 先仿真标注三类风险轨迹,再用 CoAA-RL 把前瞻摘要的奖励绑到下游安全裁决效用上。
Janus 由两部分组成:基于仿真的轨迹合成流水线,以及用两个耦合任务联合训练共享守卫策略的强化学习框架 CoAA-RL。推理时 Vanguard 先从轨迹前缀预测安全相关的未来摘要,再据此裁决并在执行前拦截。
问题设定与风险分类
- 形式化:每个训练样本为 (x, τpre, s, y)。x 是用户指令,τpre 是已观察轨迹前缀,s 是后续轨迹的自然语言摘要,y 是安全标签。共享策略 πθ 用任务指示 m∈{A, D} 区分前瞻模式与裁决模式。
- 三类来源:Table 4 按不安全行为从哪里产生分类。用户来源是指令编码有害目标,常伪装成业务或效率任务,伤害领域包括 cyber abuse、fraud、harassment、hate、sexual exploitation、disinformation、copyright abuse、drugs、violence、terrorism。环境来源出现在工具输出、检索文件或邮件中,细类包括 prompt injection、Goal Hijack、Tool-use steering、Data exfiltration、Memory poisoning、Resource exhaustion。智能体来源在指令含糊或不完美时出现,细类包括 Planning Failure、Instruction-Following Failure、Incorrect assumption,以及 Missing clarification、Scope expansion、Preparation-to-execution escalation、High-impact default。
- 场景表示:给定生成策略 π,场景 c = (x, T, r, e)。T 是可用工具集合,r 是评价标准,e 只在环境来源样本中实例化,表示环境注入策略。
仿真数据构建
- 场景构造:Manager 把策略拆成子任务。Instructor 生成用户指令,ToolDesigner 指定工具环境,Grader 生成评价标准;环境来源样本由 EnvInjector 指定风险内容如何经工具输出或环境工件注入;多轮样本由 Decomposer 把指令拆成共同追求同一风险目标的多轮用户回合。合成不执行真实工具。
- 轨迹展开与质控:Executor 按 ReAct 式循环展开轨迹;工具被调用时,Simulator 根据工具模式、调用参数和此前轨迹返回结构化观察,环境来源样本则按 e 把风险内容嵌入观察。Reviewer 按任务一致性、风险覆盖和轨迹完整性做拒绝采样,三项都满足才保留;失败则重生成,直到通过或达到最大重试次数。Reviewer 指出具体问题时,Manager 纳入反馈并重新分派相应子任务。论文未给出该重试上限的数值。
- 步骤级标注:对每条通过审核的轨迹 τ,在关键决策点把轨迹分成执行前缀 τpre 与后续 τafter。Safe 表示任务可以在无有害执行的情况下继续;Unsafe 表示智能体已经表达了执行有害动作的明确意图;Potential Unsafe 表示前缀有非平凡风险但缺少明确有害意图。同时生成描述风险如何展开的摘要 s。全部标注由 GPT-5.5 产生。由此得到 75,180 条训练样本:Safe 34,100、Unsafe 18,665、Potential Unsafe 22,415。
- Figure 2 的分布:用户来源 55.0%(其中 Cyber abuse 14.6%、Fraud 9.6%、Disinformation 7.4%、Violence 5.7%、Harassment 4.5%、Others 13.1%);环境来源 29.2%(prompt injection 9.6%、Goal Hijack 6.3%、Tool-use steering 4.8%、Data exfiltration 4.1%、Others 4.5%);智能体来源 15.8%(Planning Failure 5.7%、Instruction-Following Failure 4.3%、Incorrect assumption 3.6%、Others 2.2%)。安全标签为 Safe 45.4%、Potential unsafe 29.8%、Unsafe 24.8%。
CoAA-RL:耦合的前瞻与裁决
- 前瞻任务:给定 (x, τpre),采样 GA 个未来摘要 Sk。摘要抽象未来执行路径,应捕捉高风险工具调用、跟随环境注入、范围扩张或不安全后果性动作,而不是逐步复述。用双向 NLI 相似度 Sim(Sk, s) 衡量与真实后续摘要的一致性(Laban et al. 2022; Zha et al. 2023)。
- 裁决任务:对每个 Sk 采样 GD 个裁决 Jk,j,解析为预测标签 ŷk,j 和简短理由。裁决奖励为 r^D_{k,j} = λD ℓ_{k,j} + (1−λD) ϕ_{k,j},其中 ℓ 是标签正确性,ϕ 是格式有效性。某条摘要的效用 uk 是以它为条件时裁决奖励的平均。前瞻奖励为 r^A_k = (1−λA) Sim(Sk, s) + λA uk。λA 调节未来一致性与裁决效用的折中。论文未在正文给出 GA、GD、λD 的取值;主设置使用 λA = 0.5(Figure 4)。
- 群体相对联合优化:两类任务都用 GRPO(Shao et al. 2024)。前瞻优势在同一轨迹前缀的 GA 个摘要之间计算;裁决优势在某个裁决奖励方差非零的前瞻组 k̃ 内计算。联合目标为 θ⋆ = arg min_θ [L^A_GRPO(θ) + η L^D_GRPO(θ)],η 控制裁决目标的相对权重。论文未报告 η 的取值。作者称,因为共享 πθ,前瞻会关注对安全裁决重要的事件,裁决奖励则把前瞻推向对决策有用的预见。
推理时的两阶段判断
- 流程:每个轨迹步骤,Vanguard 先由前瞻模式解码出 ŝ,再在 (x, τpre, ŝ) 上解码裁决 Ĵ,解析为安全标签 ŷ 和简短理由。推理时没有真实后续,裁决只依赖已观察前缀和模型自己预期的未来摘要。
- 干预:评测中守卫在候选动作执行前被查询;守卫模型基线在检测到不安全行为后终止执行。附录给出了样本生成、前瞻、裁决等提示词模板,此处不复述其具体约束。
论文做了哪些实验?
Vanguard 在四个基准上平均 ASR 为 0.071,均为最低;AgentDojo 良性 Utility 为 0.680,与无守卫持平。
实验设置
- 被测对象:防御方法为 Vanguard、Qwen3-8B、Llama-Guard-3-8B、Qwen3Guard-Gen-8B、TS-Guard、Sandwich Defense、LlamaFirewall,以及 No Guard。它们被加在 ReAct 式 LLM 智能体上。消融写明在 Qwen3-32B 下进行。论文未在正文写明主实验里被守卫的智能体骨干的具体模型名;Limitations 称评测限于一组固定的 agent backbones。
- 基准规模:AgentDojo 为 97 个良性实例和 949 个对抗实例,攻击类型为 important_instructions。Agent-SafetyBench 为官方 2,000 例。AgentLAB 为 400 个对抗实例,tool_chaining 与 memory_poisoning 各 200。LPS-Bench 从官方仓库采样 570 例。
- 指标:AgentDojo 报告良性任务 Utility(官方任务成功评价器)和对抗任务 ASR(官方注入成功评价器)。其余三个基准以 ASR 为主。保护率定义为 1−ASR。Utility 越高越好,ASR 越低越好。
- 评审:Agent-SafetyBench 用 ShieldAgent judge 给出 safe/unsafe,若智能体到达基准定义的不安全状态,或在守卫介入前执行不安全动作,则计为攻击成功。AgentLAB 的规划器、攻击者和评审使用官方代码与官方默认模型,论文未写出这些默认模型的名称;ASR 为自适应攻击目标达成的回合比例。LPS-Bench 用官方评价器的 PASS/FAIL 与执行状态信号计算 ASR。
- 训练数据:75,180 条逐步标注样本。论文未报告训练重复次数、评测随机种子或主实验查询次数。
主结果
据 Table 1(Utility 越高越好,ASR 越低越好):
表格较宽,可左右滑动
Guard AgentDojo Util ↑ AgentDojo ASR ↓ Agent-SafetyBench ASR ↓ AgentLAB ASR ↓ LPS-Bench ASR ↓ No Guard 0.680 0.167 0.293 0.287 0.842 Qwen3-8B 0.588 0.066 0.128 0.122 0.323 Llama-Guard-3-8B 0.588 0.069 0.127 0.140 0.381 Qwen3Guard-Gen-8B 0.680 0.151 0.159 0.220 0.500 TS-Guard 0.619 0.080 0.102 0.163 0.332 Sandwich Defense 0.701 0.109 0.255 0.287 0.844 LlamaFirewall 0.598 0.062 0.218 0.145 0.530 Vanguard 0.680 0.054 0.068 0.087 0.075 - 作者的汇总:四个 ASR 列平均后,Vanguard 的平均 ASR 为 0.071,六个守卫基线为 0.230,无守卫参照为 0.397。以 1−ASR 为保护率,Vanguard 比守卫基线的平均保护率高 15.9 个百分点。AgentDojo 良性任务上,Vanguard 的 Utility 为 0.680,比守卫基线均值 0.629 高 5.1 个百分点,并与无守卫参照相同。
- 相对逐步守卫模型:作者称 Qwen3-8B、Llama-Guard-3-8B、Qwen3Guard-Gen-8B、TS-Guard 主要依据已观察轨迹判断,四个基准上的平均 ASR 在 0.160 到 0.258。相对每个基准上最强的逐步模型,Vanguard 把 ASR 从 AgentDojo 的 0.066 降到 0.054、Agent-SafetyBench 的 0.102 降到 0.068、AgentLAB 的 0.122 降到 0.087、LPS-Bench 的 0.323 降到 0.075。作者认为增益在 LPS-Bench 上尤其突出,说明预判延迟后果对长程规划安全特别重要。AgentDojo Utility 与无守卫和 Qwen3Guard-Gen-8B 同为 0.680,同时把该基准 ASR 从 Qwen3Guard-Gen-8B 的 0.151 降到 0.054。
- 相对框架级防御:Sandwich Defense 在 AgentLAB、LPS-Bench 上 ASR 为 0.287 和 0.844;LlamaFirewall 在 Agent-SafetyBench、AgentLAB、LPS-Bench 上为 0.218、0.145、0.530。Vanguard 在这三个基准上为 0.068、0.087、0.075。AgentDojo Utility 为 0.680,比 Sandwich Defense 的 0.701 低 0.021,高于 LlamaFirewall 的 0.598。作者称学到的轨迹级前瞻提供了更强防护,且没有牺牲良性任务表现。Table 1 中 Sandwich Defense 的 AgentDojo Utility 是防御方法里最高的一格,其 LPS-Bench ASR 0.844 高于 No Guard 的 0.842。
前瞻与耦合奖励消融
Table 2 在 Qwen3-32B 上比较 AgentDojo、AgentLAB、LPS-Bench。Oracle 使用真实未来后续,作者称为不可部署的上界。
表格较宽,可左右滑动
设置 AgentDojo Util AgentDojo ASR AgentLAB ASR LPS-Bench ASR Vanguard 0.680 0.054 0.087 0.075 w/o Anticipation 0.526 0.092 0.142 0.211 w/o Infer. Sum. 0.557 0.078 0.128 0.164 w/ Oracle Sum. 0.680 0.041 0.063 0.052 Sim-only 0.351 0.089 0.151 0.194 Util-only 0.392 0.081 0.134 0.172 Decoupled 0.639 0.104 0.175 0.484 - RQ1:作者报告,去掉训练时的前瞻任务后,三基准平均 ASR 从 0.072 升到 0.148,AgentDojo Utility 从 0.680 降到 0.526;推理时去掉未来摘要则平均 ASR 升到 0.123、Utility 降到 0.557。Oracle 摘要把平均 ASR 进一步降到 0.052。作者认为准确的未来信息可以明显改善裁决,Vanguard 通过 CoAA-RL 内化对决策有用的前瞻,从而接近这一上界。
- RQ2:Sim-only 只用生成摘要与真实未来摘要的相似度;Util-only 只用裁决效用;Decoupled 把两个任务分开训练。作者称相对 Vanguard,Sim-only 使 AgentDojo Utility 下降 48.4%、平均 ASR 上升 101.9%;Util-only 使 Utility 下降 42.4%、平均 ASR 上升 79.2%。Decoupled 仍有较高的 AgentDojo Utility 0.639,但平均 ASR 从 0.072 升到 0.254,LPS-Bench 上退化最大(0.484)。作者认为需要把摘要保真度和裁决有用性耦合起来的奖励,而不是单独优化任一目标。
前缀预算下的早期预测
Table 3 仍是步骤级评测,但守卫只能看到完整执行的 25%、50%、75% 或 100% 前缀。表中 LlamaGuard、QwenGuard 对应正文的 Llama-Guard 与 QwenGuard 写法,论文未逐列改写成 Table 1 的全名。
表格较宽,可左右滑动
前缀 Guard AgentDojo Util AgentDojo ASR AgentLAB ASR LPS-Bench ASR 25% Vanguard 0.639 0.141 0.200 0.498 25% LlamaGuard 0.649 0.162 0.242 0.640 25% QwenGuard 0.623 0.154 0.253 0.331 25% TS-Guard 0.649 0.163 0.235 0.842 50% Vanguard 0.670 0.072 0.172 0.279 100% Vanguard 0.680 0.054 0.087 0.075 - 作者的解读:Vanguard 在三个基准上的平均 ASR 从 25% 前缀的 0.280 降到 50%、75%、100% 的 0.174、0.121、0.072。25% 时证据稀疏,Vanguard 已在 AgentDojo 和 AgentLAB 上 ASR 最低,但 LPS-Bench 上 QwenGuard 为 0.331,低于 Vanguard 的 0.498;作者认为规划风险往往需要更晚的上下文证据。从 50% 起 Vanguard 在三个基准上都取得最好 ASR;100% 前缀时平均 ASR 相对最强基线降低 57.6%(相对降幅,作者的说法)。
- 50% 与 75% 的其余格子(Table 3):50% 时 LlamaGuard 为 Util 0.598、ASR 0.108 / 0.203 / 0.461;QwenGuard 为 0.662、0.151 / 0.245 / 0.516;TS-Guard 为 0.649、0.167 / 0.217 / 0.440。75% 时 Vanguard 为 0.629、0.062 / 0.150 / 0.151;LlamaGuard 为 0.588、0.069 / 0.313 / 0.523;QwenGuard 为 0.611、0.134 / 0.245 / 0.502;TS-Guard 为 0.629、0.117 / 0.193 / 0.393。100% 时 LlamaGuard 为 0.588、0.069 / 0.140 / 0.381;QwenGuard 为 0.680、0.151 / 0.155 / 0.353;TS-Guard 为 0.619、0.080 / 0.145 / 0.284。100% 的 QwenGuard 与 Table 1 的 Qwen3Guard-Gen-8B 数字并不相同,论文未说明二者是否为同一模型、同一设置。
其他消融与分析
- λA(Figure 4,RQ3):λA = 0 时 AgentDojo Utility 为 0.351、平均 ASR 为 0.145;λA = 1 时 Utility 为 0.392、平均 ASR 为 0.129。λA = 0.25 时平均 ASR 降到 0.078、Utility 升到 0.567。λA = 0.50 时 Utility 最高,为 0.680,平均 ASR 为 0.072。λA = 0.75 时平均 ASR 最低,为 0.034,但 Utility 降到 0.464。作者认为中等范围内方法是稳健的,平衡摘要保真与裁决有用性才能同时保住良性任务表现和防护;λA = 0.75 对应更保守、可能过度拦截良性任务的守卫。Figure 4 的曲线形状在纯文本中不可见,上述数值来自正文。
- Table 2 未包含 Agent-SafetyBench,前缀实验同样未包含该基准。论文未报告统计显著性检验。
有什么可以进一步探索的点?
作者指出仿真轨迹和固定骨干、工具与基准场景限制了对真实部署与新对抗的泛化判断。
作者指出的局限与后续方向
- 仿真而非部署数据:Limitations 写明,训练轨迹由多智能体仿真构造,而不是从已部署的智能体系统采集。仿真可以控制风险来源并合成多样的长程失败,但可能无法完全捕捉真实部署中的工具行为、环境反馈和用户交互分布。
- 泛化范围:Limitations 写明,评测仍限于一组固定的 agent backbones、工具使用环境和基准定义的风险场景,因此没有充分刻画所学的前瞻–裁决策略对未见工具、新形式的对抗适应,或与数据构建和评测中所用策略差异很大的安全策略的泛化。论文未另列 Future Work 专节;Conclusion 称这些发现把未来风险前瞻标为构建主动、轨迹感知的工具型智能体安全措施的关键能力,没有给出额外的实验计划。
实验覆盖范围
- 主评测:四个基准上比较 Vanguard、四种逐步守卫模型、Sandwich Defense、LlamaFirewall 和 No Guard(Table 1)。规模为 AgentDojo 97 个良性实例与 949 个对抗实例、Agent-SafetyBench 2,000 例、AgentLAB 400 个对抗实例、LPS-Bench 570 例。
- 消融与敏感性:前瞻有无、推理摘要有无、Oracle 摘要、Sim-only、Util-only、Decoupled 报告在 AgentDojo、AgentLAB、LPS-Bench 上,并写明在 Qwen3-32B 下进行(Table 2)。λA 取 0、0.25、0.50、0.75、1(Figure 4 与正文)。前缀预算为 25%、50%、75%、100%(Table 3)。
- 训练规模与标签:75,180 条样本,Safe / Unsafe / Potential Unsafe 分别为 34,100 / 18,665 / 22,415;Figure 2 给出三类风险来源及若干细类比例。标注模型为 GPT-5.5。
- 论文未报告的设置:正文未给出 GA、GD、λD、η、Reviewer 最大重试次数,也未报告主实验被守卫智能体的具体模型名称、AgentLAB 官方默认评审模型的名称、重复次数或显著性检验。Table 3 的 100% 前缀与 Table 1 的同名方向数字不完全一致,论文未解释这一差异。
总结一下论文的主要内容
Janus 用仿真轨迹和 CoAA-RL 训练前瞻守卫 Vanguard,在四个基准上降低 ASR,并保持 AgentDojo 良性 Utility。
Janus 是一套面向长程智能体安全的前瞻式守卫训练框架,产物是在动作执行前拦截的模型 Vanguard。
- 问题:工具型智能体的失败是操作性的,不安全动作可能很晚才出现。作者认为反应式守卫评估的是轨迹中已经发生的行为,等到危险步骤再报警就来不及阻止伤害。
- 方法:仿真流水线按用户、环境、智能体三类来源生成轨迹,不调用真实工具,并由 Reviewer 按一致性、风险覆盖和完整性过滤;GPT-5.5 把决策点前缀标成 Safe、Unsafe 或 Potential Unsafe,共 75,180 条。CoAA-RL 让共享策略同时做未来摘要和安全裁决,前瞻奖励把摘要与真实后续的 NLI 相似度,同该摘要带来的裁决效用加在一起,再用 GRPO 联合更新。推理时模型先写出未来摘要,再给出标签和简短理由。
- 主结果:Table 1 中 Vanguard 的 ASR 在四个基准上都最低:AgentDojo 0.054、Agent-SafetyBench 0.068、AgentLAB 0.087、LPS-Bench 0.075,四基准平均 ASR 为 0.071。作者报告其平均保护率比六个守卫基线高 15.9 个百分点;AgentDojo 良性 Utility 为 0.680,与无守卫相同,比守卫基线均值高 5.1 个百分点。Sandwich Defense 的 AgentDojo Utility 更高,为 0.701。
- 消融:去掉前瞻或在推理时去掉摘要,三基准平均 ASR 从 0.072 升到 0.148 或 0.123(Table 2)。只优化相似度、只优化裁决效用或把两任务解耦,都会提高平均 ASR,解耦后 LPS-Bench ASR 为 0.484。λA = 0.5 时 Utility 为 0.680、平均 ASR 为 0.072;λA = 0.75 时平均 ASR 为 0.034,Utility 降到 0.464。25% 前缀时 LPS-Bench 上 Vanguard 的 ASR 高于 QwenGuard。
- 作者的结论:作者认为预测式守卫能在降低攻击成功的同时保留良性任务效用,未来风险前瞻是构建主动、轨迹感知防护的关键能力。作者同时指出,轨迹来自仿真,评测限于固定骨干、工具环境和基准风险场景。