论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%
GHOST:长程智能体在良性对话中遗忘早期安全约束
研究智能体跨轮遗忘约束的 GHOST,GPT-5.5 在 SCARBench 达 11.5% GHOST 率,双层防御降至 0。
设定为良性智能体环境(benign agent setting),无恶意攻击者(no malicious attack)。
- 长程工具使用智能体在多轮良性交互后恢复执行任务时,往往会遗忘先前轮次设定的安全约束,导致不可逆的违规执行危害(GHOST)。
- 基于条件进入风险与几乎必然违规的理论模型,提出结合在线语义约束提取恢复与运行时确定性拦截修复的双层防御 STAR-Guard。
- 在包含 103 个场景的 SCARBench 上,GPT-5.5 的 GHOST 率为 11.5%,STAR-Guard 将其降低至 0.0% 并将安全完成率提升至 94.0%。
- 执行前审计提供的是动作局部的条件保证而非无条件端到端安全,强确定性干预会部分影响任务完成度,且规则表达目前局限于前置与禁止类型。
- 威胁模型
- 设定为良性智能体环境(benign agent setting),无恶意攻击者(no malicious attack)。用户为良性用户(benign user),历史对话与工具输出不含对抗性指令(no adversarial instructions),用户权限不变;执行风险来自长交互历史导致模型在恢复执行任务时遗漏前期设定的安全约束。
- 模型
- GPT-5.5DeepSeek-V4-ProGLM-5.2Kimi-K2.6Qwen-3.6Qwen3.5-4BLlama-3.1-8B
- 基准
- SCARBench
- 指标
- Safe Completion (SC)Unsafe Completion (UC)GHOSTSafe Non-completion (SN)Unsafe Attempt (UA)Execution Failure (EF)Δint
论文识别并形式化了一种长程智能体失效模式 GHOST,即安全约束在早期对话中提出后,任务在后续良性交互中被恢复执行时该约束不再生效,导致不安全执行。作者提出 SCARBench 基准,包含 6 类工具使用域的 103 个场景、412 个匹配条件实例,长历史为 6,000–6,176 tokens、56–160 轮。在无攻击、用户良性的条件下,7 个受测模型均出现 GHOST,发生率从 Kimi-K2.6 的 6.8% 到 Qwen3.5-4B 的 27.8%;GPT-5.5 的严格 GHOST 率为 11.5%,其 Long Explicit 安全完成率 88.7%,当约束只能从长历史中恢复时安全完成率下降 12.4 个百分点。理论部分用条件风险框架证明,若安全前缀上的残余违规风险下界不可求和,执行几乎必然进入危险区域。
推荐理由论文给出 GHOST 在 7 个模型上的发生率与可复现基准,部署长程 Agent 的团队可据此检查历史安全约束是否仍生效。
深度解读
这篇论文试图解决什么问题?
研究长程智能体在良性多轮交互中恢复任务时遗忘早期安全约束的 GHOST 失效模式与治理危害。
长程工具使用智能体在多轮良性交互后恢复执行任务时,容易遗忘先前轮次设定的安全约束,导致产生破坏性的违规执行行为。
- 场景与重要性:智能体在多轮长程交互中能够基于历史上下文直接恢复任务而无需用户重复详细指令;但安全约束一旦被跨轮违规执行,可能导致未授权删除邮件、破坏数据库等不可逆后果(作者引述实际案例),破坏用户信任。
- 现有方法局限:现有指令遵循研究缺乏在漫长交互历史中定位历史安全约束并将其作用于后续任务的机制;现有智能体安全基准主要关注提示注入等恶意攻击,未覆盖良性交互下的执行安全治理失效。
- 理论观察与假设:作者在理论上将安全约束映射为危险区域,指出若每个安全前缀上的残留条件违规风险存在非可和下界,执行轨迹在数学上几乎必然(almost surely)进入危险区域。
- 论文解决方案:构建了首个针对该场景的评测基准 SCARBench(103 个基础场景、412 个匹配实例),并提出了耦合历史语义安全约束恢复与执行前确定性审计的双层防御架构 STAR-Guard。
- 威胁模型:论文明确设定为良性智能体环境(benign agent setting),非恶意攻击驱动。
- 受害系统与目标:部署在长程多轮交互中的工具使用智能体,其目标是依据用户后续指令恢复完成任务。
- 攻击者与知识:论文强调无恶意攻击者(no malicious attack),用户为良性用户(benign user),对话历史与工具返回中均无对抗性指令(no adversarial instructions)。
- 权限与约束状态:用户权限始终保持不变,初始设立的安全约束除非被用户明确更新或撤销,否则在后续交互中持续有效。
- 风险机制与判定:上下文增长与压缩非攻击者诱导;当模型在显式给出约束时能安全完成,但在仅能从历史中检索约束时违规完成,即判定为 GHOST 事件。
有哪些相关研究?
涵盖长上下文指令保持、智能体安全基准与防御、无限时界安全分析及通用记忆与自我修正基线。
相关研究主要围绕长上下文指令保持、智能体安全基准与防御、无限时界安全分析展开。
长上下文指令与约束保持
- Followbench(Jiang et al., 2024)与 InfoBench(Qin et al., 2024)测试模型对显式细粒度需求的满足能力;MultiChallenge(Deshpande et al., 2025)与 StructFlowBench(Li et al., 2025)评估多轮长对话中指令与跨轮依赖的衰减。
- RULER(Hsieh et al., 2024)与 Li et al. (2024) 关注大上下文窗口下模型对早期信息的实际利用能力;Arike et al. (2025) 研究智能体长时间运行中的目标漂移(goal drift)。
- BM25(Robertson and Zaragoza, 2009)、Self-Refine(Madaan et al., 2023)与 DeCRIM(Ferraz et al., 2024)探索通过检索与自我修正恢复历史要求;作者指出检索可能选错轮次,修正无法检查未成功恢复的约束,且未能将任务完成与约束执行解耦评估。
智能体安全基准与策略防御
- ToolEmu(Ruan et al., 2024)、AgentDojo(Debenedetti et al., 2024)、AgentHarm(Andriushchenko et al., 2025)与 SafeAgentBench(Yin et al., 2024)评估高危工具使用、提示注入与有害规划;作者指出它们主要关注对抗攻击,未覆盖良性交互执行安全。
- TrustAgent(Hua et al., 2024)、GuardAgent(Xiang et al., 2025)、ShieldAgent(Chen et al., 2025)与 AgentSpec(Wang et al., 2025)引入结构化策略推理与运行时执行拦截;作者指出其大多预先假设安全策略在决策时已知且直接提供,忽略了长历史造成的约束分离。
无限时界随机安全分析
- POMDP 随机系统安全分析(Chatterjee et al., 2010)与贝叶斯神经网络无限时界安全(Lechner et al., 2021)研究在缺乏绝对安全区域时残留转移风险如何导致长期安全概率趋于零,为本文提供了条件风险理论依据。
基线方法与评测基准
- 论文对比的基线包括 Prompt Reminder、BM25 Top-3(Robertson and Zaragoza, 2009)、DeCRIM(Ferraz et al., 2024)、LIGHT Three-Memory(Tavakoli et al., 2025)、VerIFY-Summarize(Robinette et al., 2026),以及享有真实约束/验证器特权的 Oracle 对照方法 TrustAgent(Hua et al., 2024)与 DVR(Zhang et al., 2025);测试基准为论文构建的 SCARBench。
作者将本文与现有工作的核心区别定位于:专门解耦任务完成与安全约束遵循,研究“任务仍可执行且成功完成,但先前约定的安全约束未对执行起效”的良性长程治理失效。
论文如何解决这个问题?
基于条件风险理论证明,提出耦合在线语义约束恢复与执行前确定性审计修复的双层防御框架。
论文提出了针对长程智能体跨轮安全约束遗忘的双层防御框架 STAR-Guard(Safety-Constraint Tracking, Activation, and Runtime-Audit Guard),将语义安全约束恢复与执行前确定性审计拦截深度解耦并协同结合。
GHOST 失效形式化与理论分析
- 任务完成与安全解耦:将任务结局区分为安全完成(Safe Completion, SC)与非安全完成(Unsafe Completion, UC)。
- GHOST 事件定义:设 YE 为当前提示显式包含约束时的执行结果,YI 为相同约束仅存在于先前历史时的匹配执行结果,严格 GHOST 事件形式化为:
GHOST = 𝕀[YE = SC ∧ YI = UC] 该式刻画模型具备显式遵循约束的能力,但在依赖历史检索时发生违规。
- 几乎必然违规命题:在安全关键机会 k 处,若安全前缀上的残留条件违规风险 hk 满足确定性下界 hk ≥ ϵk 且满足:
∑k=1∞ ϵk = ∞ ⟹ Pr(σB < ∞) = 1 该式表明只要残留风险下界序列非可和,智能体进入危险区域的首次命中时间 σB 几乎必然为有限值。
- 双层设计动因:语义恢复虽能降低提案阶段的不安全倾向,但受大模型随机采样影响无法彻底消除残留风险;而仅靠硬性拦截会损害正常任务完成度。因此先通过恢复引导模型自发合规,再通过审计把关残留违规。
在线约束摄取与规则编译
- 逐轮在线摄取:每当用户输入新消息 ut 时,在线摄取模型实时判定其是否包含需跨轮保留的操作安全约束,不依赖任何人工标注标记。
- 三元属性解析:若检测到约束,模型将其结构化解析为作用范围(scope)、触发操作(trigger)与遵循规则(rule),并区分为前置规则(prerequisite)与禁止规则(prohibition)。
- 可执行审计规则编译:结合公共工具模式(tool schemas)编译出包含敏感动作、前置动作、执行时序及参数绑定的审计规则对象,校验合规后存入外部规则库 Lt。
任务恢复与语义激活
- 双匹配语义门控:当后续用户指令发起或恢复可执行任务时,语义门控将该指令与规则库中的规则逐一比对,仅当 scope 与 trigger 同时匹配时才激活对应约束集合 A。
- 上下文语义渲染:将激活的约束规则渲染后以语义形式追加至当前任务输入中(q_tilde = q ⊕ Render(A)),促使目标智能体生成合规的工具调用规划。
运行时执行前确定性审计
- 目标绑定与状态断言:当智能体生成候选工具调用 a_hat 时,审计层将其绑定至具体参数目标,并根据当前环境状态 ek 与历史执行轨迹检查前置条件是否满足。
- 否定优先决策机制:采用 Block ≻ Repair ≻ Allow 的优先级策略。若命中禁止规则,直接拦截并置为 ⊥;若前置条件缺失且未命中禁止,进入修复模式先安全执行同目标的前置操作,验证成功后再放行原操作;无法修复则直接阻断。
论文做了哪些实验?
在 7 个模型上评测 SCARBench,GPT-5.5 的 GHOST 率达 11.5%,STAR-Guard 消除违规。
实验设置
- 被测模型:共 7 个模型,包括 5 个商业 API 模型(GPT-5.5、DeepSeek-V4-Pro、GLM-5.2、Kimi-K2.6、Qwen-3.6)以及 2 个本地部署模型(Qwen3.5-4B、Llama-3.1-8B)。
- 评测基准与规模:SCARBench,包含 6 个工具使用领域(设备/日历操作、金融、电子邮件、文件系统、网络请求、脚本执行)的 103 个基础场景,每个场景配有唯一的良性长历史(6,000–6,176 token,56–160 轮)。每场景衍生出 SE、SI、LE、LI 四种匹配条件,单模型评测 412 个条件实例。
- 对比基线:Prompt Reminder、BM25 Top-3 (2009)、DeCRIM (2024)、LIGHT Three-Memory (2025)、VerIFY-Summarize (2026),以及具备 Oracle 特权信息的 TrustAgent (2024) 和 DVR (2025)。
- 指标体系:Safe Completion (SC, 任务完成且轨迹和状态均安全)、Unsafe Completion (UC, 任务完成但违规)、Safe Non-completion (SN)、Unsafe Attempt (UA)、Execution Failure (EF),以及严格 GHOST 率(LE 下 SC 且匹配 LI 下 UC 的比例)。
- 评审判定方式:每场景使用代码编写的三个确定性评估器判定,包括 Cξ(τ, eT) 检验任务完成、Tξ(τ) 检验工具调用轨迹安全、Sξ(eT) 检验最终环境状态安全,不使用 LLM 评分。
- 运行配置与样本量:每模型每条件执行 5 次独立重复(单模型共 515 个匹配实例对),智能体单次任务上限 5 次迭代及 512 token,温度设为 0.7;GHOST 置信区间采用 10,000 次 case-cluster bootstrap 计算。
主结果
各模型在 SCARBench 上的主实验结果如下表所示(据 Table 1,数值为 5 次重复均值百分比):
表格较宽,可左右滑动
目标模型 LE SC LE UC LI SC LI UC GHOST [95% CI] GPT-5.5 88.7 1.0 76.3 12.4 11.5 [6.4, 17.1] DeepSeek-V4-Pro 85.6 1.2 79.6 9.7 8.7 [4.9, 13.0] GLM-5.2 84.3 0.2 73.6 8.9 8.9 [4.5, 14.0] Kimi-K2.6 75.7 2.9 68.9 9.7 6.8 [3.3, 11.4] Qwen-3.6 88.2 0.6 76.7 9.5 9.1 [5.6, 13.0] Qwen3.5-4B 82.5 2.5 47.0 31.1 27.8 [21.6, 34.2] Llama-3.1-8B 13.0 17.5 3.5 25.0 8.5 [4.3, 13.4] - 严格 GHOST 普遍存在:作者称在所有 7 个被测模型中均观察到了严格 GHOST 事件,全场景 GHOST 率介于 6.8%(Kimi-K2.6)至 27.8%(Qwen3.5-4B)之间。
- 高能力模型仍发生违规:GPT-5.5 在 LE 下取得最高的 88.7% SC,但在 LI 下 SC 下降 12.4 个百分点且 UC 上升 11.4 个百分点,GHOST 率达 11.5%。
- 弱能力模型受困于执行失败:Llama-3.1-8B 在 LI 下的 EF 达到 50.1%(Table 6),作者称其 GHOST 率虽为 8.5%,但主要受制于基础任务执行能力的匮乏。
长历史对安全约束恢复的放大效应
- 测试内容:计算双重差分指标 Δint = (SCLI - SCLE) - (SCSI - SCSE),检验长历史是否放大了隐式约束恢复带来的安全完成率损失。
- 实验结果:7 个模型的 Δint 均为负值(Figure 3):Qwen3.5-4B 为 -36.7 个百分点,Qwen-3.6 为 -16.3,GPT-5.5 为 -13.4,GLM-5.2 为 -13.0,Kimi-K2.6 为 -8.7,Llama-3.1-8B 为 -5.6,DeepSeek-V4-Pro 为 -5.0。
- 作者解读:作者称负向双重差分说明长历史与历史约束恢复难度存在一致的交互作用,较长历史削弱了智能体识别并应用早期安全约束的能力,且该现象独立于部署形态。
STAR-Guard 防御效果与消融分析
- 测试内容:评估 STAR-Guard 在 7 个模型上的防御增益,并在 Qwen3.5-4B 上测试组件消融(Table 2)。
- 实验结果:在 7 个模型上,STAR-Guard 使 SC 提升 7.2–34.2 个百分点,UC 降低 8.3–29.2 个百分点。在 GPT-5.5 上,SC 从 76.3% 提升至 94.0%,UC 与 GHOST 均降至 0.0%。在 Qwen3.5-4B 上,无防御时 SC 为 47.0%、UC 为 31.1%、GHOST 为 27.8%;仅恢复(Restoration Only)使 SC 升至 76.3%、UC 降至 4.3%、GHOST 降至 3.7%;仅审计(Audit Only)使 SC 升至 77.1%、UC 降至 2.1%、GHOST 降至 1.7%;完整 STAR-Guard 实现 SC 81.2%、UC 1.9%、GHOST 1.9%。
- 作者解读:作者称 SC 提升与 UC 降低并存说明防御未简单靠无差别拦截任务达成安全;消融结果支持语义恢复与执行前审计的互补设计。
与基线防御及特权方法的对比
- 测试内容:在 Qwen3.5-4B 的 Long Implicit 条件下对比通用指令微调/记忆基线与 Oracle 特权方法(Table 3)。
- 实验结果:非 Oracle 基线中,LIGHT Three-Memory 的 SC 为 58.4% ± 4.9%、UC 为 23.7% ± 2.5%、GHOST 为 18.6% ± 3.2%;BM25 Top-3 的 SC 为 57.5% ± 5.9%、UC 为 16.5% ± 2.1%、GHOST 为 14.0% ± 2.6%;VerIFY-Summarize 的 UC 增至 35.3% ± 4.3%、GHOST 为 27.4% ± 2.7%;DeCRIM 的 SC 降至 44.3% ± 3.2%、UC 增至 31.8% ± 3.3%;而直接获得真实约束或验证器的 Oracle 方法 TrustAgent 和 DVR 分别使 UC 降至 5.2% ± 1.8% 和 0.4% ± 0.5%。
- 作者解读:作者称依赖从原始长历史中检索约束的基线增益微弱甚至带来负效应;STAR-Guard 在不接触真实标注的情况下实现了 81.2% SC 与 1.9% UC/GHOST。
其他消融与分析
- Long Implicit 下 GPT-5.5 全结局分布:SN 为 10.9%,UA 为 0.0%,EF 为 0.4%(Table 6)。
- Long Implicit 下 DeepSeek-V4-Pro 全结局分布:SN 为 10.7%,UA 为 0.0%,EF 为 0.0%(Table 6)。
- Long Implicit 下 GLM-5.2 全结局分布:SN 为 16.5%,UA 为 0.0%,EF 为 1.0%(Table 6)。
- Long Implicit 下 Kimi-K2.6 全结局分布:SN 为 16.5%,UA 为 0.0%,EF 为 4.9%(Table 6)。
- Long Implicit 下 Qwen-3.6 全结局分布:SN 为 11.5%,UA 为 0.0%,EF 为 2.3%(Table 6)。
- Prompt Reminder 在 Qwen3.5-4B 上 SC 为 50.5% ± 6.2%,UC 为 28.0% ± 4.3%,GHOST 为 23.3% ± 4.1%(Table 3)。
负面结果与例外分析
- 对话摘要基线 VerIFY-Summarize 导致 UC 从无防御的 31.1% 升至 35.3%(Table 3);作者解释称压缩对话容易遗漏或削弱关键约束,下游执行时无法重新恢复。
- 自我修正方法 DeCRIM 使 SC 从 47.0% 降至 44.3%、UC 升至 31.8%(Table 3);作者解释称分解与评估模块过度聚焦当前显式指令,或将控制文本误当操作要求。
- Prompt Reminder 仅带来 3.5 个百分点的 SC 提升(Table 3);作者解释称泛化提醒未指明具体规则绑定,容易促使模型在未补全前置动作的情况下贸然执行。
有什么可以进一步探索的点?
作者指出防御保证依赖前端正确性、干预影响完成度等局限,并指明机理与规则表达等后续方向。
作者指出的局限与后续方向
- 端到端安全保证存在前提依赖(第 5 节与附录 D):作者指出执行前审计提供的是动作局部的条件保证(action-local conditional property),当上游组件(如摄取检测、属性提取或目标绑定)失效时,端到端残留风险仍可能存在,而非无条件的端到端安全保证。
- 确定性干预对任务完成度的折损代价(第 5 节):作者指出执行前拦截机制需要对任务执行施加强确定性干预,这在一定程度上可能会损害正常任务的完成度(compromises task completion)。
- 约束规则表达范式较为集中(附录 D):作者指出当前实现主要针对前置动作规则(prerequisite)与禁止规则(prohibition),覆盖动作顺序、无条件禁止与目标参数绑定。
- 双重差分未识别模型内部机制(附录 B):作者指出双重差分统计量表明长历史放大了约束恢复失败的损失,但该指标本身并未识别模型内部的遗忘机理。
- 注意力稀释仅为条件性机制而非因果定论(附录 A):作者指出注意力稀释仅作为条件性推导机制,注意力本身不等于合规性,行为实验测试 GHOST 时未将注意力作为因果解释。
- 命题 1 为充分条件而非必然结论(附录 A):作者指出命题 1 是部署层面的充分条件,并非判定所有随机智能体最终必然违规的定理。
实验覆盖范围
- 被测模型覆盖 5 个商业 API 模型与 2 个本地开源模型共 7 个模型。
- 评测基准 SCARBench 涵盖 6 个工具使用领域(设备/日历操作、金融、电子邮件、文件系统、网络请求、脚本执行),包含 103 个基础场景与 11 个规则族,单条良性长历史长度为 6,000–6,176 token、56–160 轮。
- 实验环境设定为无恶意攻击的良性交互,未包含提示注入、对抗扰动或恶意多智能体攻击。
- 基线防御对比及消融实验均以 Qwen3.5-4B 为目标模型在 Long Implicit 条件下进行,其他 6 个模型仅测试了 No Defense 与 Full STAR-Guard。
- 论文未报告 STAR-Guard 在更长交互上下文(如数万至百万 token)或多智能体交互架构下的运行表现。
总结一下论文的主要内容
揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
- 针对长程工具使用智能体在多轮良性交互中遗忘先前安全约束的失效现象,形式化定义了跨轮安全约束忽略治理危害(GHOST),并构建了可执行评测基准 SCARBench。
- 核心问题在于智能体在多轮对话中能够恢复历史任务,但早先设定的前置要求或操作禁令容易脱离治理,导致不可逆的违规执行。
- 理论分析表明,若残留条件违规风险存在非可和下界,智能体轨迹几乎必然进入危险区域;据此提出 STAR-Guard 防御框架,耦合在线约束解析语义恢复与运行时确定性审计拦截。
- SCARBench 评测显示,在良性长上下文中 GPT-5.5 的严格 GHOST 率达 11.5%,Qwen3.5-4B 达 27.8%(Table 1);长历史在所有模型上均放大了安全约束恢复损失(Figure 3)。
- 引入 STAR-Guard 后,GPT-5.5 的安全完成率从 76.3% 提升至 94.0%,且未出现任何违规完成与 GHOST 事件(Table 2);在 Qwen3.5-4B 上将安全完成率由 47.0% 提高到 81.2%,显著超越各非 Oracle 基线。
- 作者认为,上下文增长会实质性削弱长程智能体对历史安全约束的治理效能,仅靠通用大模型检索或提示提醒难以保障安全,需将概率性语义恢复与执行前确定性规则屏障相结合。