研究者提出 relinking 漏洞:LLM Agent 压缩边界可被拼出恶意指令
Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents
作者称摘要压缩器会将分散良性片段重组为恶意指令;RELINK在4个Agent基准默认设置下取得86.9%执行率。
攻击面为非受信输入通道Huntrust;攻击者为black-box,无法修改Htrust、压缩器Cθ及其提示词qc、预算β、后端模型B或工具,仅有应用级知识;其能力是将分散且局部良性的攻击载荷片段植入Huntrust;目标是让压缩器重写生成完整恶意指令τ*并在后端执行。
- 基于摘要的提示词压缩改变了智能体安全边界:前向过滤器检查压缩前的原始上下文,而受信任压缩器可能将分散的局部良性片段重组为完整的后端恶意指令,形成TOCTOU漏洞。现有输入过滤和输出验证均无法检测这种指令生成过程。
- 基于动作图和上下文序列两重视图构建DSL,提出三阶段自动化攻击RELINK:Decompose剪除动作与参数间的绑定边;Disguise注入非绑定的角色句柄保证可恢复性;Distribute将两部分掩码投影插入到远端宿主锚点中。
- 在4个长上下文基准上,RELINK使整体重链率和后端执行率达到86.9%(对照组17.0%),且在不同压缩率、压缩模型和后端模型下均保持有效;真实系统OpenClaw和Claude Code案例显示默认压缩命令同样会触发恶意指令重链。
- KBRA防御仅保护压缩边界,对源上下文已完全许可的直接注入无效,且依赖工具模式等配置工件;评测覆盖4个基准共619个样本,测试了6种压缩模型和6种后端模型,但长上下文全注意力分析在部分样本上出现显存溢出报错。
- 被测模型
- Gemma-4-31B-itGPT-OSS-20BQwen3.6-27BQwen3.5-9BQwen3.5-4BGPT-4o-miniDeepSeek-v4-flashQwen3.6-max-previewClaude-opus-4-7GPT-5.5Gemini-3.5-flashLlama Prompt Guard 2ProtectAI DeBERTa-v2ShieldGemma-2BShieldGemma-9B
- 基准
- AgentDojoASBInjecAgentτ2-bench
- 指标
- Relink Rate (RR)Backend Action Rate (BAR)BAR AfterAttack BlockUtility FP
香港科技大学研究者提出 relinking,一种针对 LLM Agent 摘要式提示压缩的新型漏洞:压缩器像被利用的中间人,把分散在上下文各处、单独看都无害的片段拼成一条完整的恶意指令。作者称这是摘要式压缩器的内生漏洞,注意力机制让分散片段可被联合取用,预训练让兼容片段显得可连接,后训练对有用性的偏好则倾向把它们合并成紧凑的可执行指令。他们提出自动化工具 Relink,用领域特定语言把恶意载荷拆成无害片段并分散植入,在四个长上下文 Agent 基准上达到 86.9% 的 Relink Rate 与 Backend Action Rate,而对照的 clean-split 为 17.0%;在 OpenClaw 和 Claude Code 的案例研究中,默认压缩命令把分离片段合并为可执行载荷。
推荐理由论文提出压缩边界上的 relinking 漏洞,并给出自动化构造工具与 11 种防御的失效结果,适合关注 Agent 上下文压缩安全的团队参考。
深度解读
这篇论文试图解决什么问题?
作者指出基于摘要的提示词压缩引入重链漏洞,压缩器会将分散良性片段重组为恶意指令并诱发后端执行。
基于摘要的提示词压缩在智能体中引入了重链(Relinking)漏洞,导致受信任压缩器将分散且局部良性的片段重组为完整的后端可执行恶意指令。
- 问题场景与重要性:现代 LLM 智能体在长视距任务中上下文迅速累积,生产级系统(如 Claude Code、Cursor、OpenClaw)普遍采用基于 LLM 摘要的提示词压缩来缩减 token 成本并保留语义;然而压缩改变了安全边界,形成了检查时间到使用时间(TOCTOU)的表征差异。
- 现有防御与威胁模型的不足:传统输入过滤器仅在压缩前检查离散源输入,而输出验证器主要执行实体或跨度级基础校验(Grounding);提示词注入和载荷切分依赖源端存在完整恶意指令或显式重构规则,现有方法无法检测源端完全无恶意指令且无显式重构标记的转换过程。
- 核心机理观察:作者提出三重机理假说——注意力机制使跨文档的分散片段在压缩中全局可见(Cross-Fragment Binding),预训练引入基于表面类型的类型化槽位先验(Typed Slot Priors),后训练中的有益性偏好(Helpfulness Preference)促使压缩器将分散的关联片段主动合并为紧凑的交接指令。
- 提出的方法与防御:作者提出了自动化攻击构造工具 Relink,通过三阶段流水线在源端植入分散且局部良性的动作与参数片段;同时提出了基于压缩边界审计的防御机制 KBRA(Keyed Binding Reassembly Audit),通过局部性要求验证压缩后指令是否获得源上下文许可。
- 威胁模型:
- 受害系统:基于压缩的智能体流水线(Compressed-agent Pipeline),源上下文划分为受信上下文 Htrust 与非受信通道 Huntrust,攻击面完全为 Huntrust。
- 攻击者知识:黑盒(Black-box),仅掌握部署环境的应用级知识,无权访问或修改内部权重、提示词或配置。
- 攻击者能力:无法修改 Htrust、压缩器 Cθ 及其提示词 qc、token 预算 β、后端模型 B 或任何工具实现;仅能将攻击载荷片段植入非受信通道以替换 Huntrust。
- 攻击目标:在压缩阶段使压缩上下文表达目标指令(Express(Sadv, τ) = 1),在后端阶段使后端模型实际执行目标动作(Act(aadv, τ) = 1)。
有哪些相关研究?
作者梳理了提示词压缩、载荷切分与输入输出防御,指出重链无需源端完整指令与显式重构规则,利用压缩器自主建立恶意绑定。
提示词压缩与摘要保真度研究
- 压缩方法与评测取向:LLMLingua(Jiang 等, 2023)与 LLMLingua-2(Pan 等, 2024)等方法通过标记选择或蒸馏减少长上下文推理开销;作者指出既有工作多以任务准确率或信息保留为评测导向,而本文将长视距智能体的摘要压紧视为安全边界。
- 摘要幻觉基准:FaithBench(Bao 等, 2025)与多文档摘要幻觉研究(Belem 等, 2025)关注未受源文本支持的捏造信息;作者指出重链的所有语义片段在源上下文中均真实存在,并非无端捏造。
- 扰动式压缩攻击:CompressionAttack(Liu 等, 2025)通过超出训练分布的对抗扰动诱导语义漂移;作者指出重链不依赖对抗扰动,完全在压缩器正常的抽象概括能力范围内运作。
智能体提示词攻击与载荷切分
- 间接提示词注入:Greshake 等(2023)与 Perez 等(2022)等展示了应用端遵循非受信指令的风险;作者指出此类攻击在源端直接嵌入了完整的恶意指令。
- 载荷切分攻击:变量重构(Kang 等, 2024)、语义分解与重构 DrAttack(Li 等, 2024)及上下文切分(Liu 等, 2023)将对抗内容分散于上下文;作者指出这些方法依赖攻击者提供的显式重构规则(如指令拼接),而重链由压缩器自主完成绑定。
智能体防御与检测基准
- 单表征安全防御:Llama Guard(Inan 等, 2023)、ShieldGemma(Zeng 等, 2024)、Llama Prompt Guard 2(Chennabasappa 等, 2025)及运行时策略 CaMeL(Debenedetti 等, 2025);作者指出其仅孤立校验源输入或最终输出,无法捕捉跨表征的语义重组。
- 跨度定位与溯源方法:PromptLocate(Jia 等, 2025)与 AttnTrace(Wang 等, 2025)用于定位可疑源跨度;作者指出在重链场景下,压缩前各片段局部良性,压缩后各片段均有来源支撑,单点检查难以防御。
基线方法与基准定位
- 对比基线与基准环境:论文选用了 Clean-split、Random-split、变量重构、语义分解与重构、上下文切分作为攻击基线,选取了 11 种代表性防御机制,并在 AgentDojo、ASB、InjecAgent、τ2-bench 四个基准上构建长上下文评测。
- 与既有工作的本质区别:作者称本文区别于以往工作的核心在于消除了攻击者端的显式重构,利用压缩器内生的抽象概括能力与有益性偏好跨片段绑定良性元素,指出了压缩边界的系统性风险。
论文如何解决这个问题?
论文形式化重链条件,设计DSL与Decompose-Disguise-Distribute三阶段攻击,并提出KBRA边界审计防御。
整体思路上,论文将重链过程形式化为谓词-参数绑定的重组,基于经验语料提炼特定领域语言(DSL),构建了三阶段自动化攻击工具 Relink,并提出了基于压缩边界审计的防御机制 KBRA。
问题设定与形式化
- 载荷指令构成:将目标载荷指令形式化为 τ = (p, r, v, κ),其中 p 为后端智能体动作谓词,v 为参数值,r 为 v 相对于 p 填充的语义角色,κ 为可选约束条件。
- 重链判定条件:建立四个指标(Ground、Support、Express、Act),当满足 Ground(H, τ) = 1 ∧ Support(H, τ) = 0 ∧ Express(S, τ) = 1 时认定发生重链,即源文本包含动作与参数成分且未声明绑定,但压缩文本表达了该绑定指令;若后端进一步执行(Act = 1)则为可执行重链。
基于语料分析的 DSL 抽象
- 经验设计原则:作者分析了 11 个智能体语料后提炼出三大构造需求:逐字保留精确目标值、适配多样化载体跨度风格(JSON、散文、键值对等)、显式控制片段间局部性距离。
- 双重协调视图:DSL 维护指令图视图(将动作、参数值和约束解耦为节点并由绑定边连接)与上下文序列视图(将低权限载体建模为有序锚点序列),为跨段切分与定位提供操作句柄。
RELINK 三阶段攻击构建流程
- Decompose(绑定边剪枝):删除指令图中动作与参数之间的关键绑定边,将其划分为保留开放槽位的动作子图 Gp 与保留表面类型的数值子图 Gv,跨边约束直接丢弃,确保源端不包含完整指令。
- Disguise(线索约束角色实例化):将抽象角色标签投射为离散非绑定的角色句柄坐标(覆盖同工作流、参考角色、载体上下文等线索),分别附加到两端子图,使两端在压缩时具备关系可恢复性但不形成直接绑定。
- Distribute(掩码锚点投影):在载体锚点序列上构建二值放置掩码 Me,对角线置零且过滤局部绑定组合,通过确定性投影选择非对角有效坐标对,将渲染片段分别插入宿主锚点并线性化为对抗载体。
压缩边界审计防御 KBRA
- 边界不变量:KBRA 强制执行边界不变量,规定后验指令必须由单个源文本段落联合声明动作、角色和数值时才算获得许可,跨段落分离提及不构成合法授权。
- 三步审计流程:运行抽取(Extract,恢复三元组绑定)、投影(Project,映射到规范键集合,未知项映射为底元素 ⊥ 执行 Fail-closed 拒绝)、匹配(Match,验证后验动作键集是否被源端键集包含,提供 Exact 与 Semantic 两种模式)。
论文做了哪些实验?
RELINK在4个基准上取得86.9%的执行率,机理探针显示三重假说成立,所提KBRA防御将残余执行率降至接近0%。
实验设置
- 被测模型:主实验默认采用 Gemma-4-31B-it(同时作为压缩模型与后端模型);压缩模型泛化测试覆盖 GPT-OSS-20B、Qwen3.6-27B、Qwen3.5-9B、Qwen3.5-4B、GPT-4o-mini;后端模型泛化测试覆盖 DeepSeek-v4-flash、Qwen3.6-max-preview、Claude-opus-4-7、GPT-5.5、Gemini-3.5-flash;防御测试覆盖 Llama Prompt Guard 2、ProtectAI DeBERTa-v2、ShieldGemma-2B、ShieldGemma-9B、PromptLocate、AttnTrace、SecAlign、CaMeL;机理分析对照模型为 Gemma-4-31B(base)。
- 数据集与规模:基于 4 个长上下文智能体基准重构过滤,评估集共 619 个样本(AgentDojo 30 个、ASB 188 个、InjecAgent 200 个、τ2-bench 201 个);泛化与消融实验采用 180 个样本的固定诊断子集(AgentDojo 30 个,其余三基准各 50 个)。
- 基线方法:攻击基线包括 Clean-split(良性切分对照)、Random-split、变量重构、语义分解与重构、上下文切分;防御基线包括 11 种覆盖输入过滤、提示词防御、源净化、后端强化及运行时策略的机制。
- 指标定义:Relink Rate(RR,压缩上下文满足动作谓词且精确匹配参数值的比例);Backend Action Rate(BAR,后端模型实际发射或接受目标动作的比例);Filter Pass、BAR After、Attack Block、Utility FP 与 Avg. Cost。
- 评审与判定方式:RR 采用确定性精确参数匹配;BAR 采用各基准自带的代码指标自动化判定,未采用 LLM 裁判打分;默认压缩率为 0.6,默认采用 agent_handoff 提示词。
- 重复次数:论文正文未报告多次重复采样的随机种子数量或多次运行的标准差(附录 B.1 报告了 95% bootstrap 置信区间与统计检验 p 值)。
主结果
据 Table 3 报告的主实验结果(默认压缩流水线,压缩模型与后端模型均为 Gemma-4-31B-it,压缩率 0.6):
表格较宽,可左右滑动
基准 Clean-split RR Clean-split BAR RELINK RR RELINK BAR ∆ BAR AgentDojo 9.5% 9.5% 90.5% 90.5% 81.0 pp ASB 1.1% 1.1% 100.0% 100.0% 98.9 pp InjecAgent 47.5% 47.5% 98.0% 98.0% 50.5 pp τ2-bench 2.5% 2.5% 63.2% 63.2% 60.7 pp Overall 17.0% 17.0% 86.9% 86.9% 69.9 pp - 攻击提高执行率:作者称 RELINK 将整体 RR 和 BAR 从对照组的 17.0% 提升至 86.9%,在 ASB 达到 100.0%,在 InjecAgent 达到 98.0%,表明关系引导构建相比单纯暴露片段增加了大量信号。
- 任务结构影响重链难度:作者指出 τ2-bench 是最难的场景(BAR 为 63.2%),作者认为客服工作流具有更强的任务、状态或来源结构,压缩器较难将分离片段整合为可执行交接状态。
- 兼顾隐蔽性与执行力:与切分攻击对比中,作者称变量重构等基线因显式拼接规则未能通过源端过滤(Filter Pass 为 0%),而 RELINK 既保持源端可采纳性又实现高后端执行率(Figure 6)。
三重机理探针验证(RQ1)
- 测试设置:在 619 个样本或其注意力可行子集上构造角色破坏对照(pctrl),测量注意力差值 ∆attn、槽位先验概率差值 ∆log P、有益性偏好效用差值 ∆util。
- 实验结果:∆attn 在 99.4% 的样本上为正(p < 10^-27,Table 9),因因果掩码限制信号严格单向沿 Rv → Rp 流动;∆log P 在 95.2% 的样本上为正(Table 10);∆util 在 75.3% 的样本上为正(Figure 5),微调模型在 81.6% 样本上展现选择性偏好,而基座模型仅 15.7%(Table 11)。
- 作者解读:作者称探针结果支持了三个机理假说,表明跨片段连接广泛存在,而后训练的有益性偏好是驱动压缩器自主闭合断开绑定的关键根源。
泛化性与真实系统案例(RQ3 & RQ5)
- 测试设置:在 180 样本子集上变换压缩率、压缩提示词、压缩模型和后端模型,并在 OpenClaw 与 Claude Code 中测试默认压缩命令。
- 实验结果:压缩率在 0.3–0.8 变化时 RELINK 保持在 87.7%–91.2%(Figure 7);智能体交接提示词下 BAR 达 89.5%(Table 4);GPT-4o-mini 为压缩器时 BAR 为 36.8%,Gemma-4-31B-it 达 89.5%(Table 5);Gemini-3.5-flash 为后端时 BAR 为 35.1%(Table 6);在 OpenClaw 中促成未授权 RSVP 提交,在 Claude Code 中诱导修改 webhook 配置(Figure 8, 9)。
- 作者解读:作者称漏洞跨预算、模型与工作流普适存在;提示词措辞是最大变异来源;真实系统的紧凑化命令会真实执行由分离片段重链合成的恶意操作。
防御机制与 KBRA 边界审计评测(Section 8)
- 测试设置:评测 11 种代表性防御机制与 KBRA 审计机制的残余后端执行率(BAR After)、攻击拦截率(Attack Block)、良性误报率(Utility FP)及开销(Table 8)。
- 实验结果:现有防御中 Llama Prompt Guard 2 将残余 BAR 降至 0.00% 但误报率达 100.0%;ShieldGemma-2B 误报率 1.5% 但残余 BAR 高达 84.6%;KBRA-exact 残余 BAR 为 0.0%,KBRA-semantic(后端审计)残余 BAR 为 0.3%,且 Utility FP 仅 0.93%,CPU 延迟 69.9ms。
- 作者解读:作者称单点防御必然陷入安全与效用两难,而通过审计 H → S 跨边界状态,KBRA 打破了该权衡,在保留良性效用的同时消除未授权执行。
其他消融与分析
- 移除线索(No cue):BAR 从 89.5% 降至 80.7%(Table 7,180 样本诊断集)。
- 错配线索(Mismatched cue):BAR 降至 70.8%,在 τ2-bench 降至 2.0%(Table 7)。
- 仅距离插入(Distance-only insert):BAR 为 86.5%,相对完整配置下降 3.0 个百分点(Table 7)。
- 通用风格渲染(Generic realization):BAR 为 87.7%,相对完整配置下降 1.8 个百分点(Table 7)。
- 注意力头消融(Head-Ablation Sweep):Top-64 头消融将效用差从 0.397 降至 0.079,随机 64 头消融降至 -0.131(附录 B.4)。
例外与测量局限
作者指出 τ2-bench 基准上重链难度高于其他基准,在错配线索下 BAR 降至 2.0%(Table 7);此外 Gemma-4-31B-it 全注意力提取在最长的 231 个长上下文样本上因显存不足报错失败(附录 B.2)。
有什么可以进一步探索的点?
作者指出KBRA仅保护压缩边界且依赖配置工件,白盒攻击可通过单段合并或实体碰撞绕过,长文本注意力存在显存溢出局限。
作者指出的局限与后续方向
- 仅保护压缩边界而非全栈架构:作者指出 KBRA 仅保护压缩边界,若受信源输入 Hlic 本身已许可恶意动作(例如直接提示词注入),KBRA 将放行该动作,此时必须依赖传统输入过滤器(Section 8.2)。
- 配置工件的安全性审计依赖:作者指出定义抽取器 E 与投影函数 Φ 的配置工件(如工具模式、实体别名表)属于安全关键资产,必须经过专门审计(Section 8.2)。
- 单段授权自适应攻击(A1):作者指出白盒攻击者可将动作与参数合并到单个低权限段落中以满足局部性要求,该攻击放弃了重链形式并转化为直接注入,交由输入层防御处理(附录 C.3)。
- 实体碰撞自适应攻击(A2):作者指出攻击者可构造特定参数值在语义匹配器下与合法源键发生碰撞,造成 0.2%–0.3% 的残余执行率漏洞,需通过扩展冻结别名表予以压缩(附录 C.3)。
- 长文本全注意力测量局限:在最长的 231 个样本上,Gemma-4-31B-it 全注意力提取在 8 张 H800 GPU 下因显存溢出报错,作者改用轻量模型 Qwen3.5-4B 验证单向注意力路由(附录 B.2)。
实验覆盖范围
- 基准与样本覆盖:评测覆盖 AgentDojo、ASB、InjecAgent、τ2-bench 共 4 个长上下文基准,过滤后最终评测集为 619 个样本,消融与泛化实验使用 180 个样本的固定子集(Section 7.1, 7.4)。
- 模型覆盖:主实验采用 Gemma-4-31B-it,压缩模型泛化测试覆盖 6 种模型,后端模型泛化测试覆盖 6 种模型(Table 5, Table 6)。
- 系统案例覆盖:真实系统案例覆盖任务自动化平台 OpenClaw 与软件维护智能体 Claude Code 的默认压缩指令(Section 7.6)。
- 防御基线覆盖:防御评测覆盖输入过滤器、压缩提示词防御、源端净化器、后端强化与运行时策略共 5 类 11 种机制(Section 8.1)。
- 实验报告信息:论文报告了确定性匹配指标与统计检验值,但未报告主实验中多次采样的重复轮数与离散度分布。
总结一下论文的主要内容
论文指出提示词压缩引入重链漏洞,提出RELINK攻击工具与KBRA边界审计防御,证明压缩边界应作为关键安全边界。
本文研究了智能体基于摘要的提示词压缩所引入的新型安全漏洞——重链(Relinking),并提出了系统化的攻击构建方法与边界审计防御机制。
- 问题定位:长视距智能体广泛采用 LLM 摘要进行上下文压缩,导致前向安全过滤器与后端执行模型之间产生表示层面的 TOCTOU 差距,使压缩器充当了“混淆代理”。
- 攻击机制与方法:由于跨片段注意力、类型化槽位先验和有益性偏好的共同作用,压缩器会自主将源文本中分散且良性的动作与参数组装为可执行恶意指令;作者开发了自动化工具 RELINK,利用 DSL 通过 Decompose(剪除绑定边)、Disguise(添加角色句柄)和 Distribute(掩码锚点投影)在源端构造不可检出的恶意片段。
- 主要实验发现:
- 在 4 个智能体基准的 619 个样本上,RELINK 在默认设置(Gemma-4-31B-it,压缩率 0.6)下取得 86.9% 的重链率与后端执行率,对照组仅 17.0%(Table 3)。
- 在 ASB 基准上执行率达 100.0%,在客户服务基准 τ2-bench 上达 63.2%(Table 3)。
- 在 180 样本泛化测试中,攻击在 0.3 至 0.8 压缩率下均保持 87% 以上执行率(Figure 7),且在 6 种压缩模型与 6 种后端模型中均表现有效(Table 5, 6)。
- 真实工业级智能体 OpenClaw 与 Claude Code 的案例研究显示,默认紧凑化命令会真实执行由分离片段重链合成的未授权动作与仓库配置修改(Figure 8, 9)。
- 防御方案与结论:现有 11 种代表性单点防御均面临安全与效用的严苛权衡;作者提出的 KBRA 边界审计方案通过验证后验指令的局部性源端支持,将残余执行率降至 0.0%–0.3%,且语义模式下误报率仅 0.93%(Table 8);作者呼吁未来智能体架构必须将提示词压缩显式纳入关键安全边界进行协同防护。