LTBD:用可学习信任边界分隔符防御提示注入
LTBD冻结LLM、只学四个分隔符,四模型在AlpacaFarm上worst-case ASR均为0.00%。
攻击者把恶意指令插入不可信外部数据,使模型偏离可信用户指令。
- LLM把可信指令与可能含恶意指令的外部数据放在同一序列,却没有显式的信任来源表示,用户意图可能被覆盖。作者称改参数的防御对闭源模型往往不可行,手工提示仍可能被强攻击攻破。
- LTBD只训练四个分隔符嵌入,分别标出可信指令区与不可信数据区的起止,基座LLM冻结。损失是良性响应的交叉熵,加上相对攻击诱导响应的偏好项;训练时一半样本注入Ignore、Completion或Delimiter-Spoof。
- 四模型AlpacaFarm ASR均为0.00%,TaskTracker为0.11–0.19%。作者称效用代价小,CyberSecEval2并非每格最低。Table3自适应ASR为0.00%或0.48%,基准未写明。
- 论文未专门写出局限或后续方向。实验覆盖四个开源指令模型与AlpacaFarm、SEP、TaskTracker、CyberSecEval2;消融在两个模型上进行。未报告样本量、重复次数、ASR判定器与开销数值,Table3基准未写明。
- 威胁模型
- 攻击者把恶意指令插入不可信外部数据,使模型偏离可信用户指令。自适应设定下,攻击者完全知晓四个分隔符和LTBD输入结构,伪造边界以模仿、结束或重开区域;这些变体也用于训练增强。受害系统是同时处理可信指令与外部数据的LLM。ASR是遵循注入指令而非合法任务的样本比例。
- 被测模型
- Llama3-8B-InstructLlama3.1-8B-InstructFalcon3-7B-InstructQwen2.5-7B-Instruct
- 基准
- AlpacaFarmSEPTaskTrackerCyberSecEval2AlpacaEval2Cleaned Alpaca
- 指标
- ASRWinRate
论文提出可学习信任边界分隔符(LTBD),一种在输入中显式编码信任边界、不改变 LLM 参数的轻量防御方法,用少量可学习分隔符区分可信用户指令与不可信外部数据,使模型更好遵循预期的信任层级。实验显示 LTBD 明显优于推理时防御,与基于训练的方法表现相当,同时保持良性任务效用、推理开销可忽略。在 AlpacaFarm 上攻击成功率为 0.00%,在 TaskTracker 上仅为 0.11-0.19%;在攻击者完全了解该防御并试图绕过的自适应攻击下仍然有效。论文共 5 页、3 张表、1 张图,归入 cs.CR 与 cs.AI,arXiv 编号 2610.11634。
深度解读
这篇论文试图解决什么问题?
作者认为提示注入源于缺少显式信任边界,LTBD用四个可学习分隔符编码该边界且不改LLM。
核心问题是:能否教会 LLM 何处该信任,而不是只告诉它忽略什么,同时不修改 LLM 本身。
- 出现场景:作者认为,当前 LLM 把可信指令和可能含对抗内容的外部数据放进同一序列,却没有信任来源(trust provenance)的显式表示,因此外部数据中的恶意指令可能盖过用户意图。
- 现有不足:作者称 Reminder、Sandwich 等提示仍可能被强攻击攻破;StruQ 要改模型参数,对闭源模型往往不可行,并可能改变原行为;DefensiveToken 虽冻结基座,但其 token 是全局控制信号,并不显式对应可信与不可信区域的边界。
- 核心假设:作者认为,把信任边界做成可学习对象,就足以维持可信指令的权威,并抑制不可信数据里的竞争性指令。
- 提出的方法:提出 LTBD(Learnable Trust-Boundary Delimiters),用少量可学习分隔符标出两类区域,只训练这些嵌入,基座 LLM 完全冻结。
- 威胁模型:
- 目标:让模型偏离用户任务,转而遵循插在外部数据里的恶意指令。
- 能力:攻击者把恶意指令插入外部数据。自适应设定下,攻击者完全知晓四个分隔符和 LTBD 输入结构,伪造边界以模仿、结束或重开区域;这些变体也用作训练增强。
- 知识:摘要称自适应攻击者对防御具有 full knowledge;Section 3.4 具体化为完全知晓四个分隔符与输入结构。标准攻击是否知道模型权重,论文未写。
- 受害系统与判定:受害系统是同时处理可信指令与外部数据的 LLM。ASR 是模型遵循注入指令而非合法任务的样本比例。
有哪些相关研究?
引言对比提示词防御、StruQ与DefensiveToken;作者将LTBD定位为冻结LLM的可学习信任边界。
论文没有独立的 Related Work,相关讨论集中在引言,实验节补充基线。
提示词式防御
- Reminder([13])与 Sandwich([14])——用手工提示要求模型忽略恶意内容。作者称它们仍可能被强攻击攻破,引言将此说法挂在引用 [15, 12] 上。
- TextGrad([20])——实验中作为优化防御提示的基线。引言未讨论其不足。
训练式结构分离
- StruQ([11])——把指令与数据结构化分开,并微调模型以遵守该边界。作者称这要修改底层参数,对闭源模型往往不可行,且可能改变原模型行为。实验中的 StruQ-Full 与 StruQ-LoRA 属于这一类。
- SecAlign([12])——实验中以 SecAlign-LoRA 作为训练式基线。作者称 StruQ 与 SecAlign 通过全量微调或 LoRA 更新底层模型来获得鲁棒性。引言未单独展开 SecAlign 的做法。
冻结参数的防御 token
- DefensiveToken([16])——保持基座冻结,学习防御 token 嵌入。作者称这些 token 充当全局控制信号,而不是把表示与可信、不可信区域的来源对应起来。
基线与基准
- 基线方法:无防御,以及 Reminder、Sandwich、TextGrad、DefensiveToken、StruQ-LoRA、StruQ-Full、SecAlign-LoRA。
- 基准:效用在 AlpacaFarm 与 SEP 上用 AlpacaEval2 报 WinRate;安全在 AlpacaFarm、SEP、TaskTracker、CyberSecEval2 上报 ASR。训练用 Cleaned Alpaca。注入变体名包括 Ignore、Completion、Ignore-Completion,以及作者提出的 Delimiter-Spoof。
作者把 LTBD 放在训练式方法的显式结构分离和参数高效防御的轻量部署之间:不改 LLM 权重,只让绑在边界上的分隔符学到与信任相关的角色。
论文如何解决这个问题?
LTBD只优化四个边界分隔符嵌入,用交叉熵加偏好损失让冻结LLM维持可信指令权威。
LTBD 把提示注入看成信任边界建模:只训练四个分隔符嵌入,冻结基座,使模型区分可信指令区与不可信数据区,即便两边都有类似指令的文本。
问题设定
- 输入:模型同时处理可信任务指令 I 与外部数据 D。攻击把恶意指令插入 D,得到被攻击数据 D′。
- 期望行为:良性输入应遵循 I,并在 D 上完成任务。D′ 里类似指令的内容仍应是数据,而不是新的权威。
- 与先前做法的差别:作者称,只做结构分离并不保证模型尊重边界,StruQ 仍要微调;通用防御 token 能在不改 LLM 时转向行为,但不把表示绑到可信区域的来源上。
分隔符与输入
- 四个 token:tIB、tIE、tDB、tDE,分别标记可信指令区与不可信数据区的起止。嵌入矩阵为 4 行,宽度等于该 LLM 的 token 嵌入维。
- 拼接方式:对良性或被攻击的外部内容,输入为 xT = [tIB; I; tIE; tDB; D̂; tDE],分号表示序列拼接。
- 可训练范围:LLM 参数完全冻结,只优化这四个嵌入。作者称每个分隔符绑到特定结构边界,所以学到的是信任相关角色,而不是通用防御前缀。
- 部署:不另加防御模型,不改 LLM 权重。Figure 1 对照无防御输入与用四个分隔符包裹后的输入。
训练目标
- 参考响应:良性输入上,冻结基座给出要保留的响应 y+。被攻击输入上,无防御模型给出 y−,作为要抑制的攻击诱导行为。
- 损失:目标为 L = LCE + λ Lpref。交叉熵鼓励在包裹后的输入上生成 y+;偏好项提高 y+ 相对 y− 的似然,形式是对二者对数概率差经 β 缩放后过 sigmoid,再取负对数。良性样本的偏好项置 0。
- 实验中的取值:Section 3.1 设 λ = 0.3、β = 0.1。论文未写优化器名称。
数据与优化流程
- 数据:按 StruQ 的做法从指令微调数据构造防御集。实验用 Cleaned Alpaca(约 51K)。一半样本不变;对其余外部数据非空的样本施加三种注入之一。Section 2.4 写等概率采样,Section 3.1 写随机注入,并命名为 Ignore、Completion 与 Delimiter-Spoof。
- 标签:同一 y+ 用于良性与被攻击输入;被攻击样本另有 y−,良性样本的 y− 为空。作者称这是为了在存在注入时仍保持原任务行为。
- 优化:四个 token 加入词表,嵌入按 N(0, I) 初始化;冻结基座,只对分隔符嵌入做梯度更新。四个模型都训练一个 epoch,学习率 0.1。Algorithm 1 汇总该流程。作者称与训练式基线使用同一训练集和数据构建协议。
- 边界伪造增强:训练时也把伪造边界结构当作攻击增强。具体模式属于自适应攻击,这里不展开语句。
推理时的用法
- 包装:推理时用学到的分隔符包裹输入,使模型遵循可信指令,并把可能被攻击的外部数据当数据。
- 论文给出的成功标准:安全看模型是否仍遵循可信指令;后文用 ASR 统计遵循注入指令的比例,用 WinRate 统计良性任务效用。
论文做了哪些实验?
Table1中四模型LTBD的AlpacaFarm ASR均为0.00%;作者称效用代价小,自适应下仍低。
实验设置
- 被测模型:Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct、Qwen2.5-7B-Instruct。各防御都作用在这些模型上,结果按模型分别报告。
- 训练:Cleaned Alpaca(约 51K),单 epoch,学习率 0.1,λ = 0.3,β = 0.1。作者称与训练式基线同一训练集和数据构建协议;Section 3.1 列出的三种注入含 Delimiter-Spoof。
- 基线:提示词式为 Reminder、Sandwich、TextGrad、DefensiveToken;训练式为 StruQ-LoRA、StruQ-Full、SecAlign-LoRA;另有无防御。
- 效用:AlpacaEval2,在 AlpacaFarm 与 SEP 上报 WinRate。GPT-4o 作评审,对照 GPT-4 Turbo 参考回答。
- 安全:ASR,定义为遵循注入指令而非合法任务的比例。AlpacaFarm 评测 Ignore、Completion、Ignore-Completion,报 worst-case ASR。SEP 用实例相关注入。TaskTracker 与 CyberSecEval2 用基准定义的攻击设置。
- 未写明项:各基准样本量、重复次数,以及 ASR 由规则还是模型判定。论文未给推理耗时。
主结果
下表只列 Table 1 的 LTBD 行。AlpacaFarm ASR 是三种攻击的 worst-case。
表格较宽,可左右滑动
模型 AlpacaFarm ASR SEP ASR TaskTracker ASR CyberSecEval2 ASR AlpacaFarm WinRate Llama3-8B-Instruct 0.00% 2.04% 0.13% 7.27% 35.73% Llama3.1-8B-Instruct 0.00% 2.00% 0.19% 7.27% 30.98% Falcon3-7B-Instruct 0.00% 1.57% 0.11% 1.82% 36.42% Qwen2.5-7B-Instruct 0.00% 1.86% 0.14% 12.73% 41.71% - 作者对安全的概括:作者称 AlpacaFarm 上四个模型 ASR 均为 0%,优于推理时防御,并与最强训练式方法相当;相对 DefensiveToken,四模型 SEP ASR 由 3.20/2.81/6.70/4.40% 降到表中 LTBD 行。作者给出的 TaskTracker 区间是 0.11–0.19%。反例在 CyberSecEval2:Llama3-8B-Instruct 上 TextGrad 为 1.8%、DefensiveToken 为 3.64%,均低于表中 LTBD;Qwen2.5-7B-Instruct 上 StruQ-Full 为 3.6%,也更低。作者只称 Falcon3-7B 在该基准上最好。同为 0.00% 的还有 Llama3-8B-Instruct 上 TextGrad 的 AlpacaFarm ASR,但其 WinRate 为 22.9%。
- 效用:作者称四个模型的 AlpacaFarm WinRate 在全部防御中最高,SEP WinRate 在四个里的三个上最高;8 项效用中 6 项不低于无防御,相对 DefensiveToken 有 7 项更高,并认为分隔符可能增强原有任务遵循,而不是用效用换安全。表外的 LTBD SEP WinRate 为 60.55%、54.92%、57.09%、63.90%。例外是 Llama3.1-8B-Instruct:AlpacaFarm WinRate 低于无防御的 31.37%,SEP WinRate 低于无防御 59.04% 与 DefensiveToken 57.90%。
- 训练式对照:无防御的 AlpacaFarm ASR 为 55.29%、74.52%、89.9%、93.75%。SEP 上 StruQ-Full 在 Llama3 与 Llama3.1 为 0.4% 与 0.2%,低于表中 LTBD。作者称冻结全部 LLM、只优化四个嵌入,仍能在 TaskTracker 以及 Falcon3、Qwen2.5 的 SEP 上达到或超过会更新模型的方法。
消融:放置位置与偏好损失
- 测了什么:Table 2 只含 Llama3-8B-Instruct 与 Llama3.1-8B-Instruct。Prefix+CE 把同样四个 token 全放在输入前缀;Boundary+CE 放在区域边界但去掉偏好损失;第三行是完整 LTBD。
- 结果:Llama3.1-8B-Instruct 上,Prefix+CE 的 WinRate / AlpacaFarm ASR / SEP ASR 为 27.50% / 23.08% / 33.81%;边界放置后为 30.98% / 0.48% / 3.43%;加上偏好损失后为 30.98% / 0.00% / 2.00%。Llama3-8B-Instruct 上,三者依次为 27.60% / 6.73% / 15.43%,34.51% / 0.00% / 2.34%,以及 35.73% / 0.00% / 2.04%。
- 作者解读:作者称收益并非只来自增加可训练 token,把 token 绑到可信与不可信区域是主要来源;偏好项进一步压低 SEP ASR,并保持或提高 WinRate。
自适应攻击
- 测了什么:Delimiter-Spoof。攻击者完全知晓四个分隔符和输入结构,在注入内容周围伪造分隔符,以模仿、结束或重开区域。五种变体分别测试,报 worst-case ASR;这些变体也用于训练增强。
- 结果:Table 3 的 Plain Injection 与 Adaptive Attack 为:Llama3-8B-Instruct 均为 0.00%;Llama3.1-8B-Instruct 均为 0.48%;Falcon3-7B-Instruct 均为 0.00%;Qwen2.5-7B-Instruct 由 0.00% 到 0.48%。论文未说明该表基准,也未定义 Plain Injection。Llama3.1 的 Plain Injection 0.48% 与 Table 1 中 AlpacaFarm 的 0.00% 不同。
- 作者解读:作者称显式伪造分隔符语法几乎不比普通注入更有效;防御编码在与真实结构边界绑定的嵌入里,伪造文本不会自动获得同样的信任语义,因此更难绕过。
其他消融与分析
- 论文未报告学习率、λ、β、epoch 或分隔符个数的额外扫描。
- Llama3-8B-Instruct 上,Sandwich 的 AlpacaFarm ASR 为 56.7%,高于无防御 55.29%;Reminder 的 TaskTracker ASR 为 19.8%,高于无防御 16.4%。
- Falcon3-7B-Instruct 与 Qwen2.5-7B-Instruct 上,TextGrad 的 AlpacaFarm ASR 为 97.1% 与 97.6%,高于无防御 89.9% 与 93.75%;Llama3-8B-Instruct 上其 SEP WinRate 为 1.1%。
- SecAlign-LoRA 的 SEP ASR 在 Falcon3-7B-Instruct 上为 35.4%,在 Qwen2.5-7B-Instruct 上为 14.7%。
- TaskTracker 上 Llama3.1-8B-Instruct 的 StruQ-Full 为 0.18%,LTBD 为 0.19%。作者称推理开销可忽略,但未给延迟或额外 token 数。
有什么可以进一步探索的点?
论文未在结论或附录中专门写出局限或后续工作。
作者指出的局限与后续方向
论文没有 Limitations、Discussion 或 Future Work。结论只称在输入层学习信任边界是一种简单且有效的做法,并称推理开销可忽略,没有写成局限或后续工作的原句。论文未专门讨论局限。
实验覆盖范围
- 安全与效用实验使用 Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct、Qwen2.5-7B-Instruct 四个开源指令微调模型(Section 3.1、Table 1)。
- 安全基准为 AlpacaFarm(Ignore、Completion、Ignore-Completion 的 worst-case ASR)、SEP、TaskTracker、CyberSecEval2;效用为这两个数据集上的 WinRate,评审是 GPT-4o,参考是 GPT-4 Turbo(Section 3.1)。论文未报告各基准样本量和重复次数。
- 对照包括无防御、Reminder、Sandwich、TextGrad、DefensiveToken、StruQ-LoRA、StruQ-Full、SecAlign-LoRA(Table 1)。训练用 Cleaned Alpaca(约 51K),单 epoch,学习率 0.1,λ = 0.3,β = 0.1。
- 消融在上述前两个模型上比较前缀放置、边界放置和是否使用偏好损失(Table 2)。自适应评测是 Delimiter-Spoof 五种变体的 worst-case,且这些变体也用于训练增强(Section 3.4、Table 3)。论文未说明 Table 3 的基准,也未报告 ASR 判定器及与人工的一致性。
- 引言写明闭源模型上修改参数往往不可行,并以此作为冻结 LLM 的动机;实验报告的是上述四个开源模型。论文未报告闭源模型上的结果,也未报告推理开销的具体数值。
总结一下论文的主要内容
LTBD只训练四个分隔符嵌入;作者称AlpacaFarm上ASR为0.00%,效用代价小。
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
- 问题:作者认为,两类内容进的是同一序列,模型却没有信任来源的显式表示,外部数据里的指令式文本会争夺行为权威。
- 做法:分隔符分别包住指令区与数据区;冻结模型先产生良性响应和攻击诱导响应,再以交叉熵加偏好损失只更新四个嵌入。实验里训练一个 epoch,学习率 0.1,λ = 0.3,β = 0.1。数据来自 Cleaned Alpaca(约 51K),一半保持原样,另一半在外部数据非空时注入 Ignore、Completion 或 Delimiter-Spoof。
- 主结果:Table 1 中四个模型的 AlpacaFarm worst-case ASR 均为 0.00%;TaskTracker ASR 为 0.13%、0.19%、0.11%、0.14%。CyberSecEval2 ASR 为 7.27%、7.27%、1.82%、12.73%。AlpacaFarm WinRate 为 35.73%、30.98%、36.42%、41.71%。
- 对照:作者称它优于推理时防御,并接近会更新模型的 StruQ 与 SecAlign,且多数效用评测不低于无防御。表格反例包括:Llama3-8B-Instruct 的 CyberSecEval2 上 TextGrad 为 1.8%;Llama3.1-8B-Instruct 的两项 WinRate 低于无防御。
- 机制检查:Table 2 里,把 token 从纯前缀改到边界后,Llama3.1-8B-Instruct 的 AlpacaFarm ASR 从 23.08% 到 0.48%,完整目标再到 0.00%。Table 3 中伪造边界的 worst-case ASR 为 0.00% 或 0.48%,论文未写明基准。作者称优势来自与真实边界绑定的嵌入,而不是分隔符的表面文字。
- 作者结论:作者认为,在输入层把信任边界学出来、而不修改 LLM,就可以在较小效用代价下防御提示注入。论文未专门讨论局限。