跳到正文
原文
Hugging Face Daily Papers·原文 · 入选 精选关注度82

同字节不同权限:保留 token 表示如何放大聊天模板提示注入

Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection

AI 导读

论文在字节完全相同、仅 token id 不同的条件下对比聊天模板注入,发现把伪造角色标记编码为普通子词后,Llama-3.1、GLM-4.5 和 Seed-OSS-36B 在 InjecAgent 上的攻击成功率下降 39 至 66 个百分点,AgentDojo 多轮任务中差距依然存在。作者用 Matched 对照控制额外 token 数量,确认差距来自保留 token 的学习向量而非标记文本;在 Llama-3.1 上,嵌入空间最近的普通 token 向量可完全恢复攻击。指令微调会加强模型对保留标记的偏好,抑制 Qwen3-8B 的推理块会把直接危害上的差距从 8.1 扩大到 49.8 个百分点。

论文速读

问题
LLM agent 把工具输出和 system prompt 读进同一 token 流,恶意工具结果可伪造聊天模板标记。已有工作把这类攻击归因于模板文本结构,但伪造标记同时带有文本和保留 token id 两种属性,二者未被区分。
方法
在字节完全相同的前提下,只改变伪造标记是否以 reserved id 编码(Reserved vs Split),并加入 token 数相同的 Matched 对照,定义 identity gap Δ=ASR(Matched)−ASR(Split);在 InjecAgent 与 AgentDojo 上测多个开源模型,并做 embedding 向量替换与自适应拼写搜索。
实验与结果
在 Llama-3.1、GLM-4.5、Seed-OSS-36B 上,去掉 reserved id 使攻击成功率下降 39–66 pp,多轮 AgentDojo 上差距仍在;Qwen3-8B 上主要是标记文本起作用,此前报告的零效应源于读数已接近 100%。权威来自标记位置那一个学习向量,指令微调会加强模型对 reserved 标记的偏好;现有 tokenizer 缓解只覆盖 special token,未覆盖承载工具输出的 tool-protocol token。
局限与可以继续做的
只研究自托管开源模型,接受纯字符串的托管 API 不在范围内;InjecAgent 的成功判据是下一轮解析出的工具调用,执行级成功只在 AgentDojo 上测;向量替换干预的是模型输入而非攻击者可发送的字节。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文用固定字节、只改 token id 的对照,量化了保留 token 表示在聊天模板注入中贡献多少攻击成功率,并指出常见缓解只覆盖特殊 token。

阅读原文huggingface.co