输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%
Prefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs
AI 导读
该研究首次系统隔离推理模型的 scratchpad 推理通道作为输出前缀攻击面,在 AdvBench 的 1,800 个测试用例上对 Gemini 3 Flash Preview、DeepSeek V4 Flash 和 Claude Haiku 4.5 三个前沿模型做了 3×2 因子实验(前缀类型 × 是否注入恶意推理)。结果显示,单独注入恶意推理几乎无效(攻击成功率约 0%),但同样的推理加上一句简单的输出前缀后,部分模型的攻击成功率最高升至 99%。上下文相关前缀优于静态前缀,且易感性高度依赖模型:Claude Haiku 4.5 在所有策略下攻击成功率不超过 1%,Gemini 3 Flash Preview 在推理加静态前缀下达 99%,DeepSeek V4 Flash 从静态前缀的 19% 升至上下文前缀的 56%。
论文速读
- 推理模型会在最终回答前生成 scratchpad 推理,部分 API 允许编辑该推理字段。作者想弄清:把 output-prefix 攻击指向推理通道时,模型是更稳健还是更易被越狱。
- 作者用 3×2 因子设计(prefix 类型 × 是否注入恶意推理),在 AdvBench 的 100 条恶意提示上攻击 Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5,共 1800 个测试用例,并用 LLM judge 打分。
- 单独注入恶意推理几乎无效(ASR≈0%);但同样的推理加上一个简单 output prefix 后,部分模型 ASR 最高达 99%。contextual prefix 优于 static prefix,且易感性因模型而异,Claude Haiku 4.5 近乎免疫。
- 作者指出只研究了三个模型和一个数据集(AdvBench),结果未必能推广到其他对齐策略与推理实现;评估依赖单一自动 judge,仅在一个 tactic/model 上做过人工验证。后续可纳入更多模型与基准(如 MaliciousInstruct),并测试更长、更复杂的提示以验证 token 分布假设。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文用 3×2 因子设计在三个前沿模型上量化了推理通道注入的增益,并给出推理单独注入为何无效的 token 分布解释。