跳到正文
原文
论文追踪· arXiv:2605.08313· Ziyang You, Xiaoke Yang, Zhanling Fan, Feng Guo, Xiaogen Zhou, Xuxing Lu·本站收录 · 原文发表

研究者提出 SeedHijack 攻击,劫持 LLM 采样随机数种子

Seed Hijacking of LLM Sampling and Quantum Random Number Defense

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

SeedHijack劫持PRNG强制选token;GPT-2注入538/540,另有QRNG对照0/100。

威胁模型供应链对手破坏LLM推理框架内的PRNG实现。

问题
LLM自回归采样依赖可预测的PRNG。作者认为供应链对手可不改权重、输入和logits,强制选出指定token;RLHF等对齐只改分布,不改采样器。
方法
SeedHijack替换采样器读到的均匀随机数,使逆变换落在目标token的CDF区间,且不改logits。防御用QRNG600的预缓冲硬件随机数代替MT19937。
实验与结果
GPT-2(124M)9组配置精确注入538/540。Table 2四模型各180次为100.0%。另100次试验PRNG为100/100、QRNG为0/100,论文未写模型。
局限与可以继续做的
作者写出三点:需供应链接入而非远程利用;验证到7B、未做70B+;QRNG缓冲需定期补充。实验为5个模型上的token ID匹配;论文未报告检测器与CSPRNG的定量结果。
实验设置GPT-2 (124M)、Qwen2-1.5B-Instruct 等 · 20 diverse prompts (news completion, code generation, dialogue, creative writing)、100-trial defense benchmark · exact token match、injection rate 等
威胁模型
供应链对手破坏LLM推理框架内的PRNG实现。论文称为white-box runtime attack:需直接访问推理进程内存空间,并取得采样所用的后处理token概率分布;不需要模型结构、权重或训练数据。不改权重、用户输入或logits,把PRNG输出换到目标token的CDF区间。
被测模型
GPT-2 (124M)Qwen2-1.5B-InstructDeepSeek-R1-1.5BQwen2-7B-InstructDeepSeek-R1-Distill-Qwen-7B
基准
20 diverse prompts (news completion, code generation, dialogue, creative writing)100-trial defense benchmark
指标
exact token matchinjection rateper-token latencymemory
AI 导读研究者提出 SeedHijack,一种通过操纵伪随机数生成器(PRNG)输出、在不改变模型 logits 的情况下强制模型选中攻击者指定 token 的后门攻击。在 GPT-2(124M)上的 540 次试验中,该攻击在 9 种采样配置下实现 99.6% 的精确 token 注入,并在四个对齐模型(1.5B-7B,涵盖 RLHF、SFT 与推理蒸馏)上达到 100% 成功率,绕过了本工作测试的全部对齐方法。作者同时提出基于硬件量子随机数生成器(QRNG)的防御,在其评估的威胁模型下可消除该攻击,中位开销为延迟增加 0.6%、内存增加 7.7 MB。

研究者提出 SeedHijack,一种通过操纵伪随机数生成器(PRNG)输出、在不改变模型 logits 的情况下强制模型选中攻击者指定 token 的后门攻击。在 GPT-2(124M)上的 540 次试验中,该攻击在 9 种采样配置下实现 99.6% 的精确 token 注入,并在四个对齐模型(1.5B-7B,涵盖 RLHF、SFT 与推理蒸馏)上达到 100% 成功率,绕过了本工作测试的全部对齐方法。作者同时提出基于硬件量子随机数生成器(QRNG)的防御,在其评估的威胁模型下可消除该攻击,中位开销为延迟增加 0.6%、内存增加 7.7 MB。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    供应链对手可劫持采样PRNG,在不改logits时强制选出指定token。

    LLM 自回归采样依赖可预测的 PRNG,供应链对手可在不改模型与 logits 的情况下强制选出指定 token。

    • 场景:作者称每个 token 最终取决于采样器消耗的随机数;PyTorch、HuggingFace Transformers、vLLM、TensorRT-LLM 的默认 PRNG 是 MT19937。作者认为状态已知则输出可预测,而现有防御很少审视这一层。
    • 现有不足:作者称 prompt injection、越狱、数据投毒和对抗鲁棒性方面的研究都未覆盖这一供应链面。RLHF 与蒸馏只改概率分布,不改把分布变成 token 的采样机制。
    • 观察:作者称 MT19937 的内部状态可由 624 个连续输出重构;把采样随机数放进目标 token 的 CDF 区间,即可按作者的论证选中该 token,且不改权重、提示词或 logit。
    • 提出的方法:攻击名为 SeedHijack;防御是用硬件 QRNG 替换 PRNG。作者称在所评估的威胁模型下,后者使攻击者不能锁定 token。
    • 威胁模型:
      • 对手:供应链对手,破坏 LLM 推理框架里的 PRNG 实现。论文将此称为 white-box runtime attack。
      • 知识:不需要模型结构、权重或训练数据;需要采样所用的后处理后 token 概率分布。
      • 能力:直接访问推理进程的内存空间;论文写可通过 624 个连续输出,或直接读取被破坏模块,取得 PRNG 状态并替换其输出。
      • 目标:在任意位置强制生成指定 token。受害的是使用该 PRNG 的推理采样过程。不修改权重、用户输入或输出 logits。
  2. 有哪些相关研究?

    相关讨论在引言与Discussion;作者称把PRNG利用扩到LLM采样。

    论文没有独立的 Related Work,相关讨论在引言和 Discussion。

    采样与 PRNG 利用

    • 默认采样:Holtzman 等(2020)说明下一个词由随机抽样决定;Matsumoto 与 Nishimura(1998)给出 MT19937。论文据此说明状态已知则采样输出可预测。
    • 直接前作:Dahiya 等(2024)在 Randomized Smoothing(Cohen 等,2019)上利用 PRNG。作者称本文将该利用扩到 LLM 文本生成,并称前者所针对的防御部署有限,而自回归采样影响文中点名的生产框架。
    • 输入侧方向:引言把 prompt injection、jailbreaking、data poisoning 与 adversarial robustness 列为研究已多、但对采样层审视有限的方向,越狱文献以文献 [4–6] 概括。论文未与这些方法做成功率对比。

    后门与检测对照

    • 权重后门:BadNets(Gu 等,2019)、TrojanNN(Liu 等,2018)。作者称它们改参数并留下梯度痕迹;SeedHijack 不改权重或输入。
    • 对抗样本:Goodfellow 等(2015)。作者称梯度引导扰动会改输入,监控可以标记。
    • 检测:作者称 logit 审计、困惑度监控、权重完整性校验、neural cleanse、Raghunathan 等(2018)的 certified defenses、Wong 与 Kolter(2018)的可证明验证、Papineni 等(2002)的 BLEU 都发现不了该攻击。论文未报告这些检测器的数字。

    对齐与随机数来源

    • 对齐:Ouyang 等(2022)的 RLHF、Rafailov 等(2023)的 DPO、Ji 等(2023)的 BeaverTails。作者称它们只改分布 P,与采样层安全正交。
    • CSPRNG:作者认为,仅观测输出时 CSPRNG 能抵抗状态预测;若随机数模块被替换或挂钩,返回值仍由对手控制。论文未做该对照实验。
    • QRNG 文献:Herrero-Collantes 与 Garcia-Escartin(2017)、Ma 等(2016);Pironio 等(2010)与 Bierhorst 等(2018)讨论 Bell 定理认证的随机数。作者用这些工作支撑硬件随机数不可预测的说法。SolarWinds 与 XZ Utils 只用于说明依赖被破坏可以影响下游,不是方法对比。

    基线与定位

    • 基线:防御对照是 MT19937 采样下的同一攻击。Table 3 定性对比 prompt injection、model poisoning、jailbreaking、adversarial examples,没有其他攻击的实测成功率。
    • 数据:20 条提示词,覆盖新闻续写、代码生成、对话、创意写作。无命名公开基准。
    • 定位:作者称采样层安全不能还原成对齐或输入过滤,并把 Dahiya 等的 PRNG 利用从 Randomized Smoothing 扩到 LLM 生成。Table 3 表注使用 unique 一词,指不改模型、不改输入、Detectable 为 No 且确定性控制这一组合。
  3. 论文如何解决这个问题?

    SeedHijack替换采样随机数以命中目标CDF区间,QRNG使该数不可预测。

    整体思路是不改模型分布,只控制采样随机数:SeedHijack 把均匀随机数换进目标 token 的 CDF 区间;防御用硬件 QRNG 使该随机数不可预测。

    问题设定

    • 采样规则:模型给出词表分布 P 后,用均匀随机数 u 做逆变换采样。附录 B 式 (1) 写 F(t)=∑i=1tpi,并要求 F(t−1) ≤ u < F(t)(F(0)=0)。
    • 生成器:默认 PRNG 为 MT19937。附录 B 写内部状态为 624 个 32 位字,共 19,968 位,特征多项式次数 19,937。作者称观测 624 个连续 32 位输出就足以确定全部状态,之后输出可预测。周期的幂次在所给文本中未分开书写,故不转写。
    • 精度条件:作者称目标概率需大于 float32 机器精度,文本记为 ε_mach≈1.19×10−7,区间才可表示;并称此时注入成功概率为 1。

    SeedHijack

    • 状态:论文给出两条取得状态的途径:观测 624 个连续输出,或在供应链场景中直接读取被破坏模块的内部状态。附录 A 写了读取方式,这里不复述调用细节。实验中攻击在推理期间持续开启。
    • 替换:拦截采样调用,根据当前 softmax 分布计算 CDF,使返回的均匀数落在目标 token 区间内。只改这一处随机数;tokenizer、前向与后处理不动,分布 P 不变。
    • 作者的隐蔽性说法:不改 logits、token 概率或生成统计,因而作者称 logit 审计、困惑度监控和权重完整性校验看不到常规后门。论文未给这些检测器的拦截数字。

    QRNG 防御

    • 设备:QRNG600 PCIe 卡,用光学零差探测真空涨落,PCIe 3.0,持续 600 Mbps。附录 A 称安全依据是真空态正交分量上的海森堡不确定性,与校准无关;原始信号经 Toeplitz 提取,作者称通过 NIST SP 800-22。
    • 接入:离线生成 5,000 万个 [0, 1) 的 float64 数,磁盘 400 MB;运行时内存映射,每个 token 取一个数,耗尽则异步补充。作者称进程内存增加 7.7 MB,中位延迟相对按需 MT19937 增加 0.6%。
    • 论证:附录 B 写正交观测量服从 N(0, 1/2),并给出 I(UQ; E)=0,E 为测量前已固定的对手侧信息。作者称落入目标区间的概率只等于该 token 的自然概率,计算无界的对手也没有额外优势。
    • 相对 CSPRNG:作者认为软件 CSPRNG 挡得住只看输出的预测,挡不住替换随机数模块;QRNG 在独立硬件信任边界上,篡改需要硬件访问或驱动被破坏,并可做在线统计检验。此段没有实验数字。

    成功判定

    • exact token match:payload 每个位置的 token ID 都要与目标一致,任一位置不同则整次试验失败。附录 C 写攻击者指定多 token 字符串再分词;文本未给出 payload 长度,也没有示例句子。
    • 过滤:附录 C 写只针对概率高于机器精度的 token。正文仍报告有试验因目标概率低于 10−7 而失败。评测不用 LLM 评审。
  4. 论文做了哪些实验?

    GPT-2上538/540(99.6%)精确注入;Table 2四对齐模型为100.0%;QRNG为0/100。

    实验设置

    • 环境:PyTorch 2.1.0、Transformers 4.35.2、CUDA 12.2、cuDNN 8.9.4,单卡 NVIDIA RTX 3090(24 GB VRAM)。附录 C。
    • 模型:GPT-2(124M,float32,无对齐);Qwen2-1.5B-Instruct(RLHF+SFT)、DeepSeek-R1-1.5B(reasoning distillation)、Qwen2-7B-Instruct(RLHF+SFT)、DeepSeek-R1-Distill-Qwen-7B(reasoning distillation),后四者均为 bfloat16。仅写明 Qwen2-1.5B-Instruct 用 chat template,DeepSeek-R1-1.5B 用原生提示格式。
    • GPT-2 网格:20 条提示词,类别为新闻续写、代码生成、对话、创意写作。τ 取 0.7、1.0、1.5,top-p 取 0.9、0.95、1.0,共 9 组;每组 20 条提示词 × 3 个种子 = 60 次,合计 540 次。
    • 对齐模型:每模型 3 组采样配置、每组 60 次,共 180 次;四模型合计 720 次。论文未说明是哪 3 组,也未说明提示词条数。
    • 指标:exact token match,全 payload 的 token ID 一致才算成功。无 LLM 评审,无人工一致性,未报告 payload 长度。
    • 防御测量:独立 100 次试验,对照为 MT19937 上的同一攻击。延迟取 1,000 次推理迭代的每 token 时间,排除 50 次预热。论文未说明这 100 次试验和延迟、内存测量用的是哪个模型。均匀性检验为 100 个 bin 的 Pearson 卡方,p>0.99;样本数幂次在文本中未分开,不转写。

    主结果

    据 Table 1(GPT-2,9 组)与 Table 2(每模型 3 组)。Table 2 表头把两款 DeepSeek 模型写作 DeepSeek-R1 1.5B 与 DeepSeek-R1 7B。

    表格较宽,可左右滑动

    模型条件成功/试验注入率
    GPT-2 (124M)9 组 τ×top-p538/54099.6%
    Qwen2-1.5B-Instruct3 组配置180/180100.0%
    DeepSeek-R1-1.5B3 组配置180/180100.0%
    Qwen2-7B-Instruct3 组配置180/180100.0%
    DeepSeek-R1-Distill-Qwen-7B3 组配置180/180100.0%
    • Table 1 有两格不是全成功:τ=1.0、top-p=1.0 为 59/60(98.3%),τ=1.5、top-p=0.9 为 59/60(98.3%),其余七格为 60/60。Figure 2 标出的九格与 Table 1 相同。作者把这两次失败归于目标概率低于 10−7,区间窄于 float32 机器精度。
    • 作者称注入不随 temperature、top-p 变化,并称 top-k 截断与 entropy-based sampling 也不影响精度。附录 C 的网格只有 temperature 与 top-p,论文未给出后两者的试验数。
    • Table 2 另把 GPT-2 在 3 组配置下记为 180/180。作者称 RLHF、SFT、reasoning distillation 以及 1.5B 到 7B 的规模都不构成防御,因为攻击在分布算完之后才作用。

    QRNG 对照

    • 注入:Figure 3a 中 PRNG 为 100/100,QRNG 为 0/100。正文另称注入率从 99.6% 降到约 1/V;1/V 不是这 100 次的实测值,这 100 次的 QRNG 结果是 0/100。论文未写明该试验的模型。
    • 延迟:Figure 3c 标出中位 12.58 ms 与 12.65 ms(标注 +0.6%),均值 12.81 ms 与 13.21 ms(标注 +3.1%),P95 一侧为 13.34、另一侧为 21.30(图内标注 +59.7%)。正文与图注写 P95 增至 21.30 ms(+59.4%)。作者把尾部归于内存映射缺页,并称 pinned memory 可去掉;论文未报告去掉之后的测量。测量用的模型未写明。
    • 内存与均匀性:作者称内存增加 7.7 MB。Figure 3b 标出 1306.1 与 1313.7,并标注 +7.7 MB。卡方检验 p>0.99,作者称未见偏离均匀分布。

    定性对照

    • Table 3 把 PRNG hijack 标为不改模型、不改输入、Detectable 为 No、Deterministic 为 Yes(99.6%)。prompt injection、model poisoning、jailbreaking 的 Detectable 为 Yes,adversarial examples 为 Partially,四者 Deterministic 均为 No。这是定性表,不是检测器实测。
    • 作者称困惑度监控、certified defenses 与 BLEU 等不能发现该攻击。论文未报告真阳或漏检。
    • 作者讨论 CSPRNG 不能应对替换随机数模块的对手。论文未报告 CSPRNG 实验。

    其他消融与分析

    • 失败条件:正文称两次失败的目标概率低于 10−7(对应 Table 1 的两格 59/60)。
    • 均匀性:100 bin,Pearson 卡方 p>0.99(附录 C)。
    • 延迟样本:1,000 次迭代,排除 50 次预热;论文未写模型。
    • 论文未报告 payload 长度、对齐实验的 3 组具体参数、检测器数字、CSPRNG 对照。
  5. 有什么可以进一步探索的点?

    作者写出三点局限:需供应链接入、未验证70B+、QRNG缓冲需补充。

    作者指出的局限与后续方向

    • 接入方式:攻击需要供应链访问,而不是远程利用。作者同时称 SolarWinds 与 XZ Utils 说明该威胁现实,且 increasingly common。出自 Discussion。
    • 模型规模:经验验证到 7B。作者称机制原则上与模型无关,但未在 70B+ 上验证;更尖锐的分布可能影响 CDF 区间计算。出自 Discussion。
    • 缓冲:预缓冲 QRNG 需要定期补充。作者称 600 Mbps 远高于通常每秒数千 token 的消耗,正常负载下耗尽不切实际。出自 Discussion。

    论文没有单独的 Future Work。代码与实验数据写的是发表后公开,属于计划(Data availability、Code availability)。

    实验覆盖范围

    • 被测模型为 GPT-2(124M)、Qwen2-1.5B-Instruct、DeepSeek-R1-1.5B、Qwen2-7B-Instruct、DeepSeek-R1-Distill-Qwen-7B,共 5 个;硬件为单卡 RTX 3090(附录 C、Table 2)。
    • GPT-2 为 20 条提示词、3 个种子、9 组 τ×top-p,540 次(Table 1)。四个对齐模型各 180 次、3 组未写明的采样配置(Table 2)。论文未写对齐模型的提示词条数。
    • 防御为独立 100 次,对照是 MT19937;延迟为 1,000 次迭代(Figure 3、附录 C)。设备为 QRNG600。论文未写这组试验的模型。
    • 成功标准是 token ID 全匹配。论文未报告 LLM 评审、人工评估、payload 长度,也未报告检测器或 CSPRNG 的定量结果。
    • 正文点名 PyTorch、HuggingFace Transformers、vLLM、TensorRT-LLM 默认使用 MT19937。附录 C 写明跑过的实现是 PyTorch 2.1.0 与 Transformers 4.35.2。
  6. 总结一下论文的主要内容

    采样层PRNG被替换以强制选token;GPT-2为99.6%,四对齐模型为100.0%,QRNG对照0/100。

    SeedHijack 把 LLM 采样用的 PRNG 输出换成攻击者选定的数,从而指定下一个 token;权重、输入和 logits 都不改。防御是用硬件 QRNG 替换该随机源。

    • 问题:作者认为 MT19937 状态可由 624 个连续输出确定,而 RLHF、SFT 与蒸馏只改分布、不改采样器。
    • 做法:在采样调用处让均匀随机数落入目标 token 的 CDF 区间;概率需高于 float32 机器精度。QRNG600 以预缓冲方式提供每个 token 的随机数。成功标准是 payload 上 token ID 全部一致。
    • 攻击数字:GPT-2(124M)在 9 组 temperature×top-p 的 540 次试验中有 538 次全匹配(99.6%,Table 1),两格为 59/60。Table 2 里四款 1.5B/7B 对齐模型各 180 次均为 100.0%。
    • 防御数字:独立 100 次试验里 PRNG 为 100/100、QRNG 为 0/100(Figure 3a);论文未写这组试验的模型。Figure 3c 中位延迟为 12.58 ms 与 12.65 ms;作者称内存增加 7.7 MB,P95 增至 21.30 ms。
    • 作者的结论:采样层不能还原成对齐或输入过滤。作者称在所评估威胁模型下,QRNG 使对手无法预计算 CDF 命中。作者同时列出三点限制:要有供应链接入、未在 70B+ 上验证、缓冲需要定期补充。
阅读原文arxiv.org