研究揭示 LLM 按 token 计费可被服务商系统性虚报
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
作者攻击CoIn、PALACE与鞅审计,称CoIn整段重复平均虚增1469.0%仍通过。
财务动机的不诚实提供方端到端运营不透明LLM服务,目标是提高上报token数并通过审计。
- 商业LLM按token计费,但提供方隐藏模型、分词器与执行,审计只能检查其自报证据。隐藏推理上的虚报因此难以被用户直接核对。
- 作者分别攻击CoIn、PALACE和可见推理上的鞅审计:复用或生成推理块、改写答案或投毒辅助数据、选择性多报并用小幅少报扩大松弛。
- CoIn上整段重复平均虚增1469.0%仍被两个验证器接受;PALACE后门对触发样本平均虚增247.16%;可见推理时补偿偏移的总虚增为50.85%且低于阈值。
- 作者称结果针对现有审计器而非不可能性,虚增率可能随部署变化,且只推动、并未给出与提供方无关的验证。实验覆盖文中三个框架和列出的公开推理数据,未评测已部署商业服务。
- 威胁模型
- 财务动机的不诚实提供方端到端运营不透明LLM服务,目标是提高上报token数并通过审计。它运行模型、分词、生成可隐藏的推理R、格式化答案并出具账单;PALACE的辅助数据也由其控制。用户通常只见提示词、答案与账单,部分部署可见推理文本。
- 被测模型
- PALACE domain-adapted auditor
- 基准
- Glaive reasoning-v1-20mMedical-R1-Distill-DataOpenThoughts-CodeOpenR1-Math-220kOpenThoughts-Math
- 指标
- InflationPercentmean inflationpredicted reasoning-token countsuccess rateZiMt
研究者指出,按 token 计费已成为商用大语言模型的标准定价方式,但服务商隐藏模型、tokenizer 与执行过程,使审计只能核验服务商自己提供的证明,形成信任悖论。他们考察三个近期的 token 审计框架,发现具备普通商业能力的服务商可系统性虚报计费 token 数:在最宽松设置下,隐藏的推理用量平均可被虚报 1,469%,按当前前沿推理模型价格,同一查询的 100 美元诚实账单会变成约 1,569 美元;即使用户能看到完整推理字符串,仅 tokenization 歧义一项仍可在检测阈值以下造成 50.85% 的虚报。作者认为问题不在某个具体审计器,而在于任何以被审计方提供证据为基础的审计,恢复诚实计费需要将上报 token 数与服务商无法控制的证据绑定,例如可信执行环境证明、推理的密码学证明或第三方重执行。
深度解读
这篇论文试图解决什么问题?
按token计费时审计只能核验提供方自报证据,不诚实提供方可虚增用量并通过三种近期审计。
不透明 LLM 按 token 计费时,审计只能检查提供方提交的证据,财务动机的提供方可以虚增上报用量并通过现有审计。
- 场景:作者称前沿推理模型每百万 token 达数十美元,虚报会在规模上变成大额超收。商业推理 API 常只返回摘要或短答案,仍按用户看不到的隐藏推理计费,虚报按设计不可见。
- 现有不足:作者称,为保护知识产权、缓解越狱并保护隐私,提供方隐藏模型、分词器与执行,审计者没有独立证据,只能查相似度、由提示词和答案预测的长度,或上报计数的聚合统计。作者称之为 trust paradox:信任恰好落在提供方最有理由操纵的产物上。
- 假设:作者认为三种框架的假设对合作方说得通,但对财务动机对手很脆弱,且造出能通过检查的证据成本低。作者写明并不声称 token 计数审计不可能。
- 本文做法:对 CoIn、PALACE 与鞅统计审计器做对抗分析。作者称普通商业能力即可系统性虚增上报 token,诚实计费需把计数绑定到提供方不控制的证据,如可信执行证明、推理的密码学证明或第三方重执行。
- 威胁模型
- 目标:提高上报 token 数并同时通过审计。
- 受害系统:不透明 LLM 服务。用户交 P、收 A,按上报 m 付费;R 可隐藏但计入用量。
- 能力:提供方端到端运行模型、分词、生成 R、格式化 A 并出账。PALACE 的辅助训练数据也由其提供。不能独立验证的轨迹、嵌入、答案、辅助标签与上报计数都在攻击面内。
- 可见性:用户通常只见 (P, A, m),部分部署可见 R 文本。CoIn 要求提供方用审计嵌入模型计算嵌入,作者称其可在提交前用同一评分函数本地筛选再承诺。
有哪些相关研究?
相关工作分不透明计费审计、模型替换检测,以及分词歧义与可独立核验的证明机制。
论文把相关工作分成不透明服务的计费诚信,以及另一条模型替换检测,并在 Discussion 里讨论与提供方无关的核验。
不透明 API 的 token 审计
- Sun et al. (2025b) 与 Velasco et al. (2025b) 指出需要审计不透明 LLM API,以及按 token 计费下的滥用激励。
- CoIn(Sun et al., 2025a)与 PALACE(Wang et al., 2025)在看不到隐藏推理时审计 token 虚增;Velasco et al. (2025a) 研究推理文本可见时由分词歧义造成的虚报。作者在这三套上做对抗分析,并称其假设可被不诚实提供方系统性利用。作者还称这三套此前未经过系统性对抗分析。
模型替换检测
- Cai et al. (2025) 考察宣传某一模型、实际提供更便宜替代模型的威胁。Zhu et al. (2025) 提出基于秩的均匀性检验;Sun et al. (2024) 提出基于秘密的验证协议 SVIP。
- 作者的对照只挂在这条线上:模型替换可能降低输出质量并被用户察觉(文中引 Kaplan et al. 2020、Chung et al. 2024、Wei et al. 2022),token 虚增则主要改账单,可见输出大体不变。作者因此聚焦后者。
隐藏推理与分词不唯一
- 引言给出隐藏推理的理由:完整轨迹可能被用来训练类似模型(Guo et al. 2025;Carlini et al. 2024),便于 chain-of-thought hijacking(Kuo et al. 2025),也可能从中间步骤泄露用户信息(Tamber et al. 2025)。
- 背景引用 Sennrich et al. (2016)、Kudo and Richardson (2018) 与 Gastaldi et al. (2024):不同 token 序列可解码为同一字符串。作者称所研究的审计框架试图收紧这一松弛。
与提供方无关的核验
- Discussion 提到可信执行环境(Costan and Devadas 2016;Tramer and Boneh 2018)和计算的密码学证明(Parno et al. 2016 的 Pinocchio;Chen et al. 2024a 的 zkML)。作者认为它们可证明执行了声明的计算,且上报值与形式化计数器一致,但不自动证明 GPU 时间、显存、能耗或服务成本。
作者将本文定位为对 token 计数审计的结构性诊断,而不是再加一种一致性检查。论文未把外部攻击方法列为基线。
论文如何解决这个问题?
分别打破CoIn、PALACE与鞅审计的假设:复用或生成轨迹、操纵答案或辅助数据、选择性虚报。
作者不提出新审计器,而是在 CoIn、PALACE 与 鞅统计审计 上,利用协议交给提供方的产物构造能通过检查的虚报:承诺的轨迹、答案与辅助数据,或可事先模拟的聚合统计。
计费对象与通过条件
- 用户提交 P,提供方观察 (P, R, A) 并上报 m。R 可隐藏并计入账单。
- CoIn 把轨迹切成 256-token 块,用 Merkle 树承诺;语义检查用 token-to-block 与 block-to-answer 两个匹配头,规则验证器与学习验证器都接受才算通过。虚增相对原始块数:InflationPercent = 100 · added / original,即仍被接受的追加块数除以原始块数再乘 100。块长固定,故块数比例等于 token 比例。
- 鞅审计用 Monte Carlo 估计期望计数。Zi = mi − m̂i 为上报减估计,正值表示该样本多报。偏差进入鞅统计量 Mt(从 M0 = 1 起连乘),Mt > 1/α 则标记。实验取 α = 0.05。附录 D 给出连乘形式。
- PALACE 比较 (P, A) 的预测与上报,偏离则标记。正文未给出该偏离的数值阈值。
打破 CoIn 的两项假设
- 假设 1:Merkle 只防止选定后改块,不检查最初承诺是否诚实。提供方决定承诺哪条轨迹。
- 假设 2:匹配头能把诚实推理与虚增内容分开。作者认为嵌入相近只说明语义接近,不说明该块来自模型推理;复制块嵌入与原块相同,按答案另生成的块也可以语义接近。
- 只改 R。变体包括随机再插入诚实块、整段反复追加、用两个匹配头的分数选出最对齐答案的块再复制,以及用微调 T5 或 LoRA 适配的 Qwen2.5-1.5B-Instruct 按答案生成新块。生成用贪心解码,再截断或用词表随机 token ID 填到 256。针对拒绝重复哈希,在复制内容前或后插入少量合法 tokenizer token。附录 B 给出迭代流程:任一验证器检出或加满 1000 块即停,并给出生成模板。
- 块复用探测比 0.75、生成块 0.5,阈值均 0.5。分析限于 2–7 块;作者称约 97% 受评样本落在此区间。作者称提供方按协议即可本地打分后再承诺,这不是额外攻击者假设。
打破 PALACE 的两项假设
- 审计器看到 P、A、上报计数和辅助数据 DA。提供方控制 A、DA 与上报计数,只有 P 来自用户。实验用官方领域适配审计器。
- 假设 1:由 (P, A) 作出的预测对答案长度、风格或某些 token 稳健。推理时攻击不改底层推理,只改返回答案的表面:在 A 末尾追加单个 token,或用 Qwen3-14B 做保持原意的风格改写。作者提到的简单防御是审计前规范化 A;自适应改写不依赖异常结尾。附录 C 给出改写提示词。
- 假设 2:辅助数据忠实、无条件触发。定向投毒改 10% 辅助数据,把原计数低于 600 的标签改为五倍,并限制在三倍标准差内。后门在原计数低于 600 的训练样本的 5.2% 上,于答案开头放入提供方自选的触发短语,标签改为以 2917 为中心、加高斯噪声、仍在 3σ 内的虚高值。15K 子集均值 953.76、标准差 654.5,三倍标准差上界 2917.26。作者称审计方没有独立真值可交叉核对。
利用鞅审计的聚合松弛
- R 以文本可见,但计费 token 序列与上报计数仍不能独立核验。分词不唯一,提供方可选择解码为同一字符串的计费分词,并在上报前模拟公开的估计器与检验。
- 作者称两点:自然推理文本上 Monte Carlo 估计系统性偏高,诚实时 Zi 多为负,Mt 有负漂移;提供方知道估计器、阈值和数据集漂移,可把虚报放进这段松弛。
- 朴素策略是多数样本诚实上报、少数样本大幅多报,让负漂移吸收正偏差。更强策略对未虚报样本略微少报,把 Mt 推得更低后再提高虚报样本。审计只看聚合,小幅少报本身不被标记。主实验数据为 Medical-R1-Distill-Data;负漂移另在四个数据集上查看。虚报按审计窗口内总账单相对诚实总量的百分比报告。
论文做了哪些实验?
CoIn平均虚增1469.0%仍通过;PALACE后门247.16%;可见推理下鞅审计总虚增50.85%。
实验设置
- 被测对象:CoIn 官方模型与框架(论文未给出嵌入模型名称)、PALACE 官方领域适配审计器、Velasco et al. 的 Monte Carlo 估计加鞅检验。生成或改写用微调 T5、LoRA 适配的 Qwen2.5-1.5B-Instruct、Qwen3-14B。
- 数据:CoIn 与 PALACE 用 Glaive reasoning-v1-20m。鞅审计主实验用 Medical-R1-Distill-Data。附录 D.1 另用 OpenThoughts-Code、OpenR1-Math-220k、OpenThoughts-Math 与 Glaive,各前 100 条。论文未报告 CoIn/PALACE 主实验条数,只称约 97% 受评样本含 2–7 个推理块,分析限于该范围。
- CoIn:256-token 块;通过要求规则与学习验证器都接受。块复用探测比 0.75、阈值 0.5;生成块探测比 0.5、阈值 0.5;追加预算 1000 块。
- PALACE:只报告领域适配审计器。投毒比例 10%;后门为原计数低于 600 的训练样本中的 5.2%。标签限制在三倍标准差内。
- 鞅审计:α = 0.05,Mt > 1/α 则标记。正文朴素攻击为每第 10 个样本多报 2000 token。附录 D.3 窗口为 1000 个样本、1,895,697 个实际 token,偏移从 1 扫到 100。
- 指标与资源:CoIn 报接受后的块数虚增百分比;PALACE 推理时攻击报预测推理 token 的变化,投毒与后门报虚增比例和平均虚增率;鞅审计报 Zi、是否过阈值和总账单虚增百分比。论文未报告重复次数。附录 A:单张 NVIDIA A100 40 GB,不评测已部署商业服务。
主结果
表格较宽,可左右滑动
设定 攻击 数值 出处 CoIn,Glaive,双验证器都接受 DA 整段重复 平均虚增 1469.0% Figure 1(b) 同上 RB 随机复用 平均虚增 549.9% Figure 1(a) PALACE 领域适配审计器 触发后门 99.91% 的触发样本平均虚增 247.16% §4.2 PALACE,long 改写 预测推理长度 平均增加 30.30% Figure 2(a) 鞅审计,α=0.05,R 文本可见 补偿偏移 总虚增 50.85% Figure 3(b) - 作者称 Figure 1 的八个变体都未触发任一验证器,每样本为数秒量级计算;论文未报告具体耗时,也未报告该图样本总数。
- 作者称最高分块变体说明 CoIn 的分数可被当作攻击目标。作者按 CoIn 结果举例:100 美元诚实推理账单大约变为 1,569 美元。
- 引言把 PALACE 中信任提供方数据的情形写为 247%,第 4.2 节的后门平均虚增率见表。作者认为这些结果指向同一结构:证据来自被审计方时,审计只核验提供方选择展示的内容。
CoIn 的其余变体
- 测了哈希多样化与生成块。Figure 1 总体均值:HSB 1004.0%,T5 生成 770.0%,Qwen2.5-1.5B 生成 611.0%;加 token 后 RB 536.8%、DA 687.0%、HSB 984.8%。作者称相对朴素复用下降有限,因为加噪副本的嵌入仍接近原块。
- 作者称更短轨迹往往在被拒绝前允许更大相对虚增。Figure 4 按原始块数标注均值:RB 在 2 块为 1725.0%、7 块为 71.4%。DA 并不严格随块数下降:3 块 1086.5%,4 块 1890.9%。
- 拒绝重复哈希被作者描述为能抓住朴素复制、且很少影响诚实轨迹;论文未报告该防御对诚实轨迹的具体比例。
PALACE 的表面操纵与投毒
- 测了句末追加单个 token 与风格改写。boxed 使预测推理 token 平均增加 82.4、成功率 82%;nil 增加 73.7、成功率 80%;数字 token 9 增加 58.6、成功率 75%(§4.2,Figure 2(b))。verbose 改写使预测长度平均增加 16.62%(Figure 2(a))。
- Figure 9:使估计最大的变体里,long 占 58.0%,verbose 占 19.5%,原答案占 3.0%。作者称审计器受答案格式影响,而不只受推理长度影响。规范化 A 被说成能对付异常结尾,但接不住语义有效的改写;论文未给该防御的检出率。
- 10% 定向投毒:低于 600 token 的样本中 47.16% 被平均虚增 38.58%。作者称 400–800 区间被高估,更高计数样本大体不受影响(Figure 2(c))。未触发时,作者称行为接近未投毒基线(Figure 2(d))。
鞅审计的负漂移与注入幅度
- 正文:每第 10 个样本多报 2000 token,其余诚实。作者称 Zi 有正尖峰,但所评估序列上 Mt 未过阈值(Figure 3(a))。该图 Martingale 轴标注到 0.000100;正文阈值在 α=0.05 时为 1/α。论文未写明 50.85% 对应哪一档单样本注入量。
- 附录 D.2 写明是每隔一个样本注入 1000 到 3000 token:1000 与 1500 时 Mt 远低于阈值,2000 时更波动仍低于阈值,2500 与 3000 时越过阈值,3000 更早触发。正文则称同一附录的幅度扫描在每样本 2000 token 时仍可应付、2500 token 起开始失败。两处对抽样间隔的写法不一致。
- 附录 D.1:四个数据集各前 100 条上,作者称诚实上报时 Zi 仍以负为主,Mt 下降并远低于阈值;OpenThoughts-Code 负偏差最强,Glaive 波动更大并偶有正异常值。纯文本看不到曲线端点。附录 D.3:每第 10 个样本虚报时,1000 token 注入在偏移 24 首次不再被标记,净虚增 79,215 token;5000 token 注入在偏移 37,净虚增 467,502;10000 token 注入在偏移 41,净虚增 963,898。作者称最优偏移下净虚增为正。
其他消融与分析
- Figure 4(c) HSB 按块数均值:2 块 3150.0%,7 块 321.4%。
- Figure 5 哈希多样化:RB+token 在 2 块 3675.0%、7 块 71.4%;DA+tokens 在 2 块 1850.0%、7 块 250.0%;HSB+token 在 2 块 2925.0%、7 块 407.1%。
- Figure 6 标注均值:T5 在 2 至 7 块为 725.0%、1110.8%、863.6%、623.0%、595.8%、371.4%;Qwen 为 1125.0%、900.9%、657.6%、502.0%、750.0%、250.0%。图注写 mean reported count,纵轴为 Reported Count (% of Original),与正文的虚增百分比用语不完全一致。
- 附录 C.2:作者称这些触发 token 的作用随审计器骨干而变,换骨干可能消除这些特定 token,但提供方可对目标审计器重做扫描。论文未报告换骨干后的数字。
有什么可以进一步探索的点?
作者称这不是不可能性结果,虚增率可能随部署变化,且未给出与提供方无关的验证方案。
作者指出的局限与后续方向
- Limitations:只评估有代表性的近期审计器,不是全部未来防御;结果说明现有方法的弱点,而不是不可能性结果。
- Limitations:部分攻击需要提供方控制服务流水线、辅助数据、答案格式或分词,测得的虚增率可能随部署变化。
- Limitations:这些发现用来推动、而不是给出与提供方无关的 token 计数验证方案。
- Discussion:TEE 与密码学证明约束的是所声明的计算和计数器,不必然证明实际 GPU 时间、显存、能耗、批处理开销或服务成本;要证明这些成本,需要公开成本模型、服务流水线日志,并把被测量纳入证明陈述。
- Discussion:把上述机制用于 LLM 服务计费,需要改动现有部署流水线、明确成本定义,以及可扩展的审计基础设施。作者称这是有希望的方向。
- Conclusion:可靠的账单问责需要把上报 token 数绑定到与提供方无关的、关于实际执行计算的证据。这是作者提出的方向,不是已完成的机制。
实验覆盖范围
- 被攻击的框架为 CoIn、PALACE 领域适配审计器、Velasco et al. 的鞅审计器,共 3 个。论文写明原 PALACE 评测里领域适配审计器优于通用审计器;本文未报告通用审计器上的数字。
- CoIn 与 PALACE 使用 Glaive reasoning-v1-20m;鞅审计主实验使用 Medical-R1-Distill-Data。负漂移检查使用 OpenThoughts-Code、OpenR1-Math-220k、OpenThoughts-Math 与 Glaive,各取前 100 条(附录 D.1)。
- CoIn 块长 256 token,通过标准为规则与学习验证器同时接受,分析限于 2–7 块。生成侧为微调 T5 与 LoRA 适配的 Qwen2.5-1.5B-Instruct,答案改写使用 Qwen3-14B。CoIn 所用嵌入模型的具体名称论文未写出。
- 鞅审计 α = 0.05。正文朴素攻击为每第 10 个样本多报 2000 token;附录 D.2 为每隔一个样本注入 1000–3000 token;附录 D.3 窗口为 1000 个样本、1,895,697 个实际 token,偏移扫描 1 到 100。
- 附录 A 写明实验使用公开数据集和公开描述的审计框架,不用私人用户数据,也不评测任何已部署商业 LLM 服务;计算在单张 NVIDIA A100(40 GB)上完成。论文未报告 CoIn 主图样本总数、各实验重复次数,以及 50.85% 对应的单样本注入量。
总结一下论文的主要内容
不诚实提供方可在三种token审计上虚报并通过检查,作者认为需改用提供方不控制的证据。
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。
- 要解决的是:模型、分词器与执行被隐藏后,审计者没有独立的计算证据,只能做一致性检查。作者称之为 trust paradox,并写明这不是在声称 token 审计不可能。
- 做法是分别攻击三个框架。CoIn 上复用、加噪复用或按答案生成推理块;PALACE 上改答案表面,或污染其依赖的辅助数据;推理文本可见的鞅审计上选择性多报,并用小幅少报扩大负漂移留下的松弛。
- 在 Glaive reasoning-v1-20m 上,CoIn 的整段重复平均虚增 1469.0%,随机复用平均虚增 549.9%,且规则与学习验证器都接受(Figure 1)。作者称按当前输出价格,100 美元诚实推理账单大约变为 1,569 美元。
- PALACE 领域适配审计器上,句末追加 boxed 使预测推理 token 平均增加 82.4(成功率 82%);long 改写使预测长度平均增加 30.30%。后门使 99.91% 的触发样本平均虚增 247.16%。
- 推理文本可见、α=0.05 时,补偿偏移策略的总虚增为 50.85%,且低于检测阈值(Figure 3)。每第 10 个样本多报 2000 token 的朴素策略,在所评估序列上也不过阈值。
- 作者的结论是:问题不在某一个模型或阈值,而在审计证据由被审计方提供。可靠问责需要把上报计数绑定到提供方不控制的计算证据。作者同时写明,测得虚增率可能随部署变化,本文只推动、并未给出这种验证方案。