跳到正文
原文
论文追踪· arXiv:2610.09981·本站收录 · 原文发表 精选关注度59

研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

关掉内容日志也会漏:LLM 路由器选大模型还是小模型的记录,能推出用户在问医疗、自伤等敏感话题

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

研究评估网关记录的LLM路由元数据泄露:50%运行点匹配长度下,RouteLLM未见提示词上骚扰与自残调用强模型少19点。

威胁模型攻击者为具有网关默认管理权限的内部人员、安全团队、财务或托管可观测厂商;目标是标记敏感请求或按敏感频率对用户排名;攻击者仅被动读取网关保留的调用模型、时间、Token数及成本等元数据,无内容访问权且无需路由器内部参数;受害者为经由网关分流的LLM路由系统。

问题
网关和云平台常记录请求路由调用的模型、时间和Token数等元数据。当路由器根据内容选择强弱模型时,关闭内容日志并不能隐藏请求主题,元数据记录成为侧信道泄露敏感话题,可能被管理员、审计或日志泄露利用。
方法
论文形式化了路由决策侧信道,在长度匹配下定义差值与信息增益,设计了账单攻击与逐条日志攻击;并在真实聊天记录和基准上预注册评估RouteLLM、notdiamond与领域路由器,最后测试了奇偶率限制、分组与按类别公平后处理等防御。
实验与结果
在50%运行点匹配长度下,RouteLLM对骚扰和自残调用强模型比例低19个百分点,而对涉性请求高10个百分点;观察20次请求时账单攻击AUC为0.71;按类别长度匹配公平性可消除单请求差距且RouterBench精度损失不超过0.2点。
局限与可以继续做的
作者指出医疗评测裁判未达预注册门槛故结果属探索性;公开发布数据去除了部分敏感内容且重复提示词较多;未测商业托管路由器;按类别公平性防御在RouterBench上仍有残留差距,且精确率防御无法抵御奇数位日志攻击。
实验设置RouteLLM (BERT router)、notdiamond-0001 等 · WildChat-1M、LMSYS-Chat-1M 等 · ∆adj、ε 等
模型
RouteLLM (BERT router)notdiamond-0001Vela (vLLM Semantic Router)GPT-4Mixtral-8x7BGPT-3.5
基准
WildChat-1MLMSYS-Chat-1MRouterBenchMMLU
指标
∆adjε∆AUCAUCAcc.Cost ($/1k)Skill kept (SK)
AI 导读和推荐理由全文 366 字

一项预注册研究在 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)上测量了 LLM 路由决策作为隐私信道的泄露程度,发现即使关闭内容日志,网关仍可保留每次请求所选模型、调用方与 token 数。在长度匹配条件下,RouteLLM 在 50% 工作点把骚扰和自伤请求送往强模型的概率比可比请求低 19 个百分点,医疗请求低 31 个百分点,性相关请求高 10 个百分点;第二个路由器 notdiamond-0001 对四类请求都更少送往强模型。仅凭 20 条路由决策即可区分频繁医疗提问用户,AUC 为 0.71,低于预注册的 0.75 阈值;域路由器的健康标签可达 0.92。作者调查了 11 个网关、路由器和云平台的日志字段,其中至少 6 个可在无内容日志下保留带调用方的逐请求模型记录,部分为默认行为。

推荐理由论文在 170 万条真实请求上测量路由决策日志对敏感话题的泄露,并给出各类防御的代价,可帮助部署路由的团队评估元数据留存风险。

深度解读

6 个问题 · 约 8,200 字

  1. 这篇论文试图解决什么问题?

    网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。

    这篇论文试图解决即使关闭内容日志,网关与云平台记录的模型路由决策元数据仍会泄露用户敏感请求话题的问题。

    • 场景与重要性:在多模型部署中,路由器根据请求内容动态选择廉价或高能力模型以权衡成本与质量,而网关与云平台默认或常态化记录所选模型、Token数与调用者标识;即使出于合规或隐私关闭请求内容记录,保留的元数据仍可能被内部人员审计、外包可观测服务获取或在数据泄露时被利用。
    • 现有方法的不足:现有隐私保护路由主要关注保护发往远程模型的内容或路由计算本身的加密,未分析和防护计算完成后的操作性日志;而自适应网络侧信道或智能体元数据研究多依赖网络流量或合成日志,未在真实用户流量与业务日志上进行测量。
    • 核心观察:路由器的决策本就是请求内容的函数,导致敏感类别与普通请求在强模型路由率上存在系统性偏差;由于敏感请求与常规请求在长度上存在天然差异,该信息通道必须在控制长度特征后衡量。
    • 论文的贡献:论文基于对11个网关和云平台的实地调查构建了威胁模型,在170万条真实请求上预注册评测了两个成本/质量路由器与一个领域路由器的泄露程度,并设计和测试了按类别匹配长度的公平性后处理等缓解防御。
    • 威胁模型:
      • 攻击者目标:在不查看请求文本的前提下,标记包含敏感话题的单个请求,或根据多次交互记录对用户的敏感话题频率进行排名。
      • 攻击者知识:掌握每个请求的路由决策 Rt(或财务视角的周期汇总数据)、输入Token数作为长度代理,以及部分带标注训练用户的统计分布;不需要路由器内部参数。
      • 攻击者能力:作为具有网关默认管理权限的内部人员(如LiteLLM代理管理员或OpenRouter组织管理员)、安全团队(SIEM)、财务部门或托管厂商,仅被动读取日志或账单记录,不修改数据或注入流量。
      • 受害系统:位于网关或云平台之后、根据请求内容将流量分流至强模型或弱模型的两模型路由系统(如RouteLLM、notdiamond-0001或领域分类器)。
  2. 有哪些相关研究?

    论文将研究归纳为成本与领域路由、隐私保护路由及自适应系统侧信道,强调自身聚焦真实业务日志泄露。

    成本质量与领域路由研究

    • 级联与学习型路由器:FrugalGPT(2024)、AutoMix(2024)、Hybrid LLM(2024)与RouteLLM(2025)通过学习查询难度或人类偏好在强弱模型间级联分流;notdiamond-0001(2023)与OpenRouter(2026)提供商业或开源路由选项;vLLM Semantic Router(2025)按主题领域分类路由。
    • 路由偏差与类别敏感性分析:Kassem等(2026)在类别基准上发现路由决策由请求类别驱动(如对抗性提示词被送入弱模型),并在PUPA子集上分析了医疗数据流向,但作者指出其关注点是鲁棒性与安全性而非日志观察者能学到什么;Koul(2026)指出复杂度路由主要因长度将非标准英语分配给低阶模型;Wang等(2026)发现商用路由器倾向于将同一基准的所有查询送往同一模型。

    隐私保护路由机制

    • 敏感性感知与协同路由:PAPILLON(2025)利用本地模型保护发往专有模型的内容,PRISM(2026)按敏感性在端云之间分流;作者指出当路由决策依赖敏感性时,决策本身即成为敏感信号。
    • 安全计算与差分隐私方案:Wu等(2026)利用安全计算保护查询内容与路由模型,但未研究计算后的记录暴露与日志记录;AVEC(2025)指出本地与远程委派标记存在泄漏并用随机响应设定界限,但仅在仿真中进行了评估。

    自适应计算与系统侧信道研究

    • 自适应网络与推断侧信道:Kannan等(2023)指出多退出网络的退出点会泄露预测并提出类别平衡退出防御(本文对齐防御的结构先例);Akinsanya与Brennan(2024)研究自适应网络的时间信道;Whisper Leak(2025)与Pouryousef等(2026)从加密流量的数据包或时延推断提示词主题或服务模型。
    • 智能体选择与路径侧信道:Dangol(2026)、SICC(2026)、Peng等(2026)与AgentCardLeak(2026)指出智能体调用顺序、消息选择和发现元数据会泄露意图,其中SICC指出长度匹配无法闭合消息选择通道;Tor路径选择(2018,2020)及Jev决策模型属性推断(2026)亦展示了选择行为的信息泄露。

    基线方法与评测基准

    • 基线与基准:论文评估的路由器包括RouteLLM的BERT路由器、notdiamond-0001和vLLM Semantic Router的Vela领域分类器;评测使用真实聊天数据WildChat-1M与LMSYS-Chat-1M,以及多模型评测基准RouterBench(含MMLU学科子集)。

    作者定位:作者指出以往工作从未测量真实部署中模型路由决策作为无内容业务记录(日志和账单)在真实用户流量上的隐私泄露,论文通过测量单请求与跨请求累积泄露并评估后处理防御填补了这一空白。

  3. 论文如何解决这个问题?

    通过长度匹配差值度量泄露,构建账单与逐条日志推断攻击,并设计按类别长度匹配公平性后处理以消除单请求差距。

    论文形式化了路由决策元数据通道,通过控制长度特征度量单请求泄露,设计基于账单与日志的用户级推断攻击,并提出基于分箱对齐的按类别长度匹配公平性后处理(Length-matched parity)防御。

    系统模型与泄露度量

    • 路由决策形式化:每个请求由内容映射至评分 s(x),在运行点 q 下将评分高于对照集 O 的 (1-q) 分位数的请求指派给强模型(决策为 1),否则指派给弱模型(决策为 0)。网关保留时间、调用者标识、决策结果 Rt 以及输入Token数 ni。
    • 长度匹配差距定义:由于请求长度本身具备信息量,论文按敏感类别的对数长度十分位数进行分箱,定义匹配长度后的强模型调用率差距为:

    Δadj(c) = pc − p̃O(c) 其中 pc 为敏感类别的强模型调用率,而后者为按敏感类别长度权重重新加权后的对照组强模型调用率。

    • 隐私损失与Token数增益:基于分箱分布定义单请求隐私损失 ε(c) 为长度加权后两组伯努利分布的最大绝对对数似然比;同时在20分箱对数长度逻辑回归上加入路由决策,通过五折交叉验证计算相对于单纯长度模型的增益 ∆AUC(c)。

    用户级推断攻击设计

    • 观察者类型与数据聚合:针对调用请求数不少于10次的用户,观察其前 T 次调用。账单攻击者 A1 仅观测强模型调用总次数 ku,利用正负类用户的经验强模型率计算对数似然比。
    • 逐条日志攻击者:针对可查看单条元数据的观察者,攻击者 A2 依据每个请求的长度全局分箱累加似然比:

    A2(u) = ∑t ≤ T [ Ru,t log (p̂1,βt)/(p̂0,βt) + (1 − Ru,t) log (1 − p̂1,βt)/(1 − p̂0,βt) ] 其中权重由训练集正负用户的经验分箱概率平滑估计。

    • 奇数位日志攻击:针对严格执行偶数步总数配额的精确率防御,事后设计的 A2-odd 仅利用奇数位置的请求记录拟合和打分,直接利用确定性互补结构提取未被混淆的决策信号。

    防御机制与后处理规则

    • 按类别长度匹配公平性(D2):将请求按全局长度划分为10个分箱,在每个分箱内计算目标强模型率,分别对每个敏感类别和对照组按原始路由器评分截取相同比例的头部请求送入强模型,从而使各分箱内两组的强模型率一致。
    • 预算带与精确率限制(D3):对每个用户的累计强模型率设置目标 Z=0.5 与松弛度 δ,超出上下边界时强制反转决策。精确率变体设定松弛度为 0.5,在偶数请求时强制强模型调用数恰为总数的一半。
    • 混合与粘性策略:随机混合 D1 以固定概率将决策替换为抛硬币;会话级粘性 D4 将会话首轮决策复用于整段会话;用户级固定 D5 则对回访用户固定分配单一模型。
  4. 论文做了哪些实验?

    实测显示强模型路由偏差方向依类别而异,账单攻击可推断用户医疗频率,按类别公平性可低成本闭合单请求差距。

    实验设置

    • 被测模型:RouteLLM(BERT路由器)、notdiamond-0001以及vLLM Semantic Router的Vela领域分类器;底层模型在RouterBench上包括GPT-4与Mixtral-8x7B(RouteLLM)、GPT-4与GPT-3.5(notdiamond)。
    • 数据集与规模:WildChat-1M(982,067条请求,97,742个用户)、LMSYS-Chat-1M(探索集251,230条,保留集502,477条)、RouterBench(36,497条提示词,含MMLU学科子集:医疗1,417条、心理学1,157条、人类性学131条、法律1,763条)。
    • 基线与对照:无防御路由器、相同预算下的随机路由、在RouterBench上根据实际精度增益分流的事后Oracle路由器。
    • 指标定义:匹配长度差值 ∆adj、单请求隐私损失 ε、相对20分箱长度模型的增益 ∆AUC、用户级AUC、RouterBench准确率与成本、自评留存技能SK。
    • 评审方式与标签来源:骚扰、自残、涉性与暴力来自LMSYS自带的OpenAI内容审核标签;医疗类别由LLM裁判判定(LMSYS为双裁判交集,WildChat为单裁判),初筛门槛为NLI医疗分不低于0.3或Vela医疗标签;人工抽检精度未达0.85门槛(LMSYS为0.75,WildChat为0.70)。
    • 样本量与重复次数:保留集主结果包含全量与指纹去重子集;bootstrap重采样1,000或2,000次计算置信区间;用户级推断在T=20时评测数百名正例与数千名负例用户。

    主结果

    表格较宽,可左右滑动

    类别数据划分与样本集样本数 nRouteLLM ∆adjRouteLLM ∆AUCnotdiamond ∆adj
    骚扰LMSYS保留集全量(验证性)7,140-0.316+0.014-0.276
    骚扰LMSYS未见提示词(事后)1,786-0.193+0.010-0.166
    自残LMSYS保留集全量(验证性)276-0.238+0.061-0.097
    自残LMSYS未见提示词(事后)164-0.186+0.050-0.028
    医疗WildChat全量(预注册/探索性)32,215-0.331+0.107-0.154
    涉性LMSYS保留集全量(次要)7,713+0.102+0.006-0.054
    暴力LMSYS保留集全量(次要)1,759+0.071+0.004-0.054
    • 偏移方向取决于类别与路由器:作者称RouteLLM在50%运行点更常将骚扰、自残和医疗请求路由至弱模型,但将涉性和暴力请求更多发往强模型;notdiamond则将所有类别均更多发往弱模型,表明偏移方向是路由器与类别组合的属性,而非敏感性本身的普遍属性(据 Table IV)。
    • 重复提示词夸大了复现差距:作者指出保留集骚扰样本中61%重复了探索集提示词;在未见提示词子集上RouteLLM差距收缩至-0.193和-0.186,但仍满足预注册判据;notdiamond自残差距则跌至-0.028且置信区间包含0(据 Table IV、Figure 2a)。
    • 决策增益受长度信息上限约束:作者指出在长度模型AUC已较高的情况下(骚扰0.78、涉性0.75),决策额外带来的∆AUC仅约+0.01,这与信息天花板效应一致;而在医疗类别上决策增益达+0.107(据 Table IV)。

    用户级累积推断实验

    • 测试设置:在WildChat医疗数据上测试观察者利用不同请求窗口长度(T=5, 10, 20, 50)推断频繁医疗咨询用户的能力,对比总账单A1、结合长度A1+L、逐条日志A2及仅看主题的理论零假设。
    • 实验结果:在预注册划分上,A1在T=20时的AUC为0.707(95% CI [0.671, 0.740]),低于预注册的0.75门槛;单纯长度特征AUC为0.54,决策带来约0.18增益;notdiamond的A1为0.66,领域路由器达到0.92(上限估计);零假设模型在T=20和50时预测AUC为0.83和0.90,高于实测的0.707与0.736(Table VII、Figure 4)。
    • 作者解读:作者认为AUC随T增长缓慢且低于理论零假设,原因在于用户间存在强烈的组内异质性(负例用户组内相关系数 ρ=0.35,正例 ρ=0.21);总账单已承载了大部分推断信号,隐藏单条记录而保留账单防护作用有限。

    基准数据集上的路由机理与Oracle对比

    • 测试设置:在RouterBench的MMLU学科子集(医疗、心理学、人类性学、法律)上评估路由器分流率与在相同预算下根据实际精度增益分流的事后Oracle的差异。
    • 实验结果:两个路由器将敏感学科送往弱模型的比例比非敏感提示词高出13至42个百分点(Table VI、Figure 3);而在相同预算下,Oracle将敏感学科送往弱模型的差距仅为1至11个百分点;两者相差10至34个百分点(如RouteLLM在心理学上差距达0.34点)。
    • 作者解读:作者认为尽管强模型在敏感学科上的实际精度优势确实偏小(相对Mixtral-8x7B低0.05至0.12),但Oracle的差距极其有限,说明路由器的敏感学科偏流绝大部分并非由实际精度增益差异所解释。

    防御策略的有效性与代价评估

    • 测试设置:在WildChat与RouterBench上评估了随机混合、按类别/池化长度匹配公平性、预算带、精确率限制、会话/用户粘性对单请求差距、用户AUC与模型精度的影响。
    • 实验结果:在WildChat上,完美标签的按类别公平性将单请求差距降至-0.001且保留0.99自评技能,但廉价分类器仅消除一半差距(-0.151);在RouterBench上,按类别公平性使精度变动不超过0.2个百分点,且降低成本2%至4%(Table V);池化公平性在RouterBench上导致医疗过度修正至+0.14,在LMSYS上无法消除正负相抵的骚扰差距(残留-0.09);精确率限制下A1在偶数T时降为0.500,但A2-odd在T=20时达到0.730(Table VIII、Table IX)。
    • 作者解读:作者认为按类别长度匹配公平性是关闭单请求差距代价最低的方式,但高度依赖准确标签;池化公平性因类别偏移幅度或方向不同而失效;预算带和精确率限制无法防御利用奇数位保留决策的日志攻击。

    其他消融与分析

    • 运行点预算 q:WildChat医疗差距在 q=0.55–0.60 时达到峰值 -0.35,在 q=0.20 时为 -0.14,在 q=0.95 时为 -0.13(Figure 2b)。
    • 随机混合比率 η:在 η=0.5 时RouteLLM的WildChat医疗单请求差距从 -0.331 降至 -0.164,自评技能从 1.00 降至 0.50,A1仅从 0.718 降至 0.688(Table VIII)。
    • 预算带松弛度 δ:在 δ=±1, ±2, ±4 下,RouteLLM的WildChat医疗A1分别为 0.670、0.691、0.709,单请求差距为 -0.089、-0.129、-0.168(Table VIII)。
    • 粘性策略:会话级粘性将WildChat医疗A1降至 0.687,预算增加 2.8 个百分点;固定单用户模型将A1降至 0.600,自评技能保留 0.60(Table VIII)。
    • 账单价格比率 λ:在强弱模型价格比为 20 或 50 时,WildChat总成本推断AUC均为 0.65,总Token数AUC为 0.57(Section VI-B)。
    • 奇数位攻击时间跨度 T:在精确率防御下,RouteLLM的A2-odd在 T=5, 10, 20, 50 时的AUC分别为 0.684、0.702、0.730、0.793(Table IX)。
  5. 有什么可以进一步探索的点?

    医疗标签质量、重复提示词干扰、用户级证据仅限于单一类别以及商用托管路由器尚未实测是核心局限。

    作者指出的局限与后续方向

    • 医疗标签未过预注册验证门槛:Section X(1) 指出医疗LLM裁判在LMSYS和WildChat上均未达到0.85的预注册精度门槛,所有医疗结果均为探索性;WildChat黄金集由非盲态AI编程助手基于截断文本标注,存在高估一致性的可能;且WildChat对照组抽检仍含1.77%未召回医疗请求。
    • 审核标签版本未定且缺乏人工核验:Section X(1) 指出LMSYS审核标签直接采用2023年收集的数据集自带OpenAI审核输出,原始模型版本未明故无法基于当前API精确复现,出于伦理考虑未安排人员阅读敏感文本进行人工核验。
    • 重复提示词削弱保留集独立性:Section X(2) 指出公开聊天日志存在大量重复提示词,基于分数的指纹不能替代严格文本去重,近似重复依然存在,导致保留集复制独立性低于设计假设。
    • 路由器模型类型覆盖较窄:Section X(3) 指出研究仅评测了两个开源BERT类成本/质量路由器与一个领域路由器,notdiamond-0001已停更数年不能代表其当前商用服务,商用托管路由器(如OpenRouter Auto Router)的泄露尚未实测。
    • 用户级证据仅限于单一类别与哈希IP:Section X(4) 指出用户级分析仅在WildChat医疗类别上完成,骚扰、自残和涉性请求因缺乏用户ID未测;哈希IP可能合并共享网络或分割多设备用户,且公开数据排除了部分毒性和个人敏感对话,可能低估推断能力。
    • 真实单位评测无法迁移至真实对话:Section X(5) 与 Section XI 指出RouterBench仅涵盖学术MMLU题目与历史价格,80%的WildChat请求低于其首个分位数,校准无法迁移;按类别公平性在自身分箱上仍有0.064残余差距;未来需对商用托管路由器开展实测、通过受控重写分析格式措辞影响,并探索自适应观察者下的界限。

    实验覆盖范围

    • 被测路由器与模型:评测覆盖RouteLLM(BERT路由器)、notdiamond-0001以及vLLM Semantic Router的Vela领域分类器共3个开源路由器;底层模型评测包括GPT-4、Mixtral-8x7B和GPT-3.5。
    • 数据集与会话范围:实验基于WildChat-1M和LMSYS-Chat-1M两个英文数据集以及RouterBench基准;其中LMSYS仅涵盖对话的首轮请求。
    • 敏感话题类别覆盖:单请求评测覆盖骚扰、自残、医疗、涉性和暴力共5个类别;用户级推断仅覆盖WildChat医疗单一类别。
    • 防御机制配置:在WildChat上测试了随机混合、按类别/池化公平性、预算带、精确率限制、会话粘性与固定模型共12种配置;在RouterBench上测试了随机混合、池化公平性与按类别公平性。
    • 未报告与未测试范围:论文未报告商用托管路由服务的实测隐私数据;未测试网关提供的按Key消费额度限制防御;未对LMSYS保留集请求开展人工审查。
  6. 总结一下论文的主要内容

    论文揭示并测量了LLM路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
    • 论文定位:这是针对LLM应用中网关与云平台记录的模型路由决策元数据,在真实用户流量上开展敏感话题侧信道泄露测量与缓解防御评估的安全研究。
    • 核心问题:当路由器根据输入内容在强弱模型间分流时,即便系统出于合规完全关闭提示词内容记录,保留的模型选择、Token数和调用者标识仍会构成信息通道,导致内部人员或审计者推断敏感话题。
    • 研究方法:论文形式化了长度匹配下的路由决策泄露与基于长度模型的增益,构建了针对单请求的差值度量以及针对单用户的账单攻击A1、逐条日志攻击A2和奇数位日志攻击A2-odd;在170万条真实请求及RouterBench上预注册评估了RouteLLM、notdiamond与领域路由器,并设计了按类别长度匹配公平性、预算带和精确率限制等后处理防御。
    • 核心实验结果:
      1. 在50%运行点匹配长度下,RouteLLM在未见提示词上对骚扰和自残调用强模型的比例比对照组低19.3和18.6个百分点(Table IV);而在涉性请求上高10.2个百分点,notdiamond在所有类别上均偏向弱模型。
      2. 在WildChat医疗请求中,仅通过前20次调用的强模型总账单,攻击者识别频繁医疗用户的AUC达到0.707(Table VII);在后验精确率防御下,利用保留奇数位决策的日志攻击A2-odd在T=20时的AUC可达0.730(Table IX)。
      3. 在RouterBench上,路由器对敏感学科的分流差距达到13至42个百分点,远超实际精度增益Oracle的1至11个百分点(Table VI)。
      4. 按类别长度匹配公平性在理想标签下可完全消除真实流量的单请求差距,在RouterBench上精度损失不超过0.2个百分点且降低2%至4%成本(Table V);但池化公平性因类别偏移幅度或符号不一致而失效。
    • 作者结论与启示:作者认为从业者应将模型选择字段视为内容衍生数据,关闭内容日志并不能自动保护话题隐私;建议使用基于校验标签的按类别长度匹配公平性防御,并停止将无法抵御边界或时序攻击的会话粘性和预算带视为可靠的隐私控制措施。
阅读原文arxiv.org