研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题
提出利用路由元数据推断敏感话题的侧信道攻击
- 论文定位:这是针对LLM应用中网关与云平台记录的模型路由决策元数据,在真实用户流量上开展敏感话题侧信道泄露测量与缓解防御评估的安全研究。
- 核心问题:当路由器根据输入内容在强弱模型间分流时,即便系统出于合规完全关闭提示词内容记录,保留的模型选择、Token数和调用者标识仍会构成信息通道,导致内部人员或审计者推断敏感话题。
- 研究方法:论文形式化了长度匹配下的路由决策泄露与基于长度模型的增益,构建了针对单请求的差值度量以及针对单用户的账单攻击A1、逐条日志攻击A2和奇数位日志攻击A2-odd;在170万条真实请求及RouterBench上预注册评估了RouteLLM、notdiamond与领域路由器,并设计了按类别长度匹配公平性、预算带和精确率限制等后处理防御。
- 核心实验结果:
- 在50%运行点匹配长度下,RouteLLM在未见提示词上对骚扰和自残调用强模型的比例比对照组低19.3和18.6个百分点(Table IV);而在涉性请求上高10.2个百分点,notdiamond在所有类别上均偏向弱模型。
- 在WildChat医疗请求中,仅通过前20次调用的强模型总账单,攻击者识别频繁医疗用户的AUC达到0.707(Table VII);在后验精确率防御下,利用保留奇数位决策的日志攻击A2-odd在T=20时的AUC可达0.730(Table IX)。
- 在RouterBench上,路由器对敏感学科的分流差距达到13至42个百分点,远超实际精度增益Oracle的1至11个百分点(Table VI)。
- 按类别长度匹配公平性在理想标签下可完全消除真实流量的单请求差距,在RouterBench上精度损失不超过0.2个百分点且降低2%至4%成本(Table V);但池化公平性因类别偏移幅度或符号不一致而失效。
- 作者结论与启示:作者认为从业者应将模型选择字段视为内容衍生数据,关闭内容日志并不能自动保护话题隐私;建议使用基于校验标签的按类别长度匹配公平性防御,并停止将无法抵御边界或时序攻击的会话粘性和预算带视为可靠的隐私控制措施。