研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题
研究评估网关记录的LLM路由元数据泄露:50%运行点匹配长度下,RouteLLM未见提示词上骚扰与自残调用强模型少19点。
- -0.193RouteLLM,LMSYS未见提示词,50%运行点,骚扰类别匹配长度差值∆adj(Table IV)
- -0.186RouteLLM,LMSYS未见提示词,50%运行点,自残类别匹配长度差值∆adj(Table IV)
- +0.102RouteLLM,LMSYS保留集全部样本,50%运行点,涉性类别匹配长度差值∆adj(Table IV)
网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。
论文将研究归纳为成本与领域路由、隐私保护路由及自适应系统侧信道,强调自身聚焦真实业务日志泄露。
通过长度匹配差值度量泄露,构建账单与逐条日志推断攻击,并设计按类别长度匹配公平性后处理以消除单请求差距。
实测显示强模型路由偏差方向依类别而异,账单攻击可推断用户医疗频率,按类别公平性可低成本闭合单请求差距。
医疗标签质量、重复提示词干扰、用户级证据仅限于单一类别以及商用托管路由器尚未实测是核心局限。
论文揭示并测量了LLM路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。