研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题
一项预注册研究在 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)上测量了 LLM 路由决策作为隐私信道的泄露程度,发现即使关闭内容日志,网关仍可保留每次请求所选模型、调用方与 token 数。在长度匹配条件下,RouteLLM 在 50% 工作点把骚扰和自伤请求送往强模型的概率比可比请求低 19 个百分点,医疗请求低 31 个百分点,性相关请求高 10 个百分点;第二个路由器 notdiamond-0001 对四类请求都更少送往强模型。仅凭 20 条路由决策即可区分频繁医疗提问用户,AUC 为 0.71,低于预注册的 0.75 阈值;域路由器的健康标签可达 0.92。作者调查了 11 个网关、路由器和云平台的日志字段,其中至少 6 个可在无内容日志下保留带调用方的逐请求模型记录,部分为默认行为。
推荐理由论文在 170 万条真实请求上测量路由决策日志对敏感话题的泄露,并给出各类防御的代价,可帮助部署路由的团队评估元数据留存风险。