vLLM 修复请求状态残留导致的跨请求输出约束漏洞
vLLM:请求状态残留影响后续输出完整性
AI 导读
vLLM 安全公告披露,V1 引擎的 InputBatch.condense() 在移动受限请求后未清除原行的 allowed_token_ids_mask_cpu_tensor,后续复用该批处理槽位的无限制请求会继承前一个请求的 token 白名单,采样被他人设置的掩码约束,但受害请求仍返回 HTTP 200。该问题影响 vLLM ≤ 0.30.0 的 V1 worker InputBatch 路径,CVSS 3.1 评分 3.7(Low),归类为 CWE-440 与 CWE-668。攻击者可通过未受 --api-key 保护的 /invocations 或 /v1 提交流量植入选定的 allowed_token_ids 掩码,在并发批处理与 condense 槽位复用竞争下把受害者的输出限制到攻击者白名单内,属于词表引导而非任意文本替换,不影响机密性与可用性。
推荐理由
公告披露了 vLLM 批处理槽位复用导致的跨请求输出约束问题,并给出修复 PR 与受影响版本,供自建推理服务者排查。
阅读原文