vLLM v0.29.0 未认证生成端点可被单个请求挂起且健康检查仍返回 200
vLLM:生成请求可导致引擎挂起且健康检查未反映异常
AI 导读
vLLM 安全公告披露,v0.29.0 中默认挂载且未设 --api-key 时无需认证的 /inference/v1/generate 端点,可被任意能访问该端点的网络客户端用一个请求打挂。请求体把 sampling_params.max_tokens 设为 null、min_tokens 设为 2147483648,EngineCore 在输入线程中重新校验参数时抛出 VLLMValidationError,该异常未被捕获导致线程退出,此后所有请求挂起。根因是 min_tokens <= max_tokens 检查只在 max_tokens 已设置时于 _verify_args 中执行,而该端点直接从 JSON 构建 SamplingParams,跳过了检查。
推荐理由
vLLM v0.29.0 的未认证端点可被单个请求打挂,且健康检查仍返回 200,部署方需据此检查暴露面。
阅读原文