
vLLM v0.30.0 发布:762 个提交、DeepSeek-V4.1-Flash 等新模型、KV 水印与 HiSparse 主机分层
vLLM 发布 v0.30.0,收录 315 位贡献者的 762 个提交:新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型,GPU 权重缓存实现秒级引擎重启,Gumbel-max 生成水印,HiSparse 主机内存 KV 分层,H200 引擎初始化 28.9s→8.2s;扩缩容端点改为按需开启、GPTQ g_idx 移除等多项破坏性变更。
相关标签
发布概览
vLLM 是源自 UC Berkeley Sky Computing Lab 的 LLM 推理与服务库,以 PagedAttention 著称,现已成为拥有 2000+ 贡献者、支持 200+ 模型架构的旗舰开源 AI 基础设施项目,覆盖 NVIDIA/AMD/Intel GPU、CPU 以及 TPU、Gaudi、昇腾、Apple Silicon 等多种硬件。
v0.30.0 于 2026 年 9 月 22 日发布,收录 315 位贡献者的 762 个提交。
核心亮点
1. 新模型支持
- DeepSeek-V4.1-Flash:整个 KV 以 MXFP8 存储,借助 FlashMLA V4.1 在 SM100 上创下纪录,配合 DeepGEMM Mega-mHC、异步 Engram 预取与 DP 分片
- DeepSeek-V4-Flash-Vision-Exp:支持 ROCm 与 LoRA;另有 DeepSeek-V4 CPU 后端,基于 AVX512/AMX 稀疏 MLA、indexer、mHC 与压缩器内核
- GLM-5.3-Flash:支持 EPLB,FlashKDA 分块预 fill 较 Triton 路径快 1.7–3.8 倍
- K2-Horizon(含 reasoning/tool 解析器)、Cohere Compass、Bailing V3 VL(支持 MTP)、Nanbeige4.2
2. Fast Start:GPU 权重缓存快速重启
新增常驻的 per-GPU 权重缓存守护进程,把量化后、按 TP 分片的权重保留在显存中——引擎重启时通过 CUDA IPC 直接映射(--load-format ipc_cache),而不再从磁盘重新加载。现已覆盖 FP4 检查点与多节点 TP 场景。对需要频繁扩缩容或 RL 训练回滚的场景是显著的时间节省。
3. 生成水印
基于 Gumbel-max 的水印生成与检测,使用带密钥的 PRF,支持按请求关闭并附带示例检测端点;dual-key 变体使其与投机解码兼容。Rust 前端同步转发了按请求的水印控制开关。
4. HiSparse:稀疏 MLA 解码的主机分层
GPU 显存吃紧时将 KV 页面溢出到锁页主机内存,top-k 未命中由每请求的 GPU 热缓冲兜底,通过 HiSparseConnector 启用,附带 Prometheus 计数器与跨 TP rank 共享的主机缓存。
5. Model Runner V2 性能
- eager 模式与 FULL CUDA graph 的双批重叠(dual-batch overlap)
- MTP 与 EAGLE3/DFlash/DSpark 投机解码支持流水线并行;所有草稿模型投机器获得在线接受率估计的自适应验证
- graph capture 期间冻结 GC:H200 上捕获时间 12s→2s,引擎初始化 28.9s→8.2s
--return-sampling-mask在 GPU 上压缩,修复约 2 倍的 RL step 时间回退
6. 旗舰模型专项性能
- Qwen3.8-Flash-Next:prefill/decode 分离的 QSA indexer 内核、融合 PLE 内核、FP8 indexer 缓存、UVA PLE offload 与 Engram 张量并行;NVIDIA 路径移除 torch.compile,FP8 得以装进单张 GB300
- Kimi K3:SM100 原生 CUDA AttnRes 默认开启、KDA 混合批 gather/scatter 移除(端到端吞吐 +5.2–7.7%)、分组 FP8 MLA 缓存插入(小批量内核提速 4–6 倍)、DSV3 低延迟 GEMM(内核提速 12–81%)
7. 大规模服务与量化
- 大规模服务:稀疏 MLA 模型的 PCP+DCP、Elastic EP 在重配置间复用 CUDA graphs、无 NVLink 机器的 FlashInfer PCIe IPC all-reduce、DeepEP v2 异步 finalize 与共享专家重叠、Mooncake Store 异构 TP 共享、编码器缓存经 NIXL/Mooncake 共享
- 量化:通过
quantization_config.targets定向在线量化、可对部分预量化检查点继续在线量化、W4A16 DSA(nvfp4_fp8_ds_mlaKV 缓存)、FlashInfer CuTeDSL NVFP4 W4A16 在 SM100/103 成为 Marlin 之上的默认、AutoRound 2/3/5/6/7-bit、DeepSelect top-k 稀疏 indexer
破坏性变更(升级前必读)
- 扩缩容端点改为按需开启:
/render、/derender、/inference/v1/generate不再默认注册在vllm serve上,需传--enable-scale-out;环境变量VLLM_ENABLE_SCALE_OUT_ENDPOINTS移除 - GPTQ 激活顺序(
g_idx)移除,相关 Marlin/GPTQ/CPU/RDNA3 内核一并删除 - 0.29 弃用项清理:
VLLM_PREFIX_CACHE_RETENTION_INTERVAL、VLLM_MM_HASHER_ALGORITHM等环境变量移除,ROCm 上CUDA_VISIBLE_DEVICES回退移除(改用HIP_VISIBLE_DEVICES) - gRPC 启动方式变更:
python -m vllm.entrypoints.grpc_server弃用,改用vllm serve --grpc - YaRN 与 Transformers 对齐:厂商 YaRN 别名不再二次缩放
max_model_len,部分模型(如 TeleChat3-36B-Thinking 131072→32768、sarvam-105b 5242880→131072)的派生上下文长度会下降 - 多项新默认值:FlashInfer CuTeDSL NVFP4 W4A16(SM100/103)、W4A4 NVFP4(SM120/121)、DeepEP v2 combine 重叠开启(
VLLM_DEEPEP_V2_COMBINE_OVERLAP=0关闭)等
安全修复
- 验证错误响应体有界化,关闭约 5,300 倍的响应放大
cache_salt在到达 LMCache 前校验,单个请求不再能拖垮引擎- 客户端提供的稀疏嵌入在稠密化前有界化;视频采样参数针对 GLMGA 与 Qwen-VL 后端设置上限
安装与升级
# PyPI(CUDA 13.0)
pip install vllm
# 或使用 uv(推荐)
uv pip install vllm --torch-backend=auto
# Docker
docker pull vllm/vllm-openai:v0.30.0
# ROCm: vllm/vllm-openai-rocm:v0.30.0 | CPU: vllm/vllm-openai-cpu:v0.30.0 | XPU: vllm/vllm-openai-xpu:v0.30.0
ROCm 镜像基于 ROCm 10.0(TheRock base),CUDA wheel 默认 13.0 并提供 12.9 备选,同时提供 XPU 与 CPU(含 macOS arm64)wheel。公开的 CUDA 13.4 Rubin 构建路径也已就绪。升级前请仔细核对破坏性变更清单。
更多资讯
想看更多优质内容?
浏览所有资讯