vLLM v0.30.0 发布:762 个提交、DeepSeek-V4.1-Flash 等新模型、KV 水印与 HiSparse 主机分层

vLLM v0.30.0 发布:762 个提交、DeepSeek-V4.1-Flash 等新模型、KV 水印与 HiSparse 主机分层

3小时前
duguying
9 阅读
来源:GitHub Releases

vLLM 发布 v0.30.0,收录 315 位贡献者的 762 个提交:新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型,GPU 权重缓存实现秒级引擎重启,Gumbel-max 生成水印,HiSparse 主机内存 KV 分层,H200 引擎初始化 28.9s→8.2s;扩缩容端点改为按需开启、GPTQ g_idx 移除等多项破坏性变更。

相关标签

#vLLM#LLM#推理#开源软件#AI#GPU

发布概览

vLLM 是源自 UC Berkeley Sky Computing Lab 的 LLM 推理与服务库,以 PagedAttention 著称,现已成为拥有 2000+ 贡献者、支持 200+ 模型架构的旗舰开源 AI 基础设施项目,覆盖 NVIDIA/AMD/Intel GPU、CPU 以及 TPU、Gaudi、昇腾、Apple Silicon 等多种硬件。

v0.30.0 于 2026 年 9 月 22 日发布,收录 315 位贡献者的 762 个提交。

核心亮点

1. 新模型支持

  • DeepSeek-V4.1-Flash:整个 KV 以 MXFP8 存储,借助 FlashMLA V4.1 在 SM100 上创下纪录,配合 DeepGEMM Mega-mHC、异步 Engram 预取与 DP 分片
  • DeepSeek-V4-Flash-Vision-Exp:支持 ROCm 与 LoRA;另有 DeepSeek-V4 CPU 后端,基于 AVX512/AMX 稀疏 MLA、indexer、mHC 与压缩器内核
  • GLM-5.3-Flash:支持 EPLB,FlashKDA 分块预 fill 较 Triton 路径快 1.7–3.8 倍
  • K2-Horizon(含 reasoning/tool 解析器)、Cohere CompassBailing V3 VL(支持 MTP)、Nanbeige4.2

2. Fast Start:GPU 权重缓存快速重启

新增常驻的 per-GPU 权重缓存守护进程,把量化后、按 TP 分片的权重保留在显存中——引擎重启时通过 CUDA IPC 直接映射(--load-format ipc_cache),而不再从磁盘重新加载。现已覆盖 FP4 检查点与多节点 TP 场景。对需要频繁扩缩容或 RL 训练回滚的场景是显著的时间节省。

3. 生成水印

基于 Gumbel-max 的水印生成与检测,使用带密钥的 PRF,支持按请求关闭并附带示例检测端点;dual-key 变体使其与投机解码兼容。Rust 前端同步转发了按请求的水印控制开关。

4. HiSparse:稀疏 MLA 解码的主机分层

GPU 显存吃紧时将 KV 页面溢出到锁页主机内存,top-k 未命中由每请求的 GPU 热缓冲兜底,通过 HiSparseConnector 启用,附带 Prometheus 计数器与跨 TP rank 共享的主机缓存。

5. Model Runner V2 性能

  • eager 模式与 FULL CUDA graph 的双批重叠(dual-batch overlap)
  • MTP 与 EAGLE3/DFlash/DSpark 投机解码支持流水线并行;所有草稿模型投机器获得在线接受率估计的自适应验证
  • graph capture 期间冻结 GC:H200 上捕获时间 12s→2s,引擎初始化 28.9s→8.2s
  • --return-sampling-mask 在 GPU 上压缩,修复约 2 倍的 RL step 时间回退

6. 旗舰模型专项性能

  • Qwen3.8-Flash-Next:prefill/decode 分离的 QSA indexer 内核、融合 PLE 内核、FP8 indexer 缓存、UVA PLE offload 与 Engram 张量并行;NVIDIA 路径移除 torch.compile,FP8 得以装进单张 GB300
  • Kimi K3:SM100 原生 CUDA AttnRes 默认开启、KDA 混合批 gather/scatter 移除(端到端吞吐 +5.2–7.7%)、分组 FP8 MLA 缓存插入(小批量内核提速 4–6 倍)、DSV3 低延迟 GEMM(内核提速 12–81%)

7. 大规模服务与量化

  • 大规模服务:稀疏 MLA 模型的 PCP+DCP、Elastic EP 在重配置间复用 CUDA graphs、无 NVLink 机器的 FlashInfer PCIe IPC all-reduce、DeepEP v2 异步 finalize 与共享专家重叠、Mooncake Store 异构 TP 共享、编码器缓存经 NIXL/Mooncake 共享
  • 量化:通过 quantization_config.targets 定向在线量化、可对部分预量化检查点继续在线量化、W4A16 DSA(nvfp4_fp8_ds_mla KV 缓存)、FlashInfer CuTeDSL NVFP4 W4A16 在 SM100/103 成为 Marlin 之上的默认、AutoRound 2/3/5/6/7-bit、DeepSelect top-k 稀疏 indexer

破坏性变更(升级前必读)

  • 扩缩容端点改为按需开启/render/derender/inference/v1/generate 不再默认注册在 vllm serve 上,需传 --enable-scale-out;环境变量 VLLM_ENABLE_SCALE_OUT_ENDPOINTS 移除
  • GPTQ 激活顺序(g_idx)移除,相关 Marlin/GPTQ/CPU/RDNA3 内核一并删除
  • 0.29 弃用项清理VLLM_PREFIX_CACHE_RETENTION_INTERVALVLLM_MM_HASHER_ALGORITHM 等环境变量移除,ROCm 上 CUDA_VISIBLE_DEVICES 回退移除(改用 HIP_VISIBLE_DEVICES
  • gRPC 启动方式变更python -m vllm.entrypoints.grpc_server 弃用,改用 vllm serve --grpc
  • YaRN 与 Transformers 对齐:厂商 YaRN 别名不再二次缩放 max_model_len,部分模型(如 TeleChat3-36B-Thinking 131072→32768、sarvam-105b 5242880→131072)的派生上下文长度会下降
  • 多项新默认值:FlashInfer CuTeDSL NVFP4 W4A16(SM100/103)、W4A4 NVFP4(SM120/121)、DeepEP v2 combine 重叠开启(VLLM_DEEPEP_V2_COMBINE_OVERLAP=0 关闭)等

安全修复

  • 验证错误响应体有界化,关闭约 5,300 倍的响应放大
  • cache_salt 在到达 LMCache 前校验,单个请求不再能拖垮引擎
  • 客户端提供的稀疏嵌入在稠密化前有界化;视频采样参数针对 GLMGA 与 Qwen-VL 后端设置上限

安装与升级

# PyPI(CUDA 13.0)
pip install vllm
# 或使用 uv(推荐)
uv pip install vllm --torch-backend=auto

# Docker
docker pull vllm/vllm-openai:v0.30.0
# ROCm: vllm/vllm-openai-rocm:v0.30.0 | CPU: vllm/vllm-openai-cpu:v0.30.0 | XPU: vllm/vllm-openai-xpu:v0.30.0

ROCm 镜像基于 ROCm 10.0(TheRock base),CUDA wheel 默认 13.0 并提供 12.9 备选,同时提供 XPU 与 CPU(含 macOS arm64)wheel。公开的 CUDA 13.4 Rubin 构建路径也已就绪。升级前请仔细核对破坏性变更清单。

返回列表

更多资讯

想看更多优质内容?

浏览所有资讯