开发者生态
morning
vLLM v0.28.0
摘要
v0.28.0 Highlights This release features 584 commits from 270 contributors (76 new)! Kimi-K3 performance push : a major optimization effort for Kimi-K3 across the stack — Decode Context Parallel (DCP)...
and
for
support
Kimi
with
DSpark
models
offloading
effort
the
2026-08-30
1 阅读
约10分钟阅读
mrrrcs
字号:
v0.28.0 亮点 此版本包含来自 270 名贡献者的 584 项提交(76 名新贡献者)! Kimi-K3 性能提升:Kimi-K3 跨堆栈的主要优化工作 — 解码上下文并行 (DCP) 支持 (#50484)、融合 FlashKDA 解码和预填充内核 (#50654、#51311、#52458)、MegaMoE 的 SiTU 激活支持 (#50510)、用于序列并行的 GEMM-RS (#52079) ),将 all-gathers 与 1.5~3 倍内核级加速相结合(#51070),自适应投机代币预算提供约 60% 更好的 DSpark TTFT(#51725),以及可选的共享专家分片,每个 GPU 节省约 17 GiB 内存(#50912)。 Kimi-K3 现在也可以通过 V2 模型运行器在 ROCm 上运行 (#51653)。 DeepSeek V4:稀疏 MLA 现在可以端到端地用于纯解码、MTP 和 DSpark 推测解码 (#51538),并加入 AMD Quark NVFP4 支持 (#47972)、推理工作提示和映射 (#50580)、稀疏 top-k 元数据内核优化 (#52084、#51967)、缩小的急切 CUDA 图形区域 (#52084、#51967) #51430、#52401),以及 gfx11 和 gfx950 上的 ROCm 支持(#47017、#52212)。推测性解码进展:具有本地卷积和候选选择器的 DFlash2 (#52816)、DSpark 置信度计划验证 (#47808) 以及草稿模型自动启用的异步调度 (#48341)。 Model Runner V2 成熟度:E/P/D 分解 (#38390)、权重卸载 (#51413)、多层 MTP KV 缓存支持 (#50062)、编码器 CUDA 图 (#49852)、解码器 token-wise 池化 (#50931) 加上 Transformers 池化模型 (#52425)、无注意力模型 ( #52374 )和thinking_token_budget 支持(#46727 )。分层 KV 缓存卸载:磁盘卸载支持 (#49644)、通过 module_path 的树外二级管理器 (#51007)、部分二级负载结果 (#50321)、分层指标 (#48798) 以及用于与并行性无关的卸载的规范 CPU 布局 (#48414)。 Rust 前端和 gRPC :独立渲染器(#50289)、gRPC 上的多模态图像推理(#50368)、显式数据并行排名路由(#51178)和 RL 生命周期控制(#51316),protobuf 模式现已发布到 Buf(#51276)。新的默认值:max_num_batched_tokens 从 8192 提高到 16384 (#51726),默认为 Mamba 模型启用前缀缓存 (#50991),Blackwell CUDA 图形捕获默认值提高到 1024 (#49390)。重大更改:bitsandbytes 支持迁移到树外插件 (#43529);变形金刚升至 5.15.0 (#51668);已弃用的calculate_kv_scales运行时KV比例计算已被删除(#49389); override_attention_dtype 已删除(#48684)。发布工件 Python Wheels Platform 安装 PyPI (CUDA 13.0) pip install vllm PyPI (CUDA 13.0, uv) uv pip install vllm --torch-backend=auto ROCm pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.28.0/rocm722 Docker 镜像平台 Docker 镜像 CUDA 13.0(默认) docker pull vllm/vllm-openai:v0.28.0 ( v0.28.0-cu130 也可以) CUDA 12.9 docker pull vllm/vllm-openai:v0.28.0-cu129 CUDA 13.0 + Ubuntu 24.04 docker pull vllm/vllm-openai:v0.28.0-ubuntu2404 CUDA 12.9 + Ubuntu 24.04 docker pull vllm/vllm-openai:v0.28.0-cu129-ubuntu2404 ROCm docker pull vllm/vllm-openai-rocm:v0.28.0 CPU docker pull vllm/vllm-openai-cpu:v0.28.0 XPU docker pull vllm/vllm-openai-xpu:v0.28.0 其他工件 本页底部的资产部分提供了预构建的发布工件,包括: 源代码分发 tarball 适用于 x86_64 和 arm64 CUDA 13.0 Python 轮子 适用于 x86_64 和 arm64 CPU Python 轮子 适用于 x86_64、arm64 和 macOS 型号支持 新型号: Muse Glimmer (#51655)、带 BF16、MTP 和解析器支持的 Ling 3.0 Flash (#51045) 以及 FP8 变体 (#51265) 和混合 MXFP4 路由专家 (#52114)、Dots3 NOTE 原生多模式支持 (#51255) 和 Interns2mobius (#51149)。 Qwen:在 AMD ROCm 上启用 Qwen3.8 (#50068),为 Qwen3.5 GDN 融合 CUDA 后转换 MTP 解码内核 (#51674),与推测令牌对齐的 GDN 门 (#51812),以及针对纯文本检查点的 Qwen3.5 修复 (#50734、#50355)。 Transformers 建模后端:MLA 支持 (#48250)、与硬件无关的模型定义 (#49458)、完全通用的输入嵌入处理 (#51247)、logit softcapping (#52173) 和硬化的多模式路径 (#51408、#51657)。 LoRA:Gemma4 的视觉塔 LoRA (#42662)、Keye 的塔/连接器 LoRA (#51780) 和 Ultravox (#48215)。视觉编码器:Kimi-K2.5 (#50929) 和 Ernie-4.5-VL (#45254, #51461) 的 ViT 完整 CUDA 图,Qwen3-VL 编码器 (#40116) 的 torch.compile,以及 ViT 中避免的长阻塞 H2D 副本 (#51841)。 MoE:对 Mistral Large 3 和其他 MoE 后端的扩展 EPLB 支持 (#48355),CuTe DSL 瘦 GEMM 扩展到 GLM-5.2 (#49791)。推测解码覆盖率:KimiLinear 上声明的 EAGLE3 支持 (#5217
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱