跳到正文
原文
vLLM 官方发布· khluu·· 11 天前精选AI 评分84

vLLM v0.30.0 发布:新增模型支持并更新推理与多硬件能力

v0.30.0

AI 导读

vLLM v0.30.0 正式发布,共包含 762 次提交,贡献者 315 人,并新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持。版本更新了 Model Runner V2、Fast Start、HiSparse、量化、推测解码及 NVIDIA、ROCm、XPU、CPU 后端,同时引入 scale-out 端点改为显式启用等破坏性变更。

推荐理由

本次发布集中更新模型支持、推理引擎、量化与多硬件后端,并明确列出接口、参数和兼容性变更,便于部署前评估升级影响与迁移成本。

来源:vLLM 官方发布 · github.com