Hugging Face Blog·· 2026-07-08精选AI 评分78
vLLM 更新 transformers 建模后端,兼容架构可达到原生实现速度
Native-speed vLLM transformers modeling backend
AI 导读
vLLM 的 transformers 建模后端在三个 Qwen3 测试中均达到或超过原生实现的吞吐量。该后端通过 torch.fx 静态分析与 ast 改写应用推理层融合,并可继续使用 torch.compile 和 CUDA Graphs;目前不支持线性注意力模型,Hub 仓库中的非规范自定义模型也难以使用。
推荐理由
给出后端升级命令、启用参数和并行示例,并用三个Qwen3模型说明性能结果,便于模型作者评估迁移成本与兼容限制。
来源:Hugging Face Blog · huggingface.co