跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分72

vLLM transformers 建模后端性能追平甚至超越原生实现

Native-speed vLLM transformers modeling backend

AI 导读

vLLM 的 transformers 建模后端现已与自定义原生实现速度相当或更快,支持 Qwen3-4B 单卡、Qwen3-32B 张量并行、Qwen3-235B-A22B-FP8 MoE 数据+专家并行三种配置。

推荐理由

提供了三种不同规模 Qwen3 模型的基准对比数据,读者可以据此判断该更新对自己模型推理场景的实际价值。

来源:Hugging Face Blog · huggingface.co