跳到正文
原文
HuggingFace Blog·· 2026-07-08精选AI 评分67

vLLM 的 transformers 建模后端实现原生推理速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 表示 vLLM 的 transformers 建模后端现已在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。对比覆盖 Qwen3 4B 单卡、32B 张量并行、235B FP8 MoE 数据加专家并行三种部署,模型只需加 --model-impl transformers 即可启用,且仍可用于训练。

推荐理由

文章给出 transformers 后端与 vLLM 原生实现在三种 Qwen3 模型上的吞吐对比,便于了解免移植推理的实现路径。

来源:HuggingFace Blog · huggingface.co