跳到正文
热点事件持续更新

vLLM实测4:8稀疏专家GEMM加速1.35-1.65倍

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道,vLLM 官方转发了一组实测结果:在 B200 上,采用 paired 4:8 稀疏化(每 8 个权重保留 2 个相邻 pair)后,expert GEMM 比密集 NVFP4 快 1.35–1.65 倍。不过报道同时指出,理论上的 2 倍峰值收益在实际 serving 中无法保持:Kimi-K2.5 在 vLLM 服务中的实测加速仅为 1.18 倍。报道认为,这为 MoE 模型的稀疏推理收益提供了更贴近真实的基准参考。目前公开信息仍限于这一组基准测试结果,尚未见更大规模线上部署的数据。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    vLLM 实测:4:8 稀疏专家 GEMM 比 NVFP4 密集快 1.35-1.65 倍

    vLLM 官方转发的实测显示,paired 4:8 稀疏化(每 8 个权重保留 2 个相邻 pair)在 B200 上让 expert GEMM 比密集 NVFP4 快 1.35-1.65 倍。但理论上的 2 倍峰值收益在实际 serving 中无法保持,Kimi-K2.5 在 vLLM 服务中实测加速为 1.18 倍。这为 MoE 模型的稀疏推理收益提供了贴近真实的基准参考。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。