热点事件持续更新
vLLM实测4:8稀疏专家GEMM加速1.35-1.65倍
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月7日,AGI Hunt 报道,vLLM 官方转发了一组实测结果:在 B200 上,采用 paired 4:8 稀疏化(每 8 个权重保留 2 个相邻 pair)后,expert GEMM 比密集 NVFP4 快 1.35–1.65 倍。不过报道同时指出,理论上的 2 倍峰值收益在实际 serving 中无法保持:Kimi-K2.5 在 vLLM 服务中的实测加速仅为 1.18 倍。报道认为,这为 MoE 模型的稀疏推理收益提供了更贴近真实的基准参考。目前公开信息仍限于这一组基准测试结果,尚未见更大规模线上部署的数据。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 11:09
vLLM官方转发实测:4:8稀疏专家GEMM在B200上比NVFP4密集快1.35-1.65倍。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntvLLM 实测:4:8 稀疏专家 GEMM 比 NVFP4 密集快 1.35-1.65 倍
vLLM 官方转发的实测显示,paired 4:8 稀疏化(每 8 个权重保留 2 个相邻 pair)在 B200 上让 expert GEMM 比密集 NVFP4 快 1.35-1.65 倍。但理论上的 2 倍峰值收益在实际 serving 中无法保持,Kimi-K2.5 在 vLLM 服务中实测加速为 1.18 倍。这为 MoE 模型的稀疏推理收益提供了贴近真实的基准参考。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。