GLM-5.3-Flash NVFP4 配置与并发实测
先了解这件事
2026 年 10 月 2 日,AGI Hunt 报道称,开发者 Zach Mueller 公开了 GLM-5.3-Flash NVFP4 在 4 张 RTX 6000 Max-Q 上运行的完整 SGLang 部署配置:张量并行设为 4,MoE 后端采用 flashinfercutlass,量化方式为 modeloptfp4,KV cache 使用 fp8e4m3。同一日的后续报道补充了实测内容:Zach Mueller 用 NVIDIA AI Perf 对该量化版做了并发 1 到 32 的速度测试,结果显示并发超过 8 之后,单用户生成速度不再提升,首 token 延迟(TTFT)持续上升;作者据此给出 Pareto 交互性曲线,用以说明本地部署该模型的实用并发上限。早先报道未提及实测性能、吞吐数据或后续更新计划,后续报道补上了并发测试结果。两篇报道的配置参数(4 张 RTX 6000 Max-Q、张量并行 4、flashinfercutlass、modeloptfp4、fp8e4m3)一致,未见数字或说法冲突。
AI 根据报道生成 · 40 分钟前更新
事件进展
- 10月2日 08:32 · 1 篇报道Zach Mueller 公开 GLM-5.3-Flash NVFP4 的 SGLang 部署配置AGI Hunt:Zach Mueller 公开 GLM-5.3-Flash NVFP4 的 SGLang 部署配置
- 10月2日 08:32 · 1 篇报道GLM-5.3-Flash NVFP4 本地部署并发实测AGI Hunt:GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升
报道时间线
沿着报道,了解事件的不同侧面。
- AGI HuntZach Mueller 公开 GLM-5.3-Flash NVFP4 的 SGLang 部署配置
Zach Mueller 公开了在 4 张 RTX 6000 Max-Q 上运行 GLM-5.3-Flash NVFP4 的完整 SGLang 配置,包含张量并行 4、MoE 后端 flashinfercutlass、量化 modeloptfp4 以及 fp8e4m3 的 KV cache。
- AGI HuntGLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升
开发者 Zach Mueller 用 NVIDIA AI Perf 在 4 张 RTX 6000 Max-Q 上对 GLM-5.3-Flash NVFP4 量化版做并发 1 到 32 的速度测试。并发超过 8 后,单用户生成速度不再提升,首 token 延迟(TTFT)持续上升;作者给出 Pareto 交互性曲线,说明本地部署该模型的实用并发上限。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。