AGI Hunt· TheZachMueller·· 2 小时前AI 评分48
GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升
AI 导读
开发者 Zach Mueller 用 NVIDIA AI Perf 在 4 张 RTX 6000 Max-Q 上对 GLM-5.3-Flash NVFP4 量化版做并发 1 到 32 的速度测试。并发超过 8 后,单用户生成速度不再提升,首 token 延迟(TTFT)持续上升;作者给出 Pareto 交互性曲线,说明本地部署该模型的实用并发上限。
来源:AGI Hunt · agihunt.info