跳到正文
原文
AGI Hunt· TheZachMueller·· 3 小时前AI 评分44

GLM-5.3 量化版塞进 8 张 RTX Pro 6000,峰值解码 486 tok/s

GLM-5.3 量化版塞进 8 张 RTX Pro 6000,峰值解码 486 tok/s

AI 导读

GLM-5.3 的 NVFP4 量化版可在单节点 8 张 RTX Pro 6000 上完成部署,峰值解码达 486 tok/s。其中 nvidia 版量化实现 54 tok/s 解码、251k 上下文、峰值 476 tok/s;采用 DFlash2 的 incoai 版量化则为 93 tok/s 解码、123k 上下文。

来源:AGI Hunt · agihunt.info