跳到正文
原文
AGI Hunt· lxfater·· 3 小时前AI 评分43

网友用双 V100 玩起 93GB 的 GLM 5.3 Flash,解码约 20 t/s

网友用双 V100 玩起 93GB 的 GLM 5.3 Flash,解码约 20 t/s

AI 导读

网友以 2x Tesla V100 32GB 等极低硬件门槛本地跑起疑似 GLM 5.3 Flash 的模型,文件 93.1GB,是目前最小的版本,尚未获官方确认。该模型推测为 MoE 架构,暂不支持 MTP,解码速度约 20 tokens/s,使用定制推理引擎 Strata。作者称会继续优化并最终开源发布。

来源:AGI Hunt · agihunt.info