AGI Hunt· lxfater·· 3 小时前AI 评分43
网友用双 V100 玩起 93GB 的 GLM 5.3 Flash,解码约 20 t/s
网友用双 V100 玩起 93GB 的 GLM 5.3 Flash,解码约 20 t/s
AI 导读
网友以 2x Tesla V100 32GB 等极低硬件门槛本地跑起疑似 GLM 5.3 Flash 的模型,文件 93.1GB,是目前最小的版本,尚未获官方确认。该模型推测为 MoE 架构,暂不支持 MTP,解码速度约 20 tokens/s,使用定制推理引擎 Strata。作者称会继续优化并最终开源发布。
来源:AGI Hunt · agihunt.info