跳到正文
原文
AGI Hunt· pcuenq·· 3 小时前AI 评分47

Hugging Face 工程师用 RTX 6000 与 M5 笔记本异构分布式跑 MiMo 2.6 Flash,达 40 tokens/sec

RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec

AI 导读

Hugging Face 工程师 pcuenq 用 RTX 6000 Blackwell 与 M5 笔记本跨机分布式推理 MiMo 2.6 Flash,经 10 GbE 连接达到 40 tokens/sec。加载的是原生 mxfp4 权重,llama.cpp 开箱即用。他认为本地模型已逼近前沿水平,越来越多场景不再需要最大的闭源模型。

来源:AGI Hunt · agihunt.info