AGI Hunt· pcuenq·· 3 小时前AI 评分47
Hugging Face 工程师用 RTX 6000 与 M5 笔记本异构分布式跑 MiMo 2.6 Flash,达 40 tokens/sec
RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec
AI 导读
Hugging Face 工程师 pcuenq 用 RTX 6000 Blackwell 与 M5 笔记本跨机分布式推理 MiMo 2.6 Flash,经 10 GbE 连接达到 40 tokens/sec。加载的是原生 mxfp4 权重,llama.cpp 开箱即用。他认为本地模型已逼近前沿水平,越来越多场景不再需要最大的闭源模型。
来源:AGI Hunt · agihunt.info