AGI Hunt· pcuenq·· 3 小时前AI 评分40
RTX 6000 + M5 笔记本异构跨机跑 MiMo 2.6 Flash,40 tokens/sec
RTX 6000+M5 笔记本异构跑 MiMo 2.6 Flash,40 tokens/sec
AI 导读
作者用 RTX 6000 与 M5 笔记本经 10 GbE 跨机分布式推理 MiMo 2.6 Flash,达 40 tokens/sec。该方案使用原生 mxfp4 权重,由 llama.cpp 原生支持。作者借此感叹本地 AI 已逼近前沿水平。
来源:AGI Hunt · agihunt.info