跳到正文
热点事件持续更新

RTX 6000+M5 异构跑 MiMo 2.6 Flash

3 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,Hugging Face 工程师 pcuenq 展示了一套异构跨机分布式推理方案:一台搭载 RTX 6000 Blackwell 的 Linux 主机与 M5 笔记本经 10 GbE 连接,共同推理 MiMo 2.6 Flash,达到 40 tokens/sec。报道称该方案加载原生 mxfp4 权重,由 llama.cpp 原生支持、开箱即用。作者借此表示本地 AI 已逼近前沿水平,越来越多场景不再需要最大的闭源模型。同日他还晒出自制微型集群的硬件配置:M5 Max(128GB)、一台未启用的 M1 Max(64GB)以及上述装 RTX 6000 Blackwell 的 Linux 主机;Mac 之间用 Thunderbolt 连接,M5 与 Linux 主机之间用 10 GbE。同频道信息显示,在这一异构方案下 MiMo 2.6 Flash 同样达到 40 tokens/sec。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    晒出自制微型集群:M5 Max 128GB + Linux RTX 6000 跑本地 AI

    作者晒出自制微型推理集群:M5 Max(128GB)、未启用的 M1 Max(64GB)和一台搭载 RTX 6000 Blackwell 的 Linux 主机。Mac 之间用 Thunderbolt 连接,M5 与 Linux 主机用 10 GbE,配合异构分布式推理方案跑本地大模型,同频道信息显示 MiMo 2.6 Flash 达 40 tokens/sec。

  2. AGI Hunt
    Hugging Face 工程师用 RTX 6000 与 M5 笔记本异构分布式跑 MiMo 2.6 Flash,达 40 tokens/sec

    Hugging Face 工程师 pcuenq 用 RTX 6000 Blackwell 与 M5 笔记本跨机分布式推理 MiMo 2.6 Flash,经 10 GbE 连接达到 40 tokens/sec。加载的是原生 mxfp4 权重,llama.cpp 开箱即用。他认为本地模型已逼近前沿水平,越来越多场景不再需要最大的闭源模型。

  3. AGI Hunt
    RTX 6000 + M5 笔记本异构跨机跑 MiMo 2.6 Flash,40 tokens/sec

    作者用 RTX 6000 与 M5 笔记本经 10 GbE 跨机分布式推理 MiMo 2.6 Flash,达 40 tokens/sec。该方案使用原生 mxfp4 权重,由 llama.cpp 原生支持。作者借此感叹本地 AI 已逼近前沿水平。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。