跳到正文
热点事件持续更新

Qwen3-Next-80B MoE专家替换提速约3倍

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月6日,AGI Hunt 报道了一种在消费级硬件上运行 Qwen3-Next-80B-A3B 的做法。作者把该模型 Q4KM 量化后 48.5GB 权重中的约 1/4 专家常驻 RTX 3090 显存,其余专家按需从 NVMe 读取,以此绕开显存与内存限制。报道称,在约 15.7GB 显存、16GB 内存的场景下,解码速度由 llama.cpp(--n-c-moe 34)的 31.8 tok/s 提升到 94.5 tok/s,约 3 倍;即使不常驻专家、纯 SSD 读取,也能达到 89 tok/s。目前该方案仍属作者的实测分享,报道未提及更广泛的验证或后续更新。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速

    作者把 Qwen3-Next-80B-A3B(Q4KM,48.5GB)的 1/4 专家常驻 RTX 3090 显存、其余按需从 NVMe 读取,在约 15.7GB 显存下把 16GB 内存场景的解码速度从 llama.cpp(--n-cpu-moe 34)的 31.8 tok/s 提升到 94.5 tok/s,纯 SSD 读取也有 89 tok/s。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。