热点事件持续更新
Qwen3-Next-80B MoE专家替换提速约3倍
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月6日,AGI Hunt 报道了一种在消费级硬件上运行 Qwen3-Next-80B-A3B 的做法。作者把该模型 Q4KM 量化后 48.5GB 权重中的约 1/4 专家常驻 RTX 3090 显存,其余专家按需从 NVMe 读取,以此绕开显存与内存限制。报道称,在约 15.7GB 显存、16GB 内存的场景下,解码速度由 llama.cpp(--n-c-moe 34)的 31.8 tok/s 提升到 94.5 tok/s,约 3 倍;即使不常驻专家、纯 SSD 读取,也能达到 89 tok/s。目前该方案仍属作者的实测分享,报道未提及更广泛的验证或后续更新。
AI 根据报道生成 · 1 小时前更新
最新进展10月6日 20:29
3090+16GB 内存跑 Qwen3-Next-80B 解码达 94.5 tok/s,较基线约 3 倍。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Hunt3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速
作者把 Qwen3-Next-80B-A3B(Q4KM,48.5GB)的 1/4 专家常驻 RTX 3090 显存、其余按需从 NVMe 读取,在约 15.7GB 显存下把 16GB 内存场景的解码速度从 llama.cpp(--n-cpu-moe 34)的 31.8 tok/s 提升到 94.5 tok/s,纯 SSD 读取也有 89 tok/s。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。