跳到正文
原文
AGI Hunt· Zestyclose_Reality15·· 3 小时前AI 评分60

3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速

3090+16GB 内存跑 Qwen3-Next-80B,MoE 专家替换实现约 3 倍解码提速

AI 导读

作者把 Qwen3-Next-80B-A3B(Q4KM,48.5GB)的 1/4 专家常驻 RTX 3090 显存、其余按需从 NVMe 读取,在约 15.7GB 显存下把 16GB 内存场景的解码速度从 llama.cpp(--n-cpu-moe 34)的 31.8 tok/s 提升到 94.5 tok/s,纯 SSD 读取也有 89 tok/s。

来源:AGI Hunt · agihunt.info