跳到正文
原文
AGI Hunt· TheZachMueller·· 2 小时前AI 评分47

Qwen3.8-Flash-Next 2.39-bit 量化:180B 模型塞进单台 DGX Spark,仅损失 4.5%

180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5%

AI 导读

开发者 DJLougen 发布 Qwen3.8-Flash-Next 的超低比特量化版本 Mooney,已上架 Hugging Face,专家层 2.125-bit、全模型平均 2.39 bits/weight,保留 BF16 成绩的 95.5%。下载体积 92 GB、内存占用约 39 GiB,使这个 1800 亿参数的 MoE 模型可在单台 DGX Spark 上运行。

来源:AGI Hunt · agihunt.info