跳到正文
原文
AGI Hunt· turtleninja99·· 5 小时前AI 评分40

玩家在 64GB Mac mini M5 上本地跑 Qwen Flash Next

AI 导读

Reddit 用户 turtleninja99 在 64GB Mac mini M5 上本地运行 Qwen Flash Next Q4 量化模型,自优化后解码约 17.5 tks、提示词处理约 360 tks。因显存放不下全部 MoE 专家权重,作者采用热专家留缓存、其余从 SSD 流式加载的方案。但解码时仍有约 27% 的时间在等待磁盘读取,显示本地跑大 MoE 模型仍受存储带宽制约。

来源:AGI Hunt · agihunt.info