AGI Hunt· nubela·· 4 小时前AI 评分41
gufo-Qwen3.6-35B 本地实测:Strix Halo 上预填充 3095 tok/s
gufo-Qwen3.6-35B 本地实测:Strix Halo 上 3095 tok/s 预填充
AI 导读
Reddit 用户实测 gufo-Qwen3.6-35B-A3B-Q6dense 量化模型在 AMD Strix Halo 平台上的本地推理成绩,prefill 达 3095 tok/s,decode 约 190 tok/s。该项目已在 GitHub 开源,对关注消费级本地部署大模型的人是一份有参考价值的性能数据点。
来源:AGI Hunt · agihunt.info