跳到正文
原文
AGI Hunt· nubela·· 4 小时前AI 评分41

gufo-Qwen3.6-35B 本地实测:Strix Halo 上预填充 3095 tok/s

gufo-Qwen3.6-35B 本地实测:Strix Halo 上 3095 tok/s 预填充

AI 导读

Reddit 用户实测 gufo-Qwen3.6-35B-A3B-Q6dense 量化模型在 AMD Strix Halo 平台上的本地推理成绩,prefill 达 3095 tok/s,decode 约 190 tok/s。该项目已在 GitHub 开源,对关注消费级本地部署大模型的人是一份有参考价值的性能数据点。

来源:AGI Hunt · agihunt.info