AGI Hunt· tabletuser_blogspot·· 3 小时前AI 评分47
GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快
GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快
AI 导读
在 AMD Ryzen 7 6800H 的 Radeon 680M iGPU 上,用 llama.cpp Vulkan 版对 GLM-4.7 Flash 三种约 16-17GB 的 30B.A3B MoE 量化做测试,MXFP4MOE 预处理 258.36 t/s、领先约 60%,Q4KXL 生成 13.13 t/s 最快。
来源:AGI Hunt · agihunt.info