热点事件持续更新
GLM-4.7 Flash 三种量化 llama.cpp 实测
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月5日,AGI Hunt 发布 GLM-4.7 Flash 在 llama.cpp 上的量化实测。测试硬件为 AMD Ryzen 7 6800H 处理器与 Radeon 680M 核显,使用 llama.cpp 的 Vulkan 版本,对比 GLM-4.7 Flash 三种体积约 16–17GB 的 30B.A3B MoE 量化。结果显示,MXFP4MOE 在预处理阶段达到 258.36 t/s,领先约 60%;Q4KXL 在生成阶段达到 13.13 t/s,为三者中最快。这是该事件目前唯一一篇报道,尚无与其他来源数据的差异或更正。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI HuntGLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快
在 AMD Ryzen 7 6800H 的 Radeon 680M iGPU 上,用 llama.cpp Vulkan 版对 GLM-4.7 Flash 三种约 16-17GB 的 30B.A3B MoE 量化做测试,MXFP4MOE 预处理 258.36 t/s、领先约 60%,Q4KXL 生成 13.13 t/s 最快。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。