跳到正文
热点事件持续更新

GLM-4.7 Flash 三种量化 llama.cpp 实测

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月5日,AGI Hunt 发布 GLM-4.7 Flash 在 llama.cpp 上的量化实测。测试硬件为 AMD Ryzen 7 6800H 处理器与 Radeon 680M 核显,使用 llama.cpp 的 Vulkan 版本,对比 GLM-4.7 Flash 三种体积约 16–17GB 的 30B.A3B MoE 量化。结果显示,MXFP4MOE 在预处理阶段达到 258.36 t/s,领先约 60%;Q4KXL 在生成阶段达到 13.13 t/s,为三者中最快。这是该事件目前唯一一篇报道,尚无与其他来源数据的差异或更正。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快

    在 AMD Ryzen 7 6800H 的 Radeon 680M iGPU 上,用 llama.cpp Vulkan 版对 GLM-4.7 Flash 三种约 16-17GB 的 30B.A3B MoE 量化做测试,MXFP4MOE 预处理 258.36 t/s、领先约 60%,Q4KXL 生成 13.13 t/s 最快。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。