跳到正文
热点事件持续更新

16GB显存跑Qwen3-27B:开MTP掉上下文

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月3日,AGI Hunt 报道,有用户在 16GB 显存上用 llama.cpp 以 iq3s 量化本地运行 Qwen3 27B,为 Hermes agent 提供服务。该用户实测发现,开启 MTP draft 后 prefill 变慢,模型表现似乎也变差;在显存吃紧的情况下,上下文只能压缩到 96k,解码速度约 40–60 tps。若关闭 MTP,则可恢复 128k 上下文,但解码降至约 35 tps。该用户就这一取舍发帖征询建议,报道中未见后续结论。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    16GB 显存跑 Qwen3-27B agent:开 MTP 掉上下文还变笨?

    用户用 llama.cpp 在 16GB 显存以 iq3s 量化本地运行 Qwen3 27B,为 Hermes agent 服务,发现开启 MTP draft 后 prefill 变慢、模型表现似乎变差。显存吃紧下上下文只能压到 96k,解码约 40-60 tps。关闭 MTP 可恢复 128k 上下文,但解码降至约 35 tps,用户发帖征询取舍建议。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。