跳到正文
原文
AGI Hunt· Remarkable_Air_8383·· 2 小时前AI 评分34

16GB 显存跑 Qwen3-27B agent:开 MTP 掉上下文还变笨?

AI 导读

用户用 llama.cpp 在 16GB 显存以 iq3s 量化本地运行 Qwen3 27B,为 Hermes agent 服务,发现开启 MTP draft 后 prefill 变慢、模型表现似乎变差。显存吃紧下上下文只能压到 96k,解码约 40-60 tps。关闭 MTP 可恢复 128k 上下文,但解码降至约 35 tps,用户发帖征询取舍建议。

来源:AGI Hunt · agihunt.info