热点事件持续更新
Qwen3.6 混合架构致 llama-server 重算 prompt
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 5 日,AGI Hunt 发布排查记录:作者在 16GB 显存的 4060 Ti 上用 llama-server 运行 Qwen3.6 35B-A3B(Q4KM 量化),专家层大多通过 --n-cpu-moe 放在 CPU,并搭配 OpenCode 使用。使用中发现每轮对话开始前都会出现较长暂停,且随会话变长而进一步恶化。报道将原因指向 Qwen3.6 的混合架构,使 llama-server 每轮都要全量重算 prompt。截至该报道,问题仍处于作者的个人复现与排查阶段,未见官方回应或其他来源的独立验证。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI Hunt排查 OpenCode 每轮卡顿:Qwen3.6 混合架构致 llama-server 全量重算 prompt
作者在 16GB 的 4060 Ti 上用 llama-server 跑 Qwen3.6 35B-A3B(Q4KM,专家层多数通过 --n-cpu-moe 放在 CPU),配合 OpenCode 时发现每轮对话开始都有长暂停,且随会话变长而恶化。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。