跳到正文
热点事件持续更新

Qwen3.6 混合架构致 llama-server 重算 prompt

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 5 日,AGI Hunt 发布排查记录:作者在 16GB 显存的 4060 Ti 上用 llama-server 运行 Qwen3.6 35B-A3B(Q4KM 量化),专家层大多通过 --n-cpu-moe 放在 CPU,并搭配 OpenCode 使用。使用中发现每轮对话开始前都会出现较长暂停,且随会话变长而进一步恶化。报道将原因指向 Qwen3.6 的混合架构,使 llama-server 每轮都要全量重算 prompt。截至该报道,问题仍处于作者的个人复现与排查阶段,未见官方回应或其他来源的独立验证。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    排查 OpenCode 每轮卡顿:Qwen3.6 混合架构致 llama-server 全量重算 prompt

    作者在 16GB 的 4060 Ti 上用 llama-server 跑 Qwen3.6 35B-A3B(Q4KM,专家层多数通过 --n-cpu-moe 放在 CPU),配合 OpenCode 时发现每轮对话开始都有长暂停,且随会话变长而恶化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。