AGI Hunt· MysteriousInterest32·· 4 小时前AI 评分52
排查 OpenCode 每轮卡顿:Qwen3.6 混合架构致 llama-server 全量重算 prompt
AI 导读
作者在 16GB 的 4060 Ti 上用 llama-server 跑 Qwen3.6 35B-A3B(Q4KM,专家层多数通过 --n-cpu-moe 放在 CPU),配合 OpenCode 时发现每轮对话开始都有长暂停,且随会话变长而恶化。
来源:AGI Hunt · agihunt.info