AGI Hunt· Gunho Park·· 3 小时前AI 评分46
SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍
SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍
AI 导读
针对 MoE 模型批式解码几乎触及全部专家池、权重搬运成为瓶颈的问题,SlimWise 按推理阶段解耦专家剪枝:prefill 用全模型、decode 用剪枝后模型,并复用 prefill 生成的 KV cache,另加低成本蒸馏阶段让 decoder 继续使用全模型 KV cache。
来源:AGI Hunt · agihunt.info