跳到正文
热点事件持续更新

SlimWise 解耦MoE专家剪枝,解码吞吐提升1.81倍

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,AGI Hunt 报道了 SlimWise 的方法。报道称,MoE 模型在批式解码时几乎会触及全部专家池,权重搬运因此成为瓶颈。SlimWise 的应对思路是按推理阶段解耦专家剪枝:prefill 阶段使用全模型,decode 阶段改用剪枝后的模型,并复用 prefill 生成的 KV cache;此外还加入一个低成本的蒸馏阶段,让 decoder 能够继续使用全模型的 KV cache。报道称该方法使解码吞吐最高提升 1.81 倍。此前版本标题中已出现 1.81 倍这一数字,本次新报道补充了分阶段剪枝、KV cache 复用与蒸馏阶段的具体机制,未见与早先说法相矛盾的数字或结论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍

    针对 MoE 模型批式解码几乎触及全部专家池、权重搬运成为瓶颈的问题,SlimWise 按推理阶段解耦专家剪枝:prefill 用全模型、decode 用剪枝后模型,并复用 prefill 生成的 KV cache,另加低成本蒸馏阶段让 decoder 继续使用全模型 KV cache。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。