跳到正文
原文
AGI Hunt· burny_tech·· 5 小时前AI 评分30

rosinality 提出新 looped MoE 配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力

looped MoE 新配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力

AI 导读

研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。

来源:AGI Hunt · agihunt.info