AGI Hunt· Shouren Wang·· 3 小时前AI 评分43
Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat
Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat
AI 导读
Foil 提出给循环 MoE「打循环」:专家层减半、每层专家数翻倍、循环次数翻倍,每轮循环解绑独立注意力参数,专家与路由保持共享。在专家参数与每 token 专家计算量不变的前提下,20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时压平最多者以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好。代码与配置已在 GitHub 开源。
来源:AGI Hunt · agihunt.info