热点事件持续更新
Foil 提出循环 MoE 方法,预训练损失降 0.012 nat
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Foil 提出一种针对循环 MoE 的「压平」做法:专家层数量减半、每层专家数翻倍、循环次数翻倍,并在每轮循环解绑独立注意力参数,专家与路由保持共享。据 AGI Hunt 2026 年 10 月 6 日报道,在专家参数与每 token 专家计算量不变的前提下,20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时压平程度最高的模型以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好。相关代码与配置已在 GitHub 开源。
AI 根据报道生成 · 1 小时前更新
最新进展10月6日 19:17
Foil 循环 MoE 方法细节公开:专家层减半、每层专家数翻倍,代码与配置已开源。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntFoil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat
Foil 提出给循环 MoE「打循环」:专家层减半、每层专家数翻倍、循环次数翻倍,每轮循环解绑独立注意力参数,专家与路由保持共享。在专家参数与每 token 专家计算量不变的前提下,20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时压平最多者以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好。代码与配置已在 GitHub 开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。