跳到正文
热点事件持续更新

Foil 提出循环 MoE 方法,预训练损失降 0.012 nat

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Foil 提出一种针对循环 MoE 的「压平」做法:专家层数量减半、每层专家数翻倍、循环次数翻倍,并在每轮循环解绑独立注意力参数,专家与路由保持共享。据 AGI Hunt 2026 年 10 月 6 日报道,在专家参数与每 token 专家计算量不变的前提下,20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时压平程度最高的模型以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好。相关代码与配置已在 GitHub 开源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    Foil 方法让循环 MoE 翻倍专家数,百B token 预训练损失降 0.012 nat

    Foil 提出给循环 MoE「打循环」:专家层减半、每层专家数翻倍、循环次数翻倍,每轮循环解绑独立注意力参数,专家与路由保持共享。在专家参数与每 token 专家计算量不变的前提下,20B token 时所有 Foil 模型预训练损失均低于未压平基线;100B token 时压平最多者以相同参数和计算量比基线低 0.012 nat,下游准确率持平或更好。代码与配置已在 GitHub 开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。