跳到正文
热点事件持续更新

Aleph Alpha 公开 MoE 预训练扩展方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,Aleph Alpha 通过官方博客公开其在混合专家(MoE)模型预训练上的分层预训练 scaling 方法。据 AGI Hunt 报道,该博客称团队将一个 30B-A3B 的 MoE 模型从 16 块 B200 GPU 扩展到 512 块,全程保持 35% 的 MFU,并实现近线性扩展;博客还讨论了不同 GPU 规模下的取舍,对从事预训练工程实践的团队具有参考价值。目前该事件仅有这一篇报道,暂无后续进展或第三方复现信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展

    Aleph Alpha 发布博客详解其分层预训练 scaling 方法,将一个 30B-A3B 的 MoE 模型从 16 块 B200 扩展到 512 块,全程保持 35% 的 MFU 并实现近线性扩展。博客还讨论了不同 GPU 规模下的取舍,对做预训练工程实践的团队有参考价值。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。