热点事件持续更新
Aleph Alpha 公开 MoE 预训练扩展方法
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,Aleph Alpha 通过官方博客公开其在混合专家(MoE)模型预训练上的分层预训练 scaling 方法。据 AGI Hunt 报道,该博客称团队将一个 30B-A3B 的 MoE 模型从 16 块 B200 GPU 扩展到 512 块,全程保持 35% 的 MFU,并实现近线性扩展;博客还讨论了不同 GPU 规模下的取舍,对从事预训练工程实践的团队具有参考价值。目前该事件仅有这一篇报道,暂无后续进展或第三方复现信息。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 00:22
Aleph Alpha 公开 MoE 分层预训练扩展方法:30B-A3B 模型从 16 块扩至 512 块 B200。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntAleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展
Aleph Alpha 发布博客详解其分层预训练 scaling 方法,将一个 30B-A3B 的 MoE 模型从 16 块 B200 扩展到 512 块,全程保持 35% 的 MFU 并实现近线性扩展。博客还讨论了不同 GPU 规模下的取舍,对做预训练工程实践的团队有参考价值。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。