跳到正文
原文
AGI Hunt· CatAstro_Piyush·· 3 小时前AI 评分41

Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展

Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展

AI 导读

Aleph Alpha 发布博客详解其分层预训练 scaling 方法,将一个 30B-A3B 的 MoE 模型从 16 块 B200 扩展到 512 块,全程保持 35% 的 MFU 并实现近线性扩展。博客还讨论了不同 GPU 规模下的取舍,对做预训练工程实践的团队有参考价值。

来源:AGI Hunt · agihunt.info