跳到正文
原文
Google Developers Blog·· 1 天前AI 评分53

在 MaxText 中复现 Olmo 3 7B 预训练:TPU 大规模训练案例研究

Reproducing Olmo 3 7B Pre-training in MaxText: case study of large scale training on TPUs

AI 导读

Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。

来源:Google Developers Blog · developers.googleblog.com