Google Developers Blog·· 1 天前AI 评分53
在 MaxText 中复现 Olmo 3 7B 预训练:TPU 大规模训练案例研究
Reproducing Olmo 3 7B Pre-training in MaxText: case study of large scale training on TPUs
AI 导读
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
来源:Google Developers Blog · developers.googleblog.com