跳到正文
原文
AGI Hunt· thisguyknowsai·· 5 小时前AI 评分24

ROME 训练管线拆解:500B token CPT 加两阶段 SFT 与 RL

AI 导读

ROME 的三阶段训练管线被拆解:Stage 1 在 5000 亿 token 的结构化代码任务上做 CPT 持续预训练,Stage 2 是带错误掩码的两阶段 SFT,Stage 3 是块级优化的 RL。各阶段逐级递进,走的是系统性能力积累路线而非捷径。

来源:AGI Hunt · agihunt.info