AGI Hunt· sophiamyang·· 5 小时前AI 评分41
Mistral 拆解大规模 RL 训练:3000 张 GPU 日产 330 亿 token
Mistral 拆解大规模 RL 训练:3000 张 GPU 日产 330 亿 token
AI 导读
Mistral 研究人员 Sophia Yang 分享其大规模 RL 训练系统:Actor 集群自动扩缩容、异步训练,单条 rollout 可达数百万 token。3000 张 GPU 每天产出约 330 亿 token,过滤掩码后约 160 亿进入训练,两阶段新方法削减 off-policy 漂移以稳定长程 RL。她称该系统跨领域人工评测「碾压 GLM 5.3」,未附数据、未经证实。
来源:AGI Hunt · agihunt.info