跳到正文
原文
AGI Hunt· sophiamyang·· 2 小时前AI 评分46

Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定

AI 导读

Fireworks 发现 RL 训练中的数值错位会毁掉训练:GLM 5.2 实验中同算法同数据,未对齐时 reward 在 25 步内崩溃,对齐后保持稳定。Qwen3.5-MoE 实验显示 expert 输出组合方式差异会导致不一致,即使一方用了更高精度,且症状酷似数据、reward 或学习率问题。

来源:AGI Hunt · agihunt.info