跳到正文
热点事件持续更新

Fireworks 揭示 RL 训练数值错位问题

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,Fireworks 公布其发现:强化学习训练中存在数值错位,会直接毁掉训练。据其披露的 GLM 5.2 实验,在算法与数据完全相同的情况下,未做对齐时 reward 在 25 步内就崩溃,对齐后则保持稳定。Qwen3.5-MoE 实验进一步显示,expert 输出组合方式的差异会导致结果不一致,即便其中一方使用了更高精度。Fireworks 指出,这类数值错位引发的症状与数据问题、reward 问题或学习率设置不当非常相似,容易被误判为调参或数据缺陷。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定

    Fireworks 发现 RL 训练中的数值错位会毁掉训练:GLM 5.2 实验中同算法同数据,未对齐时 reward 在 25 步内崩溃,对齐后保持稳定。Qwen3.5-MoE 实验显示 expert 输出组合方式差异会导致不一致,即使一方用了更高精度,且症状酷似数据、reward 或学习率问题。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。