热点事件持续更新
微软研究院提出 SortedRL 优化 RL 训练调度
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 9 月 30 日,微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。报道称,RL 生成阶段模型会产出长度差异很大的多步推理长响应,而标准训练更新要求同一 batch 内所有响应全部完成,短响应只能闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 的时间空闲。该系统称可在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。目前仅有这一篇报道,尚无更多技术细节、实验数据或第三方复现结果。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 13:35
新报道披露:RL 生成阶段 GPU 空闲时间高达 70%–74%,SortedRL 旨在缓解该瓶颈。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- AGI HuntGPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈
微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。RL 生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。该系统在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。