跳到正文
热点事件持续更新

微软研究院提出 SortedRL 优化 RL 训练调度

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 9 月 30 日,微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。报道称,RL 生成阶段模型会产出长度差异很大的多步推理长响应,而标准训练更新要求同一 batch 内所有响应全部完成,短响应只能闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 的时间空闲。该系统称可在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。目前仅有这一篇报道,尚无更多技术细节、实验数据或第三方复现结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈

    微软研究院提出 SortedRL 在线长度感知调度系统,瞄准 LLM 强化学习训练的调度瓶颈。RL 生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。该系统在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。