跳到正文
热点事件持续更新

ROSS 复用历史 rollout 做选择性监督

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 9 月 30 日,AGI Hunt 报道了一种名为 ROSS 的方法:它以完整的历史 rollout 作为上下文,只对选定的模型生成片段施加 loss,从而把原本被丢弃的自生成轨迹经离线 SFT 复用为行为经验,实现选择性监督。报道称,该方法在 SWE-bench Verified 上提升了 4.2 个百分点。目前公开信息仅涉及该方法的思路与这一评测结果,未见更多实验细节或后续进展。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. AGI Hunt
    ROSS 复用历史 rollout 做选择性监督,SWE-bench Verified 提升 4.2 个百分点

    ROSS 以完整历史 rollout 为上下文、只对选定的模型生成片段施加 loss,把原本被丢弃的自生成轨迹经离线 SFT 复用为行为经验。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。