跳到正文
热点事件持续更新

RLTL;DR 用自生成反馈突破 RLVR 瓶颈

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 1 日,据 AGI Hunt 报道,Michael Kirchhof 等人发布论文 RLTL;DR,提出让策略在失败后读取验证器输出,并自行撰写 TL;DR 式经验总结,以此突破 RLVR 的学习瓶颈。报道称,在被记为 Pass@128=0 的工具调用与编程数据集上,Qwen 3.5 9B Thinking 使用标准 GRPO 训练时 Pass@1 停留在 0-1%;改用 RLTL;DR 训练后达到 14-31%,且在评测阶段不提供任何 insight 的情况下仍保持 12-13%。截至目前,该事件仅有这一篇报道,尚未出现与上述数字或说法不一致的后续报道。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务提升至 14-31%

    Michael Kirchhof 等人发布论文 RLTL;DR,让策略在失败后读取验证器输出并自写 TL;DR 式经验总结,以突破 RLVR 的学习瓶颈。在 Pass@128=0 的工具调用与编程数据集上,Qwen 3.5 9B Thinking 用标准 GRPO 训练 Pass@1 停留在 0-1%,RLTL;DR 训练时达 14-31%,评测不给任何 insight 也保持 12-13%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。