AGI Hunt· burny_tech·· 2 小时前AI 评分47
RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务提升至 14-31%
RLTL;DR 论文:自生成反馈让 Pass@128=0 的任务破防至 14-31%
AI 导读
Michael Kirchhof 等人发布论文 RLTL;DR,让策略在失败后读取验证器输出并自写 TL;DR 式经验总结,以突破 RLVR 的学习瓶颈。在 Pass@128=0 的工具调用与编程数据集上,Qwen 3.5 9B Thinking 用标准 GRPO 训练 Pass@1 停留在 0-1%,RLTL;DR 训练时达 14-31%,评测不给任何 insight 也保持 12-13%。
来源:AGI Hunt · agihunt.info