跳到正文
热点事件持续更新

长CoT做RLHF:8B模型聊天胜GPT-4o

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 1 日,有报道称 AdithyaNLP 团队提出一条不同于数学/代码强化学习的路线:用长链式思维(长 CoT)配合奖励模型做 RLHF。该方法基于 Llama-3.1-8B-Instruct,仅使用 14K 样本,据称在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。报道还称该研究将在 COLM 2026 以海报形式展示。报道未给出训练细节、奖励模型设计与具体评测分数,也未见第三方复现。事件此前标题概括为长 CoT 做 RLHF 让 Llama-3.1-8B 聊天胜过 GPT-4o,与本条新报道口径一致,未出现数字或时间上的矛盾。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    用长 CoT 做 RLHF 替代数学 RL:Llama-3.1-8B 仅 14K 样本胜 GPT-4o

    AdithyaNLP 团队用长 CoT 配合奖励模型做 RLHF 替代数学/代码 RL。基于 Llama-3.1-8B-Instruct 仅用 14K 样本,在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。该研究将在 COLM 2026 以海报形式展示。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。