热点事件持续更新
长CoT做RLHF:8B模型聊天胜GPT-4o
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 1 日,有报道称 AdithyaNLP 团队提出一条不同于数学/代码强化学习的路线:用长链式思维(长 CoT)配合奖励模型做 RLHF。该方法基于 Llama-3.1-8B-Instruct,仅使用 14K 样本,据称在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。报道还称该研究将在 COLM 2026 以海报形式展示。报道未给出训练细节、奖励模型设计与具体评测分数,也未见第三方复现。事件此前标题概括为长 CoT 做 RLHF 让 Llama-3.1-8B 聊天胜过 GPT-4o,与本条新报道口径一致,未出现数字或时间上的矛盾。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 09:08
长CoT做RLHF,仅14K样本令Llama-3.1-8B聊天超GPT-4o,该研究将登COLM 2026。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt用长 CoT 做 RLHF 替代数学 RL:Llama-3.1-8B 仅 14K 样本胜 GPT-4o
AdithyaNLP 团队用长 CoT 配合奖励模型做 RLHF 替代数学/代码 RL。基于 Llama-3.1-8B-Instruct 仅用 14K 样本,在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。该研究将在 COLM 2026 以海报形式展示。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。