跳到正文
原文
AGI Hunt· xiye_nlp·· 3 小时前AI 评分38

用长 CoT 做 RLHF 替代数学 RL:Llama-3.1-8B 仅 14K 样本胜 GPT-4o

用长CoT做RLHF替代数学RL:Llama-3.1-8B仅14K样本胜GPT-4o

AI 导读

AdithyaNLP 团队用长 CoT 配合奖励模型做 RLHF 替代数学/代码 RL。基于 Llama-3.1-8B-Instruct 仅用 14K 样本,在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。该研究将在 COLM 2026 以海报形式展示。

来源:AGI Hunt · agihunt.info