AGI Hunt· xiye_nlp·· 3 小时前AI 评分38
用长 CoT 做 RLHF 替代数学 RL:Llama-3.1-8B 仅 14K 样本胜 GPT-4o
用长CoT做RLHF替代数学RL:Llama-3.1-8B仅14K样本胜GPT-4o
AI 导读
AdithyaNLP 团队用长 CoT 配合奖励模型做 RLHF 替代数学/代码 RL。基于 Llama-3.1-8B-Instruct 仅用 14K 样本,在聊天与创意写作上超过 GPT-4o,在 AlpacaEval2 与 WildBench 上超过 Claude-3.7-Sonnet (thinking)。该研究将在 COLM 2026 以海报形式展示。
来源:AGI Hunt · agihunt.info