AGI Hunt· OLAResearchX·· 3 小时前AI 评分41
免标签测试时强化学习:只调 10 万 bias 参数,Qwen2.5-7B 在 MATH-500 达 76.67%
免标签测试时强化学习:只调10万bias参数,Qwen2.5-7B达76.67%
AI 导读
免标签 TTRL 冻结预训练主干、只调约 10 万个 bias 参数,让 Qwen2.5-7B 在 MATH-500 达 76.67%。它以多数投票伪标签作奖励,参数量比全参数 TTRL 少 7.6 万倍。同一流程还改善 MathVista、AI2D 等视觉与音频推理,学到的 steering 向量可迁移到 4500 道未见 MATH 题。
来源:AGI Hunt · agihunt.info