热点事件持续更新
免标签TTRL仅调10万bias参数提升推理
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日报道,一种免标签测试时强化学习(TTRL)方法被提出:冻结预训练主干,只训练约10万个bias参数。它用多数投票生成的伪标签作为奖励信号,使Qwen2.5-7B在MATH-500上达到76.67%。报道称,其可训练参数量比全参数TTRL少7.6万倍。同一流程还改善了MathVista、AI2D等视觉与音频推理任务;学到的steering向量可迁移到4500道未见过的MATH题目上。当前信息来自该篇报道,未提及与早先报道存在数字或说法上的冲突。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 21:17
免标签TTRL冻结主干、只调约10万bias参数,Qwen2.5-7B在MATH-500达76.67%。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI Hunt免标签测试时强化学习:只调 10 万 bias 参数,Qwen2.5-7B 在 MATH-500 达 76.67%
免标签 TTRL 冻结预训练主干、只调约 10 万个 bias 参数,让 Qwen2.5-7B 在 MATH-500 达 76.67%。它以多数投票伪标签作奖励,参数量比全参数 TTRL 少 7.6 万倍。同一流程还改善 MathVista、AI2D 等视觉与音频推理,学到的 steering 向量可迁移到 4500 道未见 MATH 题。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。