热点事件持续更新
MIT:固定起始token让基础模型追平RL版
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
2026年10月6日,AGI Hunt 报道了 MIT 的一篇论文。该研究发现,仅通过固定起始 token 线索,基础模型的推理表现即可媲美经过强化学习(RL)训练的版本。报道给出的具体数据是:线索“. Okay”把 Olmo-3-7B 在 MATH-500 上的 pass@1 从 42% 提升到 78%;线索“Alright,”把 Qwen3-14B 从 72% 提升到 87%。报道称上述提升均由固定起始 token 线索带来。目前该事件仅见这一篇报道,尚无其他来源的独立验证或后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 12:17
MIT 论文称,固定起始 token 线索让 Olmo-3-7B 的 MATH-500 从 42% 升至 78%。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntMIT 论文:固定起始 token 线索让基础模型推理追平 RL 版,MATH-500 从 42% 升至 78%
MIT 的论文发现,固定起始 token 线索即可让基础模型推理媲美 RL 训练版本,线索“. Okay”把 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%,“Alright,”把 Qwen3-14B 从 72% 提到 87%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。