跳到正文
热点事件持续更新

MIT:固定起始token让基础模型追平RL版

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月6日,AGI Hunt 报道了 MIT 的一篇论文。该研究发现,仅通过固定起始 token 线索,基础模型的推理表现即可媲美经过强化学习(RL)训练的版本。报道给出的具体数据是:线索“. Okay”把 Olmo-3-7B 在 MATH-500 上的 pass@1 从 42% 提升到 78%;线索“Alright,”把 Qwen3-14B 从 72% 提升到 87%。报道称上述提升均由固定起始 token 线索带来。目前该事件仅见这一篇报道,尚无其他来源的独立验证或后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    MIT 论文:固定起始 token 线索让基础模型推理追平 RL 版,MATH-500 从 42% 升至 78%

    MIT 的论文发现,固定起始 token 线索即可让基础模型推理媲美 RL 训练版本,线索“. Okay”把 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%,“Alright,”把 Qwen3-14B 从 72% 提到 87%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。