跳到正文
原文
AGI Hunt· MIT·· 6 小时前AI 评分62

MIT 论文:固定起始 token 线索让基础模型推理追平 RL 版,MATH-500 从 42% 升至 78%

MIT:固定起始token让基础模型追平RL版,MATH-500从42%到78%

AI 导读

MIT 的论文发现,固定起始 token 线索即可让基础模型推理媲美 RL 训练版本,线索“. Okay”把 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%,“Alright,”把 Qwen3-14B 从 72% 提到 87%。

来源:AGI Hunt · agihunt.info