AGI Hunt· MIT·· 6 小时前AI 评分62
MIT 论文:固定起始 token 线索让基础模型推理追平 RL 版,MATH-500 从 42% 升至 78%
MIT:固定起始token让基础模型追平RL版,MATH-500从42%到78%
AI 导读
MIT 的论文发现,固定起始 token 线索即可让基础模型推理媲美 RL 训练版本,线索“. Okay”把 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提到 78%,“Alright,”把 Qwen3-14B 从 72% 提到 87%。
来源:AGI Hunt · agihunt.info