跳到正文
原文
arXiv cs.CL· Ryan Brown, Zihao Fu, Chris Russell·· 8 小时前AI 评分42

Settle:学习何时停止推理

Settle: Learning When to Stop Reasoning

AI 导读

Settle 让推理模型从已完成轨迹的答案稳定性中学会何时停止:在 MATH-500 上用 Qwen3-4B 将 token 数减少 40%,准确率仅下降 0.5 个百分点。相同 trace 下,它比在首个稳定答案处截断的监督微调高出 6.16 个百分点,token 数几乎相同。其停止分数可预测正确答案是否保持正确。

来源:arXiv cs.CL · arxiv.org