跳到正文
原文
AGI Hunt· PMinervini·· 5 小时前AI 评分43

爱丁堡大学等:自训练别只留正确答案,策略多样性采样提升 pass@k

自训练别只留正确答案:策略多样性采样提升pass@k

AI 导读

爱丁堡大学等研究者提出,自训练数据应先让模型给出多种解题思路、再按每条思路各写一份解答,而非只保留独立采样后的正确答案(RFT)。在 64 次最多解出 2 次的前沿难题上 IID 采样易模式坍缩,Qwen3-4B-Instruct 每题 4 样本时 held-out pass@64 仅 5.2,64 样本、温度 1.5 也只到 7.9。

来源:AGI Hunt · agihunt.info