跳到正文
原文
AGI Hunt· burny_tech·· 1 天前AI 评分40

Hill Sampling:让冻结 LLM 沿最优解爬坡,胜过重复采样与进化训练

AI 导读

Hill Sampling 是 test-time scaling 的更简替代方案:把冻结的 LLM 条件化在其当前找到的最优程序上,用提示词条件化的爬山循环迭代改进。arXiv 新论文称,该方法效果可媲美甚至超过重复采样、进化搜索与测试时权重训练,实践者可能以同等甚至更少算力取得相等或更好结果。

来源:AGI Hunt · agihunt.info