AGI Hunt· willcb·· 4 小时前AI 评分31
研究者 willcb:预训练靠直觉调数据,RL 后训练才是硬数学
研究者称预训练靠直觉调数据而RL是硬数学
AI 导读
AI 研究者 willcb 回顾自己四月提出的「最优教师」问题,称业内预训练的数据配方极度依赖经验直觉,而 RL 后训练是硬核数学,新出现的方法处于两者的中间态。他以「某网站采样率高只是因为感觉不错,顺便还重排了元数据」为例,说明预训练配方调优的直觉性,由此引发对大模型训练科学性的讨论。
来源:AGI Hunt · agihunt.info