AGI Hunt· niloofar_mire·· 3 小时前AI 评分38
EMNLP 口头报告:RL 训练让模型更高效遍历参数化知识
EMNLP 口头报告:RL 教模型更高效遍历参数化知识
AI 导读
一篇入选 EMNLP 口头报告的论文发现,强化学习能让模型更高效地遍历其参数化知识,从而访问到 instruction-tuned 模型中原本无法触达的知识。结论是 RL 训练不只是对齐行为,还能解锁基座中已有、但指令微调阶段无法调用的知识。作者为 @alexxxzzz6825、@niloofarmire、@RylanSchaeffer 与 Manasa Kaniselvan。
来源:AGI Hunt · agihunt.info