跳到正文
原文
AGI Hunt· a_karvonen·· 2 小时前AI 评分48

研究:SFT 泛化差源于 off-policy 数据,改写专家轨迹可媲美 RL

SFT 泛化差因 off-policy 数据,改写专家轨迹可媲美 RL

AI 导读

Maxime Labonne 引用研究指出,SFT 泛化能力弱于 RL 的根源在于数据是 off-policy 的,而非 SFT 目标函数本身。把专家轨迹改写成接近基座模型的输出风格,即可达到甚至超越 on-policy 方法,且遗忘更少。akarvonen 补充称,on-policy 训练信噪比更高,只关注目标指标,不涉及语气、回复结构等无关维度,对模型扰动更小。

来源:AGI Hunt · agihunt.info