跳到正文
原文
AGI Hunt· LinkedIn·· 3 小时前AI 评分43

LinkedIn 研究:用更小模型生成 rejected 样本,7B-72B 学生模型训练效果反而更强

研究:用更小模型生成 rejected 样本,7B-72B 学生模型训练效果反而更强

AI 导读

LinkedIn 研究显示,用更小的冻结模型生成 rejected 样本,7B-72B 学生模型的训练效果反而优于自生成 rejects,推理算力更省,该结论在代码生成与数学推理、序列级蒸馏前后均成立。研究推导了线性化特征模型下 DPO 的有限视界效用界,并指出有效的 rejected 样本应保留任务结构、限制与参考策略的耦合。

来源:AGI Hunt · agihunt.info