跳到正文
热点事件持续更新

LinkedIn研究:小模型生成rejected样本训练更优

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,AGI Hunt 报道了 LinkedIn 的一项研究:在偏好优化训练中,用更小的冻结模型生成 rejected 样本,7B-72B 学生模型的训练效果反而优于学生模型自生成 rejected 样本,且推理算力更省。报道称,该结论在代码生成与数学推理任务上成立,在序列级蒸馏前后同样成立。研究还推导了线性化特征模型下 DPO 的有限视界效用界,并指出有效的 rejected 样本应保留任务结构、限制与参考策略的耦合。目前尚未见到其他来源的独立复现或后续进展报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    LinkedIn 研究:用更小模型生成 rejected 样本,7B-72B 学生模型训练效果反而更强

    LinkedIn 研究显示,用更小的冻结模型生成 rejected 样本,7B-72B 学生模型的训练效果反而优于自生成 rejects,推理算力更省,该结论在代码生成与数学推理、序列级蒸馏前后均成立。研究推导了线性化特征模型下 DPO 的有限视界效用界,并指出有效的 rejected 样本应保留任务结构、限制与参考策略的耦合。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。