跳到正文
原文
AGI Hunt· 机器之心·· 3 小时前AI 评分44

亚马逊与杜克大学研究:仅监督 1 个 token 也能有效提升大模型推理

亚马逊与杜克研究:仅监督 1 个 token 也能有效提升大模型推理

AI 导读

亚马逊与杜克大学的研究在 On-Policy Distillation 场景下,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。

来源:AGI Hunt · agihunt.info