AGI Hunt· 机器之心·2026-10-03 10:00· 3 小时前AI 评分44亚马逊与杜克大学研究:仅监督 1 个 token 也能有效提升大模型推理亚马逊与杜克研究:仅监督 1 个 token 也能有效提升大模型推理AI 导读亚马逊与杜克大学的研究在 On-Policy Distillation 场景下,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。来源:AGI Hunt · agihunt.info#论文/研究#推理#数据/训练查看事件全部后续