热点事件持续更新
亚马逊与杜克:仅监督1个token也能提升推理
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
亚马逊与杜克大学合作的一项研究显示,提升大模型推理能力或许并不需要密集的监督信号。在 On-Policy Distillation 场景下,研究对每条长达数千 token 的 rollout 只随机保留 1 个 token 的梯度信号,监督比例约为 0.025%。即便如此稀疏的监督,学生模型的推理能力仍获得显著提升。2026年10月3日的后续报道给出了该实验的具体做法:按 rollout 随机抽取单个 token 计算梯度,而不再对整条轨迹做全量监督。报道中未披露所用模型、评测基准以及具体提升幅度等细节,也未说明该结论在不同任务规模下的适用范围。
AI 根据报道生成 · 2 小时前更新
最新进展10月3日 10:00
新报道补充细节:每条 rollout 仅随机保留1个token梯度,占比约0.025%。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI Hunt亚马逊与杜克大学研究:仅监督 1 个 token 也能有效提升大模型推理
亚马逊与杜克大学的研究在 On-Policy Distillation 场景下,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。