跳到正文
热点事件持续更新

亚马逊与杜克:仅监督1个token也能提升推理

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

亚马逊与杜克大学合作的一项研究显示,提升大模型推理能力或许并不需要密集的监督信号。在 On-Policy Distillation 场景下,研究对每条长达数千 token 的 rollout 只随机保留 1 个 token 的梯度信号,监督比例约为 0.025%。即便如此稀疏的监督,学生模型的推理能力仍获得显著提升。2026年10月3日的后续报道给出了该实验的具体做法:按 rollout 随机抽取单个 token 计算梯度,而不再对整条轨迹做全量监督。报道中未披露所用模型、评测基准以及具体提升幅度等细节,也未说明该结论在不同任务规模下的适用范围。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    亚马逊与杜克大学研究:仅监督 1 个 token 也能有效提升大模型推理

    亚马逊与杜克大学的研究在 On-Policy Distillation 场景下,对每条数千 token 的 rollout 仅随机保留 1 个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。