热点事件持续更新
OLIVE:在线蒸馏方法提升推理与Agent任务表现
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
OLIVE 是一种在线语言模型蒸馏方法,其做法是每轮由学生模型生成前缀,再由教师模型对该前缀自回归续写,学生用教师生成 token 的交叉熵进行更新。据 2026 年 9 月 30 日 arXiv cs.CL 的报道,在可比的 GPU 小时成本下,OLIVE 的推理性能高于 OPD(一种 top-16 KL 近似方法);其异步实现进一步减少了 23.8% 的训练时间。论文还称,仅使用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练,效果比同教师的离线 SFT 高出 13%。目前该工作以论文形式发布,报道未给出第三方复现或其他基准上的评测结果。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CLOLIVE:在学生的状态上向教师续写学习
OLIVE 是一种在线语言模型蒸馏方法,每轮由学生生成前缀、教师自回归续写,学生用教师生成 token 的交叉熵更新。在可比 GPU 小时成本下,其推理性能高于 OPD(top-16 KL 近似),异步实现进一步减少 23.8% 训练时间。仅用 GPT-5.4-mini 的文本,在 ScienceWorld 上持续训练比同教师离线 SFT 高 13%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。