热点事件持续更新
面向推测解码的离策略监督恢复训练框架
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
2026 年 10 月 1 日,arXiv cs.CL 刊出报道:研究者提出一个基于 rollout 的投机解码(推测解码)草稿模型训练框架,通过 Anchor-Label Relabelling(ALR)与 In-Rollout Anchors(IRA)两项机制,恢复被现有方法丢弃的 Off-Policy 监督。报道称该框架面向投机解码草稿模型的训练环节,将原本被舍弃的离策略监督重新纳入训练流程。截至目前该事件仅有这一篇报道,报道中未披露具体实验设置、所用数据集与性能数字,也无后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 12:00
研究者提出 ALR 与 IRA,恢复投机解码草稿模型训练中被现有方法丢弃的离策略监督。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv cs.CL为投机解码草稿模型恢复 Off-Policy 监督:ALR 与 IRA 框架
研究者提出基于 rollout 的投机解码草稿模型训练框架,用 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被现有方法丢弃的 Off-Policy 监督。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。