跳到正文
热点事件持续更新

面向推测解码的离策略监督恢复训练框架

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

2026 年 10 月 1 日,arXiv cs.CL 刊出报道:研究者提出一个基于 rollout 的投机解码(推测解码)草稿模型训练框架,通过 Anchor-Label Relabelling(ALR)与 In-Rollout Anchors(IRA)两项机制,恢复被现有方法丢弃的 Off-Policy 监督。报道称该框架面向投机解码草稿模型的训练环节,将原本被舍弃的离策略监督重新纳入训练流程。截至目前该事件仅有这一篇报道,报道中未披露具体实验设置、所用数据集与性能数字,也无后续进展。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv cs.CL
    为投机解码草稿模型恢复 Off-Policy 监督:ALR 与 IRA 框架

    研究者提出基于 rollout 的投机解码草稿模型训练框架,用 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被现有方法丢弃的 Off-Policy 监督。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。