跳到正文
原文
arXiv cs.CL· Jungseob Lee, Chanjun Park, Sugyeong Eo, Hyeonseok Moon·· 8 小时前AI 评分40

为投机解码草稿模型恢复 Off-Policy 监督:ALR 与 IRA 框架

Recovering Off-Policy Supervision for Speculative Decoding

AI 导读

研究者提出基于 rollout 的投机解码草稿模型训练框架,用 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被现有方法丢弃的 Off-Policy 监督。

来源:arXiv cs.CL · arxiv.org