arXiv cs.CL· Jungseob Lee, Chanjun Park, Sugyeong Eo, Hyeonseok Moon·· 8 小时前AI 评分40
为投机解码草稿模型恢复 Off-Policy 监督:ALR 与 IRA 框架
Recovering Off-Policy Supervision for Speculative Decoding
AI 导读
研究者提出基于 rollout 的投机解码草稿模型训练框架,用 Anchor-Label Relabelling(ALR)和 In-Rollout Anchors(IRA)恢复被现有方法丢弃的 Off-Policy 监督。
来源:arXiv cs.CL · arxiv.org