arXiv cs.AI· Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang, Wei Chu·· 8 小时前AI 评分33
GAD-RL:用门控与衰减的在线策略蒸馏提升 OCR 忠实度
Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
AI 导读
GAD-RL 在联合后训练中按学生当前任务表现与局部分布动态调节教师监督:任务奖励至少 0.95 的响应组直接关闭蒸馏,组均奖励升高时持续衰减蒸馏强度,并用学生给出教师 Top-1 token 的概率加权 forward KL,从而提升视觉语言模型的 OCR 转录忠实度。
来源:arXiv cs.AI · arxiv.org