跳到正文
原文
arXiv cs.AI· Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang, Wei Chu·· 8 小时前AI 评分33

GAD-RL:用门控与衰减的在线策略蒸馏提升 OCR 忠实度

Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation

AI 导读

GAD-RL 在联合后训练中按学生当前任务表现与局部分布动态调节教师监督:任务奖励至少 0.95 的响应组直接关闭蒸馏,组均奖励升高时持续衰减蒸馏强度,并用学生给出教师 Top-1 token 的概率加权 forward KL,从而提升视觉语言模型的 OCR 转录忠实度。

来源:arXiv cs.AI · arxiv.org