跳到正文
原文
arXiv cs.CL· Ilgee Hong, Changlong Yu, Zhenghao Xu, Xin Liu, Yuwei Zhang, Qin Lu, Bing Yin, Tuo Zhao·· 18 小时前AI 评分39

通过位置选择性自蒸馏从语言反馈训练 LLM 评判模型

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

AI 导读

研究提出位置选择性自蒸馏,用自然语言反馈训练 LLM 评判模型,依据教师与学生的逐位置熵差对高熵差位置做掩码,从而提升分布外泛化。所得评判模型在评测的主观子类上比 GRPO 等结果监督强化学习训练的评判模型高 2-9 个百分点,客观子类上保持相当水平。

来源:arXiv cs.CL · arxiv.org