AGI Hunt· amazon·· 2 小时前AI 评分39
亚马逊新方法:用熵移位掩码自蒸馏训练 LLM judge,超 GRPO 2-9 个点
亚马逊新方法:用熵移位掩码自蒸馏训练 LLM 评审,超 GRPO 2-9 个点
AI 导读
亚马逊研究团队用熵移位掩码自蒸馏训练 LLM judge,对高熵移位位置做掩码、保留低尾,改善分布外泛化。该方法用师生间逐位置熵移位区分 context sharpening 与 context spreading 两种模式,所得 judge 在主观子类上比 outcome-supervised RL(如 GRPO)高 2-9 个百分点,客观任务上仍具竞争力。
来源:AGI Hunt · agihunt.info