跳到正文
原文
AGI Hunt· HKUST·· 3 小时前AI 评分41

港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡

港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡

AI 导读

港科大提出 CorrGRPO,将 GRPO 多奖励训练中的成对协方差归一化为 Pearson 相关系数,避免大尺度奖励压制小尺度奖励信号。该方法在 0.5B 到 8B 参数模型上,于代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。代码已开源于 GitHub。

来源:AGI Hunt · agihunt.info