跳到正文
热点事件持续更新

港科大提出 CorrGRPO 改进 GRPO 多奖励训练

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,AGI Hunt 报道,香港科技大学提出 CorrGRPO 方法,用于改进 GRPO 的多奖励训练。该方法将多奖励训练中的成对协方差归一化为 Pearson 相关系数,以避免大尺度奖励压制小尺度奖励的信号。报道称,在 0.5B 到 8B 参数规模的模型上,CorrGRPO 在代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。相关代码已在 GitHub 开源。目前该报道为这一方法的最新公开进展,事件仍处于早期阶段,尚无更多独立验证或后续改进的报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡

    港科大提出 CorrGRPO,将 GRPO 多奖励训练中的成对协方差归一化为 Pearson 相关系数,避免大尺度奖励压制小尺度奖励信号。该方法在 0.5B 到 8B 参数模型上,于代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。代码已开源于 GitHub。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。