热点事件持续更新
港科大提出 CorrGRPO 改进 GRPO 多奖励训练
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 2 日,AGI Hunt 报道,香港科技大学提出 CorrGRPO 方法,用于改进 GRPO 的多奖励训练。该方法将多奖励训练中的成对协方差归一化为 Pearson 相关系数,以避免大尺度奖励压制小尺度奖励的信号。报道称,在 0.5B 到 8B 参数规模的模型上,CorrGRPO 在代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。相关代码已在 GitHub 开源。目前该报道为这一方法的最新公开进展,事件仍处于早期阶段,尚无更多独立验证或后续改进的报道。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 17:17
港科大提出 CorrGRPO,将多奖励协方差归一化为 Pearson 相关系数,三个任务上超越 GRPO 并已开源。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI Hunt港科大提出 CorrGRPO:用相关系数归一化解多奖励训练失衡
港科大提出 CorrGRPO,将 GRPO 多奖励训练中的成对协方差归一化为 Pearson 相关系数,避免大尺度奖励压制小尺度奖励信号。该方法在 0.5B 到 8B 参数模型上,于代码生成、工具调用、agent 安全三个多奖励任务中均超过 GRPO 及其变体。代码已开源于 GitHub。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。