AGI Hunt· kuaishou·· 2 小时前AI 评分42
快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源
AI 导读
快手团队提出 Density-Aware Reward Aggregation(DARA),针对多奖励 RLHF 中不同目标学习进度不均的问题,代码已开源。在工具调用与数学推理任务上,DARA 比 GDPO 更快学会目标行为:工具调用格式合规最多少用 26% 训练步数,数学推理长度合规最多少用 65% 步数,最终性能持平。
来源:AGI Hunt · agihunt.info