AGI Hunt· arena·· 4 小时前AI 评分41
Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo
AI 导读
Arena 团队公布文生图模型后训练新方法,在约 500 万对人类偏好投票上训练奖励模型,并用视觉语言模型自动构建 rubric,将偏好与评分表组合成复合奖励。该方法应用于 FLUX.2-dev 后训练后,Arena Elo 提升 69 分。团队指出仅靠人类偏好奖励并不充分,会奖励漏细节、添加无关内容甚至 reward-hacking 的输出。
来源:AGI Hunt · agihunt.info