跳到正文
原文
AGI Hunt· UTEXAS·· 3 小时前AI 评分42

UT Austin 团队提出 MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步

MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步

AI 导读

UT Austin 团队提出基于近端速度匹配的流模型奖励后训练方法 MEND,仅 100 步更新便在 6 个评估器中的 5 个上超越需约 4000 步的 Flow-GRPO。

来源:AGI Hunt · agihunt.info