跳到正文
热点事件持续更新

Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,Arena 团队公布了一套面向文生图模型的后训练新方法。该方法先在约 500 万对人类偏好投票上训练奖励模型,同时用视觉语言模型自动构建 rubric(评分表),再将偏好信号与 rubric 组合成复合奖励,用于模型后训练。团队将这一方法应用于 FLUX.2-dev,后训练后其 Arena Elo 提升 69 分。团队同时指出,仅依赖人类偏好奖励并不充分:这类奖励会奖励那些漏掉细节、添加无关内容、甚至属于 reward-hacking 的输出。因此他们选择把偏好与明确的评分表结合起来,以约束奖励信号的偏差。目前公布的进展即为该方法及其在 FLUX.2-dev 上的 Elo 提升结果。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo

    Arena 团队公布文生图模型后训练新方法,在约 500 万对人类偏好投票上训练奖励模型,并用视觉语言模型自动构建 rubric,将偏好与评分表组合成复合奖励。该方法应用于 FLUX.2-dev 后训练后,Arena Elo 提升 69 分。团队指出仅靠人类偏好奖励并不充分,会奖励漏细节、添加无关内容甚至 reward-hacking 的输出。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。