跳到正文
热点事件持续更新

腾讯提出自适应奖励路由优化音视频扩散RL训练

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,据 AGI Hunt 报道,腾讯提出 Adaptive Reward Routing(自适应奖励路由),用于 DiffusionNFT 的前向过程强化学习,动态适配奖励更新的位置与多奖励的组合方式,以应对音视频联合扩散训练中的多奖励冲突。该方法包含两个组件:一是跨模态影响力引导路由,以双向交叉注意力响应作为跨模态影响力的代理,据此对 token 级损失重加权,并缩放跨模态层的梯度;二是保偏好模态感知重加权,在热身后以分支级奖励梯度的交互做残差修正,避免强奖励压制弱目标。截至目前,报道仅介绍方法设计,未披露实验数据、评测结果或开源情况。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    腾讯提出 Adaptive Reward Routing:前向过程 RL 动态优化音视频联合扩散的多奖励冲突

    腾讯提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中动态适配奖励更新位置与多奖励组合方式。该方法含跨模态影响力引导路由与保偏好模态感知重加权两个组件:前者用双向交叉注意力响应作跨模态影响力代理,重加权 token 级损失并缩放跨模态层梯度;后者热身后以分支级奖励梯度交互做残差修正,避免强奖励压制弱目标。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。