跳到正文
原文
AGI Hunt· tencent·· 3 小时前AI 评分37

腾讯提出 Adaptive Reward Routing:前向过程 RL 动态优化音视频联合扩散的多奖励冲突

腾讯自适应奖励路由:前向过程 RL 动态优化音视频联合扩散的多奖励冲突

AI 导读

腾讯提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中动态适配奖励更新位置与多奖励组合方式。该方法含跨模态影响力引导路由与保偏好模态感知重加权两个组件:前者用双向交叉注意力响应作跨模态影响力代理,重加权 token 级损失并缩放跨模态层梯度;后者热身后以分支级奖励梯度交互做残差修正,避免强奖励压制弱目标。

来源:AGI Hunt · agihunt.info