跳到正文
原文
arXiv cs.AI· Zhongan Bi, Kepeng Lin, Xuanang Gao, Yuhan Sun, Lianrun Zhang·· 4 小时前AI 评分38

视觉敏感性不等于声明可撤回性:多模态强化学习的持久性感知信用分配

Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning

AI 导读

持久性感知信用门控(PACG)通过削弱异常持久的视觉声明所获正向信用,使多模态模型更易撤回图像无支撑的声明。固定 rollout 反事实诊断显示,DAPO 与 VPPO 下证据函数敏感性(EFS)上升、无支撑声明却更持久,GRPO 无此退化。

来源:arXiv cs.AI · arxiv.org