跳到正文
原文
arXiv cs.AI· Ziquan Zhu, Hanruo Zhu, Si-Yuan Lu, Morris Yu-Chao Huang, Yicheng Lin, Wei Han, Tianlong Chen, Mingyuan Wu, Hanchao Yu, Gaojie Jin, Lu Liu, Bo Sun, Tianjin Huang·· 4 小时前AI 评分34

MOTIVE:面向视觉语言模型的多视角自验证与可靠性引导重思考

When to Rethink: Learning Multi-Perspective Self-Verification for Vision-Language Models

AI 导读

MOTIVE 是面向视觉语言模型的多视角自验证框架,用可靠性引导的选择性重思考决定答案该接受还是重思考。它从互补视角评估候选答案并学习与正确性对齐的可靠性分数,推理时据此直接返回可靠答案、对不确定者触发历史引导的重思考。在多模态 benchmark 与多种 VLM 主干上,MOTIVE 一致优于强自验证与自纠正基线,并减少不必要的推理轮次。

来源:arXiv cs.AI · arxiv.org