跳到正文
原文
arXiv cs.CL· Ting-Chih Chen, Emile van Krieken, Shujian Yu, Filip Ilievski·· 4 小时前AI 评分32

VisKG:面向高效视觉推理的问题特定知识图谱

Question-Specific Knowledge Graphs for Efficient Visual Reasoning

AI 导读

VisKG 是一个强化学习框架,让模型把视觉内容转换为问题特定的知识图谱(KG)表示,过滤感知噪声并保留链式推理所需的实体-关系结构。该框架用 GDPO 稳定 RL 后训练,在科学、数学和通用视觉理解基准上性能与基线相当或更优,所需 token 少于基于 caption 的表示;GDPO 训练比 GRPO 平均提升 2% 准确率。

来源:arXiv cs.CL · arxiv.org