跳到正文
原文
AGI Hunt· valeocorg·· 4 小时前AI 评分32

Where-OPD:用合成场景做空间引导自蒸馏,多模态感知提升 3.23 分

Where-OPD:用合成场景做空间引导自蒸馏,多模态感知提升 3.23 分

AI 导读

Where-OPD 提出面向多模态大模型(MLLM)的在线自蒸馏新方法:教师模型用文本形式的空间引导定位相关视觉区域,学生仅凭图像和问题复现该行为。后训练只用程序化生成的合成场景,自带物体身份与空间坐标,无需人工标注。在 CVBench、BLINK、HR-Bench、MME-RealWorld 等六个基准上平均提升 3.23 分。

来源:AGI Hunt · agihunt.info