跳到正文
原文
arXiv cs.CV· Ross Callaghan, Niannu Gao, Hojjat Azadbakht, Hui Zhang·· 4 小时前AI 评分37

医学图像对齐评估:前沿多模态模型的通用视觉推理测试

Medical Image Alignment Assessment as a Test of Generalist Visual Reasoning in Frontier Multimodal Models

AI 导读

研究用医学图像对齐任务检验前沿多模态大模型的通用视觉推理能力:GPT-6 在几乎所有测试场景下准确率超过 85%,而仅几个月前发布的模型泛化较差,部分设置下仅略高于随机。本地微调的 MLLM 在训练任务上可匹配或超越前沿模型,但迁移到未见场景效果明显更差。作者认为医学图像对齐可作为通用视觉推理的有效测试床。

来源:arXiv cs.CV · arxiv.org