AGI Hunt· rishit_dagli·· 3 小时前AI 评分39
高通发布 IVD 基准:VLM 实时场景问答远逊人类
高通发布 IVD 基准,VLM 实时场景问答远逊人类
AI 导读
高通研究团队在 arXiv 发布 Interactive Video Dataset(IVD)基准,用于评估连接摄像头与麦克风的视觉语言模型能否基于实时画面与音频即时回答眼前场景问题。结果显示,VLM 在实时面对面问答任务上仍远远落后于人类,暴露多模态模型在交互式实时理解上的差距。
来源:AGI Hunt · agihunt.info