跳到正文
原文
AGI Hunt· rishit_dagli·· 3 小时前AI 评分44

高通团队发布 IVD 基准:VLM 实时面对面问答仍远落后人类

AI 导读

高通研究团队在 arXiv 发布论文与 Qualcomm Interactive Video Dataset(IVD)基准,评估 VLM 能否结合摄像头与麦克风输入对正在发生的场景实时问答。该任务要求用户面对镜头提问、系统实时用视觉与音频作答,现有模型表现远落后人类。论文称在此类数据上微调可显著缩小多项感知技能差距,并分享了训练 VLM 的数据与技巧。

来源:AGI Hunt · agihunt.info