跳到正文
热点事件持续更新

高通发布IVD基准:VLM实时问答远落后人类

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,高通研究团队在 arXiv 发布论文,提出 IVD(Interactive Video Dataset)基准,用于评估视觉语言模型(VLM)能否结合摄像头与麦克风输入,对正在发生的场景进行实时问答。该任务要求用户面对镜头提问、系统实时用视觉与音频作答,结果显示 VLM 在此类实时面对面问答上仍远远落后于人类,暴露多模态模型在交互式实时理解上的差距。论文称,在此类数据上进行微调可显著缩小多项感知技能上的差距,并分享了训练 VLM 的数据与技巧。同日另一篇报道对同一成果作了简要复述;早先报道称该基准全名为 Qualcomm Interactive Video Dataset(IVD),后续报道称其为 Interactive Video Dataset(IVD)。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    高通团队发布 IVD 基准:VLM 实时面对面问答仍远落后人类

    高通研究团队在 arXiv 发布论文与 Qualcomm Interactive Video Dataset(IVD)基准,评估 VLM 能否结合摄像头与麦克风输入对正在发生的场景实时问答。该任务要求用户面对镜头提问、系统实时用视觉与音频作答,现有模型表现远落后人类。论文称在此类数据上微调可显著缩小多项感知技能差距,并分享了训练 VLM 的数据与技巧。

  2. AGI Hunt
    高通发布 IVD 基准:VLM 实时场景问答远逊人类

    高通研究团队在 arXiv 发布 Interactive Video Dataset(IVD)基准,用于评估连接摄像头与麦克风的视觉语言模型能否基于实时画面与音频即时回答眼前场景问题。结果显示,VLM 在实时面对面问答任务上仍远远落后于人类,暴露多模态模型在交互式实时理解上的差距。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。