跳到正文
热点事件持续更新

LoHi 免训练框架提升长视频理解准确率

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,AGI Hunt 报道了一种名为 LoHi 的免训练长视频理解框架。该框架面向视觉语言模型(VLM),采用稠密低分辨率视频流搭配稀疏高分辨率帧的方式:低分辨率流保证时间覆盖,高分辨率帧则通过 I 帧元数据(LoHi-Anchor),或依据 query 相关性与视觉多样性(LoHi-SemDiv)选取。报道称 LoHi 无需训练、只需单次前向即可完成推理。在三个长视频基准上,相同 token 预算下,LoHi 比原生分辨率基线平均提升 10.6 个百分点,比此前最强的效率方法提升 5.2 个百分点;在小时级视频上,前端解码延迟最高降低 7 倍。目前该报道为首次披露,尚无其他来源对上述数字提出不同说法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    LoHi 框架:低分辨率稠密采样让长视频理解准确率提升 10.6 个百分点

    LoHi 用稠密低分辨率视频流搭配稀疏高分辨率帧做 VLM 长视频理解,免训练、单次前向,高分辨率帧由 I 帧元数据(LoHi-Anchor)或 query 相关性、视觉多样性(LoHi-SemDiv)选出。三个长视频基准上,同 token 预算下比原生分辨率基线平均提升 10.6 个百分点,比最强此前效率方法提升 5.2 个百分点。小时级视频前端解码延迟最高降低 7 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。