AGI Hunt· jchoi2012·· 8 小时前AI 评分42
LoHi 框架:低分辨率稠密采样让长视频理解准确率提升 10.6 个百分点
LoHi 框架:低分辨率稠密采样让长视频理解准确率提升 10.6 个百分点
AI 导读
LoHi 用稠密低分辨率视频流搭配稀疏高分辨率帧做 VLM 长视频理解,免训练、单次前向,高分辨率帧由 I 帧元数据(LoHi-Anchor)或 query 相关性、视觉多样性(LoHi-SemDiv)选出。三个长视频基准上,同 token 预算下比原生分辨率基线平均提升 10.6 个百分点,比最强此前效率方法提升 5.2 个百分点。小时级视频前端解码延迟最高降低 7 倍。
来源:AGI Hunt · agihunt.info