arXiv cs.CV· Yinying Li, Yuqian Fu, Yulin Dai, Jingyu Gong, Tianwen Qian, Xiaoling Wang·· 8 小时前AI 评分37
MEMO:面向流式视频理解的多层级实体感知记忆框架
MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding
AI 导读
MEMO 是免训练、即插即用的流式视频理解框架,以多层级实体感知的结构化记忆接入现有多模态大语言模型。它将视频切为语义片段,用轻量全局与实体级表示作检索索引,高分辨率视觉内容另存按需召回。在 StreamingBench 与 OVO-Bench 上,MEMO 持续提升多个基座模型并达到 SOTA。
来源:arXiv cs.CV · arxiv.org