跳到正文
原文
arXiv cs.CV· Haiming Zhao, Tai Wang, Kun Zhang, Xicheng Peng, Zhiyang Li·· 4 小时前AI 评分34

Concept-Driven Domain Adaptation(CDDA):让视觉-语言模型检索抽象科学概念

Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack

AI 导读

研究者提出 CDDA(Concept-Driven Domain Adaptation)三阶段框架,把双塔视觉-语言模型适配到概念级视频检索。该框架先以教科书示例-概念对结构化文本嵌入空间,再在冻结视觉编码器下迁移到纪录片视觉,最后用稀疏视觉概念监督联合适配两个编码器。在中学校物理检索基准上,CDDA 优于包括 Qwen3-VL-Embedding-2B 在内的多模态基线。

来源:arXiv cs.CV · arxiv.org