arXiv cs.CV· Haiming Zhao, Tai Wang, Kun Zhang, Xicheng Peng, Zhiyang Li·· 4 小时前AI 评分34
Concept-Driven Domain Adaptation(CDDA):让视觉-语言模型检索抽象科学概念
Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack
AI 导读
研究者提出 CDDA(Concept-Driven Domain Adaptation)三阶段框架,把双塔视觉-语言模型适配到概念级视频检索。该框架先以教科书示例-概念对结构化文本嵌入空间,再在冻结视觉编码器下迁移到纪录片视觉,最后用稀疏视觉概念监督联合适配两个编码器。在中学校物理检索基准上,CDDA 优于包括 Qwen3-VL-Embedding-2B 在内的多模态基线。
来源:arXiv cs.CV · arxiv.org