跳到正文
原文
arXiv cs.CV· Zequn Yang, Yu Miao, Haotian Ni, Ziheng Chen, Chengxiang Huang, Dongzhan Zhou, Kai Chen, Qi Zhang, Ji-Rong Wen, Yake Wei, Di Hu·· 4 小时前AI 评分36

Gestalt:大型多模态交互模型

Gestalt: Large Multimodal Interplay Model

AI 导读

研究团队提出 Gestalt,一个以多模态交互为核心的大型多模态模型新范式,采用统一离散扩散框架与交互分区架构,由可学习的 interplay token 完成跨模态交换与集成。其多模态交互金字塔将建模分为模态专属处理、跨模态对齐与深层集成,在图像生成、多模态理解与纯文本评测中提升了跨模态集成并保留各模态特有信息。

来源:arXiv cs.CV · arxiv.org