跳到正文
原文
arXiv cs.CV· Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taix\'e, Sanja Fidler, Wenhu Chen, Zian Wang, Jay Zhangjie Wu·· 8 小时前AI 评分45

PixelUMM:无需编码器的统一图像与视频理解与生成模型

PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation

AI 导读

PixelUMM 是无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解与生成。它把图像表示为空间 patch、视频表示为时空 tubelet,经单层线性投影接入共享多模态主干,Mixture-of-Transformers 架构结合共享注意力与任务专属参数,联合支持自回归文本预测与像素空间 flow matching。

来源:arXiv cs.CV · arxiv.org