跳到正文
热点事件持续更新

PixelUMM:无编码器统一图像视频理解与生成

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

2026年10月1日,arXiv cs.CV 刊出 PixelUMM 论文。该模型是无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解与生成:图像被表示为空间 patch,视频被表示为时空 tubelet,二者经单层线性投影接入共享多模态主干。架构上采用 Mixture-of-Transformers,结合共享注意力与任务专属参数,联合支持自回归文本预测与像素空间 flow matching。这是该事件目前公开的唯一一篇报道,暂未见后续进展或其他来源的补充与修正。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv cs.CV
    PixelUMM:无需编码器的统一图像与视频理解与生成模型

    PixelUMM 是无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解与生成。它把图像表示为空间 patch、视频表示为时空 tubelet,经单层线性投影接入共享多模态主干,Mixture-of-Transformers 架构结合共享注意力与任务专属参数,联合支持自回归文本预测与像素空间 flow matching。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。