跳到正文
原文
arXiv cs.CV· Mikhail Dereviannykh, Vikram Voleti, Simon Donne, Mallikarjun Byrasandra Ramalinga Reddy, Shimon Vainer, Mark Boss·· 4 小时前AI 评分36

SemanTok:为高效自回归视频生成提供可预测的语义 Token

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

AI 导读

SemanTok 是一种灵活视频 tokenizer,编码器接收冻结的 DINO 特征,并用轻量 head 从每个保留的 token 前缀单独重建它们。201M 的 SemanTok AR 模型可匹敌或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型进一步提升保真度。

来源:arXiv cs.CV · arxiv.org