热点事件持续更新
SemanTok:自回归视频生成的语义token方案
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv 计算机视觉板块报道了 SemanTok。报道称,SemanTok 是一种灵活的视频 tokenizer,其编码器接收冻结的 DINO 特征,并通过一个轻量 head 从每个保留的 token 前缀中单独重建这些特征,目标是为高效自回归视频生成提供可预测的语义 token。报道给出的结果是:参数量 201M 的 SemanTok AR 模型可匹敌或超越规模约为其 3.4 倍的 VideoFlexTok AR 模型,而更大的模型还能进一步提升保真度。目前公开信息仅止于该篇报道,未见后续进展或其他来源的独立验证。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
arXiv 报道 SemanTok:201M 的 AR 模型可匹敌或超越 3.4 倍规模的 VideoFlexTok。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.CVSemanTok:为高效自回归视频生成提供可预测的语义 Token
SemanTok 是一种灵活视频 tokenizer,编码器接收冻结的 DINO 特征,并用轻量 head 从每个保留的 token 前缀单独重建它们。201M 的 SemanTok AR 模型可匹敌或超越 3.4 倍规模的 VideoFlexTok AR 模型,更大模型进一步提升保真度。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。