跳到正文
原文
arXiv cs.CV· Ziying Zhang, Litao Li, Junchao Liao, Tianyi Zeng, Siyu Zhu, Long Qin, Zhenghao Zhang·· 4 小时前AI 评分43

VidScribe:统一视频生成中视觉文本渲染与原位编辑的基准评测

Beyond Legibility: Benchmarking Visual Text Rendering and In-Place Editing in Unified Video Generation

AI 导读

VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。

来源:arXiv cs.CV · arxiv.org