跳到正文
原文
arXiv cs.CV· Donghao Zhou, Haoyang He, Fan Zhang, Hao Yang, Guisheng Liu, Xin Gao, Zhongwei Wan, Xingyuan Bu, Jie Wang, Qiangpeng Yang, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng·· 8 小时前AI 评分38

ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing

AI 导读

ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前先激活 MLLM 思考,并把对源视频与指令的思考转化为 DiT 的条件信号。它结合渐进式课程训练与推理时思考扩展,并配套 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。5B 规模的 DiT 模型在复杂与标准编辑场景均达 SOTA,大幅超越 10B 规模基线。

来源:arXiv cs.CV · arxiv.org