arXiv cs.CV· Weihang Guo, Xiaoyu Wu, Yifei Wang, Niloofar Mireshghallah, Lydia E. Kavraki·· 4 小时前AI 评分36
视频生成规模化能否支撑推理:代价究竟多大?
Scaling Video Generation for Reasoning: At What Cost?
AI 导读
2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。
来源:arXiv cs.CV · arxiv.org