跳到正文
原文
arXiv cs.CV· Weihang Guo, Xiaoyu Wu, Yifei Wang, Niloofar Mireshghallah, Lydia E. Kavraki·· 4 小时前AI 评分36

视频生成规模化能否支撑推理:代价究竟多大?

Scaling Video Generation for Reasoning: At What Cost?

AI 导读

2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。

来源:arXiv cs.CV · arxiv.org