arXiv cs.CV· Peng Xie, Amr Alanwar·· 4 小时前AI 评分45
追踪不等于持续性:V-JEPA 2 等视频世界模型对隐藏目标保留了什么
Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object
AI 导读
冻结的 V-JEPA 2 预测器对隐藏目标保留有限:静止目标仅部分保留,容器内被带走的目标完全丢失,运动目标 0.3 秒内丢失。编码器能以 1.00 读出目标存在、容器内容可解码 3.5 秒,但预测器输出在盒子关闭半秒后仅 2% 场景含球。3000 步预测器训练即可把该信念从 0.05 提到 1.00,IntPhys-2019 从 84.2% 升到 93.3%。
来源:arXiv cs.CV · arxiv.org