跳到正文
原文
arXiv cs.CV· Peng Xie, Amr Alanwar·· 4 小时前AI 评分45

追踪不等于持续性:V-JEPA 2 等视频世界模型对隐藏目标保留了什么

Tracking Is Not Permanence: What Video World Models Keep of a Hidden Object

AI 导读

冻结的 V-JEPA 2 预测器对隐藏目标保留有限:静止目标仅部分保留,容器内被带走的目标完全丢失,运动目标 0.3 秒内丢失。编码器能以 1.00 读出目标存在、容器内容可解码 3.5 秒,但预测器输出在盒子关闭半秒后仅 2% 场景含球。3000 步预测器训练即可把该信念从 0.05 提到 1.00,IntPhys-2019 从 84.2% 升到 93.3%。

来源:arXiv cs.CV · arxiv.org