arXiv cs.CV· Ayesh Abu Lehyeh, Jay Hwasung Jung, Safwan Wshah·· 4 小时前AI 评分37
文字能为地点保留什么:跨视角地理定位的零样本语言推理
What Words Keep of a Place: Zero-Shot Language Reasoning for Cross-View Geo-Localization
AI 导读
研究用 MLLM 把地面全景与卫星瓦片写成结构化文本,不做训练,仅靠比较描述完成跨视角地理定位。在 9,826 对 VIGOR 数据上,描述排序 Recall@1 仅 0.39%;缩到 10 个邻近瓦片后,MLLM 的结构一致性评判可达随机排序两倍。接到训练好的视觉检索器上,图像重排 Recall@1 为 23.5%,描述重排仅 10.7%。
来源:arXiv cs.CV · arxiv.org