arXiv cs.CL· Mert \.Incidelen, Yamen Kashkash, Asya Berker, Murat Aydo\u{g}an·· 2 天前AI 评分38
Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层
Sorry Robot, Happy Human: Vision-Language Models Read Only One of Two Legible Typographic Layers
AI 导读
研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。
来源:arXiv cs.CL · arxiv.org