跳到正文
原文
arXiv cs.CL· Mert \.Incidelen, Yamen Kashkash, Asya Berker, Murat Aydo\u{g}an·· 2 天前AI 评分38

Sorry Robot, Happy Human:视觉语言模型只读出两层可辨识排印文字中的一层

Sorry Robot, Happy Human: Vision-Language Models Read Only One of Two Legible Typographic Layers

AI 导读

研究用 Decoy Font 方法构建包含 300 张图像的 DecoyBench,测试 3 个模型家族共 6 个闭源视觉语言模型,发现它们只能读出双层文字中的一层。高分辨率下模型对锐利轮廓文字准确率接近人类,却几乎无法完整提取柔和阴影文字;低分辨率下轮廓文字人类与模型均读不出,阴影文字反而能高准确率提取。

来源:arXiv cs.CL · arxiv.org