arXiv cs.CL· Sumin Hong, Katsumi Ibaraki, Renee Shi, David Chiang, Toby Jia-Jun Li·· 4 小时前AI 评分37
人类与视觉语言模型(VLM)的跨模态关联:选择相似,注意力不同
Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models
AI 导读
研究用相同刺激对比人类与 VLM 的跨模态关联,部分较大 VLM 选择与人类一致,但显著性与人类注视的吻合度低于 center-bias 基线。用人类选择微调小型 VLM,可让其对未见词和图像的选择对齐达到人类多数投票参考水平,注意力仍不如该基线贴近人类注视。用人类注视训练注意力只提升注意力-注视相关性,不改善选择对齐。
来源:arXiv cs.CL · arxiv.org