跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Sumin Hong, Katsumi Ibaraki, Renee Shi, David Chiang, Toby Jia-Jun Li·· 1 天前AI 评分38

人类与视觉语言模型的跨模态关联:选择相似,注意力不同

Similar Choices, Different Attention: Cross-Modal Associations in Humans and Vision-Language Models

AI 导读

研究用相同刺激(一个伪词加两张图片)对比了视觉语言模型与 53 名人类的选择和眼动,发现部分较大 VLM 的选择与人类一致,但其显著性图与人类注视的吻合度低于图像中心的固定高斯基线。用人类选择微调小 VLM 可让其在未见词和图像上的选择对齐达到人类多数投票参考水平,但注意力仍不及该基线;用人类注视训练模型注意力能提升注意力—注视相关性,却不改善选择对齐。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org