跳到正文
热点事件持续更新

研究:问题违反Grice准则时VLM的VQA准确率下降

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一项由 Monika Shah 等作者提交的研究,用违反 Grice 合作准则的问题测试视觉语言模型(VLM)的视觉问答(VQA)表现,发现 ChatGPT、Claude、Gemini 和 Llava 在问题含冗余、歧义或虚假信息时准确率下降。 研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的表现差异:人类处理 VLM 诱导违规时认知投入更低,但 VLM 自身在这类情况下准确率更差。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.CL
    用合作原则评估视觉语言模型的 VQA 表现

    一项研究用 Grice 准则被违反的问题测试视觉语言模型(VLM)的 VQA 表现,发现 ChatGPT、Claude、Gemini 和 Llava 在问题含冗余、歧义或虚假信息时准确率下降。研究还对比了人类与 VLM 的语用推理差异,以及 VLM 处理人类诱导与 AI 生成违规时的表现差异。人类处理 VLM 诱导违规的认知投入更低,但 VLM 自身在这类情况下准确率更差。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。