跳到正文
热点事件持续更新

ReTurn 基准评测多模态历史选择性使用

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究团队提出 ReTurn 基准,含 7000 个覆盖视觉与音频证据的基础任务,评测多模态模型在多轮对话中对历史信息的选择性使用。在 13 个全模态、视觉语言和音频语言模型上,中位开放式准确率从直接输入的 93.7% 降至对话中的 72.3%。 行为探测显示,高问题回忆率可能与较弱任务应用并存,竞争媒体会将答案从历史目标引开,监督适配仅带来部分提升。

AI 根据报道生成 · 48 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    ReTurn:多模态多轮对话中历史信息的选择性使用评测

    研究团队推出 ReTurn 基准,包含 7000 个覆盖视觉与音频证据的基础任务,用于评测多模态模型在多轮对话中对历史信息的选择性使用。在 13 个全模态、视觉语言和音频语言模型上,中位开放式准确率从直接输入的 93.7% 降至对话中的 72.3%。行为探测显示高问题回忆率可能与较弱任务应用并存,竞争媒体会将答案从历史目标引开,监督适配仅带来部分提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。