ReTurn 基准评测多模态历史选择性使用
热点事件持续更新
ReTurn 基准评测多模态历史选择性使用
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
研究团队提出 ReTurn 基准,含 7000 个覆盖视觉与音频证据的基础任务,评测多模态模型在多轮对话中对历史信息的选择性使用。在 13 个全模态、视觉语言和音频语言模型上,中位开放式准确率从直接输入的 93.7% 降至对话中的 72.3%。 行为探测显示,高问题回忆率可能与较弱任务应用并存,竞争媒体会将答案从历史目标引开,监督适配仅带来部分提升。
AI 根据报道生成 · 48 分钟前更新
最新进展10月9日 12:00
ReTurn:多模态多轮对话中历史信息的选择性使用评测报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.CLReTurn:多模态多轮对话中历史信息的选择性使用评测
研究团队推出 ReTurn 基准,包含 7000 个覆盖视觉与音频证据的基础任务,用于评测多模态模型在多轮对话中对历史信息的选择性使用。在 13 个全模态、视觉语言和音频语言模型上,中位开放式准确率从直接输入的 93.7% 降至对话中的 72.3%。行为探测显示高问题回忆率可能与较弱任务应用并存,竞争媒体会将答案从历史目标引开,监督适配仅带来部分提升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。