跳到正文
热点事件持续更新

多模态RLVR视觉学习机制研究

1 篇报道1 个报道来源13 小时前更新

先了解这件事

AI 综述

2026年10月3日,arXiv cs.LG发表研究《相同奖励,不同技能:多模态RL何时学会“看”》。研究显示,多模态RLVR即使训练时不提供视觉信息,也能提升视觉语言基准分数:3B模型在测试时用图像可恢复约一半的真实图像增益,7B模型恢复近五分之四。研究提出“视觉可解性”设计规则,在反事实坐标场景中用标准GRPO训练7B模型,将目标发现准确率从0.425提升至0.875,且泛化到未训练过的问题类型。将测试图像替换为灰色画布后发现率降为零,说明奖励要求什么,RL就学什么。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG(机器学习,全量分类)
    相同奖励,不同技能:多模态 RL 何时学会“看”

    多模态 RLVR 即使训练时不提供视觉信息也能提升视觉语言基准分数,3B 模型在测试时用图像可恢复约一半的真实图像增益,7B 模型恢复近五分之四。研究提出“视觉可解性”设计规则,在反事实坐标场景中用标准 GRPO 训练 7B 模型,将目标发现准确率从 0.425 提升至 0.875,且泛化到未训练过的问题类型。将测试图像替换为灰色画布后发现率降为零,说明奖励要求什么,RL 就学什么。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。