跳到正文
热点事件持续更新

Selective-RL:选择性迁移RL更新至VLM

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Suxin Ji等研究者提出Selective-RL,将强化学习阶段产生的参数更新隔离出来,保留其主导矩阵方向与幅度,迁移到视觉语言模型(VLM)的语言模块,用于跨模型能力迁移。 在三个模型家族、五个视觉推理基准的15项对比中,该方法有12项优于完整更新插值;作者报告Qwen接收模型在MathVision上提升8.55个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。代码已开源。 这些提升为论文所报告的结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    Selective-RL:将 RL 训练阶段更新选择性迁移至视觉推理模型

    研究者提出 Selective-RL,通过隔离强化学习阶段产生的参数更新、保留其主导矩阵方向并迁移至 VLM 的语言模块,实现跨模型能力迁移。在三个模型家族、五个视觉推理基准的 15 项对比中,该方法有 12 项优于完整更新插值,其中 Qwen 接收模型在 MathVision 上提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益,代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。