Selective-RL:选择性迁移RL更新至VLM
热点事件持续更新
Selective-RL:选择性迁移RL更新至VLM
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Suxin Ji等研究者提出Selective-RL,将强化学习阶段产生的参数更新隔离出来,保留其主导矩阵方向与幅度,迁移到视觉语言模型(VLM)的语言模块,用于跨模型能力迁移。 在三个模型家族、五个视觉推理基准的15项对比中,该方法有12项优于完整更新插值;作者报告Qwen接收模型在MathVision上提升8.55个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益。代码已开源。 这些提升为论文所报告的结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
Selective-RL:将 RL 训练阶段更新选择性迁移至视觉推理模型报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AISelective-RL:将 RL 训练阶段更新选择性迁移至视觉推理模型
研究者提出 Selective-RL,通过隔离强化学习阶段产生的参数更新、保留其主导矩阵方向并迁移至 VLM 的语言模块,实现跨模型能力迁移。在三个模型家族、五个视觉推理基准的 15 项对比中,该方法有 12 项优于完整更新插值,其中 Qwen 接收模型在 MathVision 上提升 8.55 个百分点。对照实验显示,仅靠更新幅度或任意低秩无法复现该增益,代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。