arXiv:cs.AI(全量分类)· Zhongan Bi, Kepeng Lin, Xuanang Gao, Yuhan Sun, Lianrun Zhang·· 1 天前AI 评分39
视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配
Visual sensitivity is not claim retractability: persistence-aware credit assignment for multimodal reinforcement learning
AI 导读
针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。
来源:arXiv:cs.AI(全量分类) · arxiv.org