跳到正文
原文
arXiv:cs.AI(全量分类)· Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang, Hejia Geng, Guancheng Wan, Bowen Zuo, Xiaomin Li, Shixiang Tang, Xinyu Xiang, Zehong Wang, Shiyi Du, Peng Xia, Shuangjia Zheng, Yining Hong, Li Erran Li, Jure Leskovec, Yejin Choi·· 3 小时前AI 评分38

UniEvo-VL:面向多模态模型自我改进的在线自蒸馏训练方案

UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement

AI 导读

UniEvo-VL 是一种让多模态模型在测试时计算中从自身批判反馈里自我进化的训练方案,由同一模型分别扮演教师和学生,通过最小化两者去噪扩散分布的分歧来训练。基于开源 Qwen-image-2512,其 GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。

来源:arXiv:cs.AI(全量分类) · arxiv.org