arXiv:cs.CL· Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Shuo Cai, Yang Yu, Yuanyi Wang, Yanggan Gu, Congkai Xie, Jianmin Wu, Hongxia Yang·· 4 小时前AI 评分39
InfiMed2:基于情境证据与稳定性感知监督的通用医学多模态基础模型
InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision
AI 导读
InfiMed2 是一系列 4B 和 27B 的通用医学多模态基础模型,基于阶段感知的数据设计,构建了 55.68B token 语料。其 CPT 流程依次适配视觉编码器、构建医学知识、在学习率衰减阶段转向证据聚焦数据混合;SFT 用答案稳定性、答案掩码重建和正确性约束筛选重新生成 VQA 回复。
正文
Authors:Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Shuo Cai, Yang Yu, Yuanyi Wang, Yanggan Gu, Congkai Xie, Jianmin Wu, Hongxia Yang
Abstract:Recent medical multimodal models have benefited from larger corpora, broader modality coverage, and stronger reasoning-oriented training, yet effective data design across continued pretraining (CPT) and post-training remains challenging. Medical sources vary substantially in structure, granularity, and information density, and their utility shifts as training progresses from broad knowledge acquisition to late-stage consolidation. Meanwhile, post-training is often dominated by short-form visual question answering, providing limited supervision for informative and answer-consistent explanations. We introduce InfiMed2, a family of 4B and 27B generalist medical multimodal foundation models built around stage-aware data design. We curate a 55.68B-token corpus that combines broad clinical knowledge with context-rich biomedical visual evidence through source-specific processing. Our CPT pipeline first adapts the vision encoder, then builds broad medical knowledge, and finally transitions to an evidence-focused data mixture during learning-rate decay. For supervised fine-tuning (SFT), we regenerate visual question-answering responses using answer stability, answer-masked reconstruction, and correctness-constrained selection to produce more informative and answer-consistent supervision. The 4B model is further optimized with reinforcement learning with verifiable rewards (RLVR). Across five medical multimodal benchmarks, InfiMed2-4B achieves 66.73% mean accuracy after RLVR, surpassing the larger Qwen3.5-9B, while InfiMed2-27B reaches 73.72%, the highest among the evaluated open-weight models.
| Subjects: | Computation and Language (cs.CL); Computer Vision and Pattern Recognition (cs.CV) |
| Cite as: | arXiv:2609.34798 [cs.CL] |
| (or arXiv:2609.34798v2 [cs.CL] for this version) | |
| https://doi.org/10.48550/arXiv.2609.34798 arXiv-issued DOI via DataCite |
Submission history
From: Guanghao Zhu [view email]
[v1]
Mon, 28 Sep 2026 10:01:35 UTC (1,334 KB)
[v2]
Wed, 7 Oct 2026 03:24:07 UTC (1,334 KB)
来源:arXiv:cs.CL · arxiv.org