UniEvo-VL:面向多模态模型自我改进的在线自蒸馏训练方案
UniEvo-VL 提出一种让多模态模型自我进化的在线自蒸馏训练方案,由同一模型分别以学生和教师身份、在不同上下文下充当师生,无需依赖独立的大型教师模型。基于开源 Qwen-image-2512,其 GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
UniEvo-VL 提出一种让多模态模型自我进化的在线自蒸馏训练方案,由同一模型分别以学生和教师身份、在不同上下文下充当师生,无需依赖独立的大型教师模型。基于开源 Qwen-image-2512,其 GenEval 分数从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。
Sakana AI 提出 Percept-Lens,通过冻结通用视觉模型并拟合简单高斯决策规则来检测 AI 生成图像,在 ECCV2026 论文中该方法在广泛评测套件上超越了所测试的最强已发布 AI 生成图像检测器。研究还表明,检测器在生成器、提示词、风格或图像域变化时性能会急剧下降,而进步也可来自更好利用通用视觉模型中已有的真实与生成结构。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
研究团队提出 OmniTaskonomy 统一分类体系,覆盖 19 项图生图(I2I)生成任务与 25 项图生文(I2T)理解能力,系统探究视觉生成监督何时以及如何提升视觉理解。
研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。
研究提出用去噪器 Jacobian 的谱特性来刻画扩散、流匹配等生成式去噪模型之间的差异,发现生成性能更好的模型对应更大的 Jacobian 特征值。作者据此设计了一种正则化方案,通过在扰动输入上训练去噪器来抑制或放大 Jacobian 响应,并在 ImageNet 上验证:同时强化数据相关主特征方向、抑制噪声无关方向能改善生成效果。
Black Forest Labs 发布多项生成式 AI 与视觉智能研究,包括面向图像、视频和音频生成的模态无关自监督流匹配框架,以及对比 SD-VAE、RAE、FLUX.1 和 FLUX.2 等扩散模型自编码器表示的研究。此外还介绍了 FLUX.1 Kontext,一个在潜空间中进行上下文图像生成与编辑的统一模型,实现了快速且业界领先的效果。
MaLiang-Harness 是一个将 MLLM 驱动的视觉生成组织为持续构建、检查与修订过程的统一框架,用于弥合程序可执行但违反构图、外观或运动要求的 Program-to-Visual(P2V)差距。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
一项基于 AFRL GOTCHA 数据集的可行性研究显示,28,656 参数的卷积自编码器在 SAR 相位历史压缩上全面落后于 BAQ:16 b/cs 时 NMSE 为 -2.87 dB,而 8-bit BAQ 配合 ±3σ 裁剪为 -35.5 dB、调优裁剪范围为 -41.0 dB,也逊于 16×16 块 KLT 的 -5.39 dB,检测 F1 上限仅 33%。
MIT CSAIL 团队在 Nature Communications 发表论文,提出“归因衰减”现象:训练数据越大,单个样本对生成结果的影响越小,删除任一图像甚至某艺术家的全部图像后输出不变。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的 score function 被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本。
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
上海人工智能实验室 InternLM 团队发布 EndoCoT 官方实现,用于在扩散模型中扩展内生链式推理(CoT),面向复杂结构化生成任务。该工作已被 ECCV 2026 收录,代码随论文一并开源。
FireRedTeam 开源了论文《InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention》的官方实现,该论文已被 NeurIPS 2025 收录。方法通过实例组装注意力机制实现布局感知的图像生成。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
FireRedTeam 提出 CQ-DINO,通过类别查询缓解广词表目标检测中的梯度稀释问题。该方法针对词表规模庞大时检测性能下降的痛点,用类别查询机制改善梯度传播。
FireRedTeam 开源 Target-Driven-Distillation 项目,用目标时间步选择与解耦引导改进一致性蒸馏。该方法面向扩散模型蒸馏场景,通过挑选目标时间步并解耦引导信号来提升生成一致性。项目已公开,具体效果与评测数据未在原文中给出。