InternLM 发布 ARC-VL:视觉思考、文本推理的视觉语言协同方案
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
上海人工智能实验室 InternLM 团队开源 ARC-VL,为 CVPR 2026 论文《Think Visually, Reason Textually: Vision-Language Synergy in ARC》的官方实现。该方法在 ARC 任务中让视觉与语言协同工作,以视觉方式进行思考、以文本方式进行推理。
上海人工智能实验室 InternLM 团队发布 Spatial-SSRL,通过自监督强化学习提升模型的空间理解能力,相关论文已被 CVPR 2026 收录。该项目为官方开源发布。
FireRedTeam 提出 IVC-Prune,通过揭示 LVLM 中的隐式视觉坐标来剪枝视觉 token。该方法针对大视觉语言模型(LVLM)中视觉 token 冗余问题,利用模型内部隐含的坐标信息判断 token 重要性。
OpenAI 发布演示视频,展示如何用 Codex 的多模态能力设计、迭代并构建应用前端界面。Channing Conger 和 Romain Huet 演示了将 Codex cloud 作为前端设计伙伴,从手机创建 Codex 任务、草图构思新功能到多模态功能的不同用法。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,共 560B 参数、激活 27B,主打实时音视频交互,权重采用 MIT License 发布。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,总参数 560B、激活 27B,基于 Shortcut-connected MoE 架构,支持实时音视频交互与最长 128K token 上下文。
Sora、ImageGen 与 Codex 被放在同一条多模态流水线中,串联视频、图像与代码生成工具,指向创意生产工作流。内容聚焦这些工具之间的衔接方式,而非单一模型的独立能力。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
OpenBMB(清华 NLP)发布 DeepThinkVLA,用于增强视觉-语言-动作(VLA)模型的推理能力。该仓库已在 GitHub 上线,具体模型规模、benchmark 分数与可用方式尚未在现有信息中披露。
OpenBMB 发布 SciCore-Omics,称其为首个连接组织学图像、空间转录组学和生物语言的三模态基础模型。该模型将三类生物医学数据模态统一到同一基础模型中。
上海人工智能实验室 InternLM 项目发布 StarBench,用于探测音频 4D 智能中的深度时空推理能力,相关论文已被 ICLR 2026 接收。该工作以官方实现形式开源,聚焦音频场景下的时空推理评测。
上海人工智能实验室 InternLM 团队开源 CapRL 官方实现,通过强化学习提升模型的密集图像描述能力,论文已被 ICLR 2026 接收。
阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni
推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线。基线模型在 Playground、Stadium 等易混类别上出错,还会幻觉出不存在的类别名;微调后分类更准确。整个流程通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
上海人工智能实验室 InternLM 团队发布科学多模态基础模型 Intern-S1,定位为面向科学领域的多模态基础模型。原文未披露参数规模、benchmark 分数及开放方式等具体细节。
Mistral AI 为 Le Chat 推出一批新功能:Deep Research 预览模式可生成带引用的结构化研究报告;语音模式由新语音输入模型 Voxtral 驱动。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
小米 MiMo 推出 lmms-eval,一个面向大型多模态模型(LMM)的一键式评估模块,用于加速 LMM 开发。该工具以评估模块形式提供,具体支持的模型、基准与使用方式未在原文中说明。
Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
Mistral AI 发布 Mistral Small 3.1,改进文本性能、新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达每秒 150 tokens,并以 Apache 2.0 许可开源。
推荐理由:官方给出基准对比与部署门槛,读者可以据此评估它在小参数量开源模型中的实际位置。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
Sam Altman 发文点评 OpenAI 当日发布的 GPT-4o,强调两点:一是把世界最强模型免费开放给 ChatGPT 用户,无广告,未来靠其他付费项目支撑,希望让数十亿人用上优秀 AI 服务;二是新语音(和视频)模式是他用过最好的计算机界面,达到接近人类水平的响应时间和表达力,感觉像电影里的 AI。他提到未来将加入可选的个性化、访问用户信息和代为执行操作等能力。
推荐理由:作者作为当事方说明 GPT-4o 免费开放的初衷和新语音模式的使用感受,读者可了解 OpenAI 对这两点的官方表态。
Lilian Weng 在 Lil'Log 发布长文,系统梳理扩散模型用于视频生成的方法。文章先讲从零训练的参数化、采样与 3D U-Net、DiT 架构(如 VDM、Imagen Video、Sora),再讲如何改造预训练图像模型生成视频(Make-A-Video、Video LDM、SVD、Lumiere),最后介绍 Text2Video-Zero、ControlVideo 等免训练适配方法。
Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。
推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。
Lilian Weng 在 Lil'Log 发表关于自监督表征学习的综述,核心思想是利用数据自带的信息构造 pretext task,从而在无标注数据上以监督方式训练,目标是学到可迁移到下游任务的中间表征而非任务本身的准确率。
Lilian Weng 在 Lil'Log 发布教程文章,系统讲解自编码器家族及变分推断原理。文章覆盖 Denoising、Sparse、k-Sparse、Contractive 自编码器,推导 VAE 的 ELBO 损失与重参数化技巧,并介绍 Beta-VAE 解耦表示、VQ-VAE 与 VQ-VAE-2 的离散潜变量方法以及处理序列数据的 TD-VAE。