NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
The DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。
In Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2
Google DeepMind 发布 Gemini 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成高质量视频,并支持通过自然语言多轮编辑视频、保持角色和场景一致。
推荐理由:原文介绍了 Gemini Omni Flash 的多模态输入、对话式视频编辑能力和开放范围,读者可以判断它对视频创作流程的影响。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。
Thinking Machines Lab 宣布 interaction models 研究预览,让模型原生处理实时音频、视频和文本交互,而非依赖外部 harness。
推荐理由:原文由当事团队给出架构设计、能力演示和基准数字,读者可以据此了解交互能力如何内置于模型本身。
上海人工智能实验室 InternLM 项目发布 ETCHR,一个以问题为条件、具备推理感知能力的图像编辑器,定位为多模态大语言模型(MLLM)的解耦式视觉推理助手。该工具通过解耦设计为 MLLM 提供独立的视觉推理支持。
Together AI 宣布 DeepSeek-V4 Pro 上线,提供 Serverless Inference(512K 上下文)与 Dedicated 部署(完整 1M 上下文、预留容量)。
推荐理由:原文给出部署形态、定价与基准数字,读者可以据此评估在 512K 上下文上运行 DeepSeek-V4 Pro 的实际成本与路径。
NVIDIA Nemotron 3 Nano Omni 现已在 Together AI 平台可用,Together AI 提供首日(Day 0)接入与 Dedicated Inference 部署。
小米发布 MiMo-V2.5-ASR,一款面向多语言、方言及复杂声学场景的鲁棒语音识别模型。该模型主打在跨语言、方言和嘈杂环境下的稳定识别表现,具体参数与评测数据尚未在仓库说明中披露。
小米为 MiMo 系列模型推出 MiMo-Skills,一个面向该系列的智能体技能(Agent skills)仓库。目前公开信息仅说明其用途是服务 Xiaomi MiMo 系列,未披露技能数量、支持版本或调用方式等细节。
蚂蚁 inclusionAI 在 GitHub 新建仓库 LLaDA2.0-Uni,定位为"理解与生成世界"。该仓库目前仅公布名称与这一句定位描述,未披露参数规模、上下文长度、benchmark 分数或开源许可等具体信息。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 提升了空间与物理推理能力,包括指向、计数、成功检测和多视角理解。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。
推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。
推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
Google 发布 Gemini 3.1 Flash-Lite,定位最快最高效、面向高负载工作负载的模型,官方称在推理、可靠性和可扩展性上超过 2.5 Flash 且成本更低。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
Anthropic 官方发布视频,介绍 Claude Opus 4.6。
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
Mistral 发布 Mistral OCR 3,整体在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 达到 74% 胜率。
小米发布 MiMo-V2-Flash 基础模型,主打高效推理、编码与智能体能力。该模型以 MiMo-V2-Flash 为名在 GitHub 新仓库开源,具体参数规模、benchmark 分数与上下文长度尚未在现有信息中披露。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米 MiMo 团队发布 MiMo-Audio-Tokenizer,一个统一音频分词器,可同时提取语义信息并实现高保真音频重建。该模型已在 GitHub 开源。
上海人工智能实验室 InternLM 团队发布科学多模态基础模型 Intern-S1,定位为面向科学领域的多模态基础模型。原文未披露参数规模、benchmark 分数及开放方式等具体细节。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
小米 MiMo 推出 lmms-eval,一个面向大型多模态模型(LMM)的一键式评估模块,用于加速 LMM 开发。该工具以评估模块形式提供,具体支持的模型、基准与使用方式未在原文中说明。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。