Mistral AI 发布首个语音合成模型 Voxtral TTS
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
美团 LongCat 在 HuggingFace 发布 560B 参数开源 MoE 模型 LongCat-Flash-Prover,通过智能体工具集成推理(TIR)推进 Lean4 原生形式化推理,将任务拆解为自动形式化、sketching 和证明三项能力,并提出 HisPO 算法稳定 MoE 长程训练。
Together AI 与 CMU、普林斯顿、Cartesia AI 等机构合作推出 Mamba-3,一个以推理效率为首要目标的状态空间模型。
Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。
推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划共同开发开源前沿模型,结合 Mistral AI 的模型架构与 NVIDIA 的算力、工具和合成数据管线。
推荐理由:官方宣布双方将共同开发开源前沿模型并开放首个基础模型,读者可以据此了解开放模型生态的协作方向。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。
推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展:其推理栈已采用 NVIDIA Dynamo 1.0,并与 NVIDIA 合作推出基于 NemoClaw 和 OpenShell 运行时的智能体部署方案。
Steve Yegge 宣布推出 Wasteland,一个把数千个 Gas Town 通过信任网络连接起来的联邦化协作系统,核心是共享的 wanted board 和基于 Git fork/merge 模型的 stamp 认证协议。
QwenLM 在 GitHub 开源 WebWorld,一个大规模网页世界模型,用于在模拟浏览器环境中训练 web agent。该方式可避开真实网页带来的延迟和安全问题。原文仅提供简要介绍,更多细节见 https://github.com/QwenLM/WebWorld。
browser-use 在 GitHub 上线 mix-eval-go,一个用 Go 编写的评测编排器,用于通过浏览器自动化智能体运行 Mix Eval 任务。该仓库目前仅给出这一句功能定位,未披露支持的模型、任务规模或性能数据。
FireRedTeam 发布 FireRedASR2,一个集 ASR、VAD、LID 和标点模块于一体的工业级语音识别系统。
FireRedTeam 开源图像编辑基础模型 FireRed-Image-Edit,宣称达到开源 SOTA 水平。该模型具备精准指令跟随、高保真生成、优异的身份一致性和多元素无缝融合能力。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Edit-Turbo,是 LongCat-Image-Edit 的蒸馏版本,仅需 8 次 NFE 即可实现高质量图像编辑,推理延迟极低。
阿里云 Qwen 团队在 GitHub 开源 Qwen3-ASR 系列 ASR 模型,支持多语言语音、音乐和歌曲识别,并提供语言检测与时间戳预测功能。仓库地址:https://github.com/QwenLM/Qwen3-ASR。
美团 LongCat 发布 LongCat-Flash-Lite,一个非思考型 68.5B 参数 MoE 模型,激活参数约 3B,通过 YaRN 支持 256k 上下文,MIT 许可开源。
美团 LongCat 基于长上下文基础模型 LongCat-Flash-Thinking-2601,通过 LoZA 稀疏注意力方案推出 LongCat-Flash-Thinking-ZigZag。
阿里云通义团队开源 Qwen3-TTS 语音合成模型系列,支持稳定且富有表现力的流式语音生成、自由音色设计和逼真的声音克隆。
美团 LongCat 团队发布更新版 LongCat-Flash-Thinking-2601,总参数 560B(激活 27B)的 MoE 大推理模型,FP8 权重以 MIT 许可开源在 HuggingFace。
QwenLM 推出 Qwen-Image-Layered,通过分层分解让图像具备内在可编辑性。该模型将图像拆解为多个图层,使各元素可独立编辑,而非在单一平面上修改。
美团 LongCat 团队发布开源模型 LongCat-Video-Avatar,统一支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 和 Video Continuation 三种生成模式,兼容单流与多流音频输入,提供单人与多人角色动画生成。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
美团 LongCat 发布图像编辑模型 LongCat-Image-Edit,为 Longcat-Image 的编辑版本,支持中英双语编辑。官方称其在开源图像编辑模型中达到 SOTA,支持全局编辑、局部编辑、文本修改和参考引导编辑,能保持未编辑区域的布局、纹理、色调和主体身份一致,适合多轮编辑。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Dev,这是 LongCat-Image 的中期训练检查点,供社区做 SFT、LoRA 等二次微调。官方称该版本保留高可塑性、未受 RL 约束的参数状态,并配套提供 SFT、LoRA 微调、DPO/GRPO/MPO 对齐及 Edit 训练的全流程代码。
美团 LongCat 发布开源中英双语图像生成基础模型 LongCat-Image,仅 6B 参数,在多个基准上超越数倍于其规模的开源模型。
Sebastian Raschka 在 Ahead of AI 发表长文,解读 DeepSeek V3.2 相比 V3/R1 的主要变化。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
Mistral AI 宣布与德国企业和机构的多项长期战略承诺。与 SAP 建立多年期合作,将 Mistral 模型集成进 SAP AI Foundation,为德国和欧洲提供全主权 AI 技术栈,并共同开发面向复杂行业和行政机构的行业方案;同时与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还将大幅扩充德国本地团队,并在未来数月开设德国办公室。
美团 LongCat 团队发布 13.6B 参数的开源视频生成基础模型 LongCat-Video,统一支持文生视频、图生视频和视频续写三类任务。模型在 Video-Continuation 上预训练,可生成长达数分钟的视频而不出现色彩漂移或质量下降,并通过粗到细策略和 Block Sparse Attention 在数分钟内生成 720p、30fps 视频。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,共 560B 参数、激活 27B,主打实时音视频交互,权重采用 MIT License 发布。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,总参数 560B、激活 27B,基于 Shortcut-connected MoE 架构,支持实时音视频交互与最长 128K token 上下文。
OpenAI 发布视频介绍其最新开放模型系列 gpt-oss,支持开发者对模型进行适配、扩展和微调,并可与 GPT-5 结合使用以构建灵活的高影响力应用。视频还展示了 NVIDIA DGX Spark AI 计算机的现场演示。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
美团 LongCat 团队开源 LongCat-Audio-Codec,一套面向语音大语言模型的音频 tokenizer 与 detokenizer 方案,并行生成语义与声学 token,可在极低码率下高保真重建音频。
OpenBMB 发布 SciCore-Omics,称其为首个连接组织学图像、空间转录组学和生物语言的三模态基础模型。该模型将三类生物医学数据模态统一到同一基础模型中。
上海人工智能实验室 InternLM 项目开源了 Spark,这是论文《SPARK: Synergistic Policy And Reward Co-Evolving Framework》的官方实现,将策略与奖励的协同演化整合进同一框架。
阿里云千问团队推出 Qwen3Guard 多语言护栏模型系列。该系列模型用于内容安全审核,支持多语言场景。