Google DeepMind 发布 Gemini 3.1 Flash TTS,新增 audio tags 精细语音控制
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 提升了空间与物理推理能力,包括指向、计数、成功检测和多视角理解。
阿里巴巴在 GitHub 上线 verl-recipe 仓库,提供一组基于 verl 的端到端强化学习训练示例。该仓库为 fork 版本,用于贡献代码,所有改动计划以 PR 形式提交至上游。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
蚂蚁 inclusionAI 在 GitHub 开源 cuLA,提供多种线性注意力变体的 CUDA 内核,使用 CuTe DSL 与 CUTLASS C++ 编写。该仓库目前仅披露技术栈,未公布支持的模型、性能数据或开源许可等细节。
Together AI 开源 Aurora,一个基于 RL 的推测解码框架,可从实时推理轨迹中持续学习并异步更新 draft 模型,在 Qwen3 和 Llama3 等模型上比静态 speculator 额外提速 1.25 倍。
美团 LongCat 发布基于扩散模型的非自回归 TTS 模型 LongCat-AudioDiT,直接在波形潜空间运行,只需 Wav-VAE 加扩散骨干。
美团 LongCat 发布 LongCat-AudioDiT,一个直接在波形潜空间工作的非自回归扩散 TTS 模型,模型权重和代码以 MIT License 开源。
美团 LongCat 团队开源原生多模态模型 LongCat-Next,基于 LongCat-Flash-Lite MoE(A3B),在单一自回归框架内统一文本、视觉和音频处理,采用 DiNA 离散原生自回归范式,结合 SAE 与 RVQ 构建语义完整的离散视觉表示,并提出 dNaViT 视觉接口。
美团 LongCat 在 HuggingFace 发布 560B 参数开源 MoE 模型 LongCat-Flash-Prover,通过智能体工具集成推理(TIR)推进 Lean4 原生形式化推理,将任务拆解为自动形式化、sketching 和证明三项能力,并提出 HisPO 算法稳定 MoE 长程训练。
Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。
推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。
推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。
Google 发布 Gemini 3.1 Flash-Lite,定位最快最高效、面向高负载工作负载的模型,官方称在推理、可靠性和可扩展性上超过 2.5 Flash 且成本更低。
FireRedTeam 推出 FireRedVAD,一款工业级语音活动检测(VAD)与音频事件检测模型,支持 100+ 语言,性能超越 Silero-VAD、TEN-VAD、FunASR-VAD 和 WebRTC-VAD。该项目定位为 SOTA 工业级方案,具体参数规模与开源方式尚未披露。
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
QwenLM 在 GitHub 开源 WebWorld,一个大规模网页世界模型,用于在模拟浏览器环境中训练 web agent。该方式可避开真实网页带来的延迟和安全问题。原文仅提供简要介绍,更多细节见 https://github.com/QwenLM/WebWorld。
FireRedTeam 发布 FireRedASR2,一个集 ASR、VAD、LID 和标点模块于一体的工业级语音识别系统。
FireRedTeam 开源图像编辑基础模型 FireRed-Image-Edit,宣称达到开源 SOTA 水平。该模型具备精准指令跟随、高保真生成、优异的身份一致性和多元素无缝融合能力。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。
Anthropic 官方发布视频,介绍 Claude Opus 4.6。
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Edit-Turbo,是 LongCat-Image-Edit 的蒸馏版本,仅需 8 次 NFE 即可实现高质量图像编辑,推理延迟极低。
阿里云 Qwen 团队在 GitHub 开源 Qwen3-ASR 系列 ASR 模型,支持多语言语音、音乐和歌曲识别,并提供语言检测与时间戳预测功能。仓库地址:https://github.com/QwenLM/Qwen3-ASR。
美团 LongCat 发布 LongCat-Flash-Lite,一个非思考型 68.5B 参数 MoE 模型,激活参数约 3B,通过 YaRN 支持 256k 上下文,MIT 许可开源。
美团 LongCat 基于长上下文基础模型 LongCat-Flash-Thinking-2601,通过 LoZA 稀疏注意力方案推出 LongCat-Flash-Thinking-ZigZag。
阿里云通义团队开源 Qwen3-TTS 语音合成模型系列,支持稳定且富有表现力的流式语音生成、自由音色设计和逼真的声音克隆。
美团 LongCat 团队发布更新版 LongCat-Flash-Thinking-2601,总参数 560B(激活 27B)的 MoE 大推理模型,FP8 权重以 MIT 许可开源在 HuggingFace。
美团 LongCat 发布 LongCat-HeavyMode-Summary,该模型在 LongCat-Flash-Thinking-2601 基础上进一步训练,后者为 5600 亿参数的 MoE 架构大推理模型。
美团发布 LongCat-Flash-Thinking-2601,总参数 560B、激活 27B 的 MoE 大推理模型,权重以 MIT License 开源。更新通过环境扩展与多环境强化学习、噪声课程训练强化智能体能力,并新增 Heavy Thinking Mode,在智能体搜索、工具调用等基准上取得有竞争力的成绩,已在 SGLang、vLLM 支持部署并上线 longcat.ai。
QwenLM 推出 Qwen-Image-Layered,通过分层分解让图像具备内在可编辑性。该模型将图像拆解为多个图层,使各元素可独立编辑,而非在单一平面上修改。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
小米发布 MiMo-V2-Flash 基础模型,主打高效推理、编码与智能体能力。该模型以 MiMo-V2-Flash 为名在 GitHub 新仓库开源,具体参数规模、benchmark 分数与上下文长度尚未在现有信息中披露。
美团 LongCat 团队发布开源模型 LongCat-Video-Avatar,统一支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 和 Video Continuation 三种生成模式,兼容单流与多流音频输入,提供单人与多人角色动画生成。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
美团 LongCat 发布图像编辑模型 LongCat-Image-Edit,为 Longcat-Image 的编辑版本,支持中英双语编辑。官方称其在开源图像编辑模型中达到 SOTA,支持全局编辑、局部编辑、文本修改和参考引导编辑,能保持未编辑区域的布局、纹理、色调和主体身份一致,适合多轮编辑。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Dev,这是 LongCat-Image 的中期训练检查点,供社区做 SFT、LoRA 等二次微调。官方称该版本保留高可塑性、未受 RL 约束的参数状态,并配套提供 SFT、LoRA 微调、DPO/GRPO/MPO 对齐及 Edit 训练的全流程代码。