阿里云 Qwen 团队开源 Qwen3-ASR 语音识别模型系列
阿里云 Qwen 团队在 GitHub 开源 Qwen3-ASR 系列 ASR 模型,支持多语言语音、音乐和歌曲识别,并提供语言检测与时间戳预测功能。仓库地址:https://github.com/QwenLM/Qwen3-ASR。
阿里云 Qwen 团队在 GitHub 开源 Qwen3-ASR 系列 ASR 模型,支持多语言语音、音乐和歌曲识别,并提供语言检测与时间戳预测功能。仓库地址:https://github.com/QwenLM/Qwen3-ASR。
美团 LongCat 发布 LongCat-Flash-Lite,一个非思考型 68.5B 参数 MoE 模型,激活参数约 3B,通过 YaRN 支持 256k 上下文,MIT 许可开源。
美团 LongCat 基于长上下文基础模型 LongCat-Flash-Thinking-2601,通过 LoZA 稀疏注意力方案推出 LongCat-Flash-Thinking-ZigZag。
阿里云通义团队开源 Qwen3-TTS 语音合成模型系列,支持稳定且富有表现力的流式语音生成、自由音色设计和逼真的声音克隆。
美团 LongCat 团队发布更新版 LongCat-Flash-Thinking-2601,总参数 560B(激活 27B)的 MoE 大推理模型,FP8 权重以 MIT 许可开源在 HuggingFace。
美团 LongCat 发布 LongCat-HeavyMode-Summary,该模型在 LongCat-Flash-Thinking-2601 基础上进一步训练,后者为 5600 亿参数的 MoE 架构大推理模型。
美团发布 LongCat-Flash-Thinking-2601,总参数 560B、激活 27B 的 MoE 大推理模型,权重以 MIT License 开源。更新通过环境扩展与多环境强化学习、噪声课程训练强化智能体能力,并新增 Heavy Thinking Mode,在智能体搜索、工具调用等基准上取得有竞争力的成绩,已在 SGLang、vLLM 支持部署并上线 longcat.ai。
QwenLM 推出 Qwen-Image-Layered,通过分层分解让图像具备内在可编辑性。该模型将图像拆解为多个图层,使各元素可独立编辑,而非在单一平面上修改。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
Mistral 发布 Mistral OCR 3,整体在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 达到 74% 胜率。
小米发布 MiMo-V2-Flash 基础模型,主打高效推理、编码与智能体能力。该模型以 MiMo-V2-Flash 为名在 GitHub 新仓库开源,具体参数规模、benchmark 分数与上下文长度尚未在现有信息中披露。
美团 LongCat 团队发布开源模型 LongCat-Video-Avatar,统一支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 和 Video Continuation 三种生成模式,兼容单流与多流音频输入,提供单人与多人角色动画生成。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
美团 LongCat 发布图像编辑模型 LongCat-Image-Edit,为 Longcat-Image 的编辑版本,支持中英双语编辑。官方称其在开源图像编辑模型中达到 SOTA,支持全局编辑、局部编辑、文本修改和参考引导编辑,能保持未编辑区域的布局、纹理、色调和主体身份一致,适合多轮编辑。
美团 LongCat 在 HuggingFace 发布 LongCat-Image-Dev,这是 LongCat-Image 的中期训练检查点,供社区做 SFT、LoRA 等二次微调。官方称该版本保留高可塑性、未受 RL 约束的参数状态,并配套提供 SFT、LoRA 微调、DPO/GRPO/MPO 对齐及 Edit 训练的全流程代码。
美团 LongCat 发布开源中英双语图像生成基础模型 LongCat-Image,仅 6B 参数,在多个基准上超越数倍于其规模的开源模型。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
美团 LongCat 团队发布 13.6B 参数的开源视频生成基础模型 LongCat-Video,统一支持文生视频、图生视频和视频续写三类任务。模型在 Video-Continuation 上预训练,可生成长达数分钟的视频而不出现色彩漂移或质量下降,并通过粗到细策略和 Block Sparse Attention 在数分钟内生成 720p、30fps 视频。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,共 560B 参数、激活 27B,主打实时音视频交互,权重采用 MIT License 发布。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,总参数 560B、激活 27B,基于 Shortcut-connected MoE 架构,支持实时音视频交互与最长 128K token 上下文。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
美团 LongCat 团队开源 LongCat-Audio-Codec,一套面向语音大语言模型的音频 tokenizer 与 detokenizer 方案,并行生成语义与声学 token,可在极低码率下高保真重建音频。
OpenBMB 发布 SciCore-Omics,称其为首个连接组织学图像、空间转录组学和生物语言的三模态基础模型。该模型将三类生物医学数据模态统一到同一基础模型中。
阿里云千问团队推出 Qwen3Guard 多语言护栏模型系列。该系列模型用于内容安全审核,支持多语言场景。
阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni
推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。
美团 LongCat 团队发布并开源 LongCat-Flash-Thinking,总参数 560B 的 MoE 大推理模型,按上下文动态激活 18.6B~31.3B 参数(平均约 27B)。
美团发布并开源 LongCat-Flash-Thinking,总参数 560B 的 MoE 大推理模型,按上下文动态激活 18.6B~31.3B(平均约 27B)参数,权重采用 MIT License。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米 MiMo 团队发布 MiMo-Audio-Tokenizer,一个统一音频分词器,可同时提取语义信息并实现高保真音频重建。该模型已在 GitHub 开源。
通义千问(Qwen)团队发布 Qwen3.8 大语言模型系列,由阿里巴巴集团开发。该系列为 Qwen 团队自研的大语言模型产品线,具体参数规模、上下文长度与可用性信息尚未在原文中披露。
美团 LongCat 团队发布 LongCat-Flash-Chat,一款总参数 560B 的 MoE 非思考基础模型,按上下文动态激活 18.6B∼31.3B 参数,平均约 27B。
美团 LongCat 团队发布 LongCat-Flash-Chat,总参数 560B 的 MoE 模型,按上下文动态激活 18.6B∼31.3B 参数(平均约 27B),通过 Shortcut-connected MoE 扩大计算通信重叠窗口,推理吞吐超 100 tokens 每秒。
上海人工智能实验室 InternLM 团队发布科学多模态基础模型 Intern-S1,定位为面向科学领域的多模态基础模型。原文未披露参数规模、benchmark 分数及开放方式等具体细节。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
小米 MiMo 推出 lmms-eval,一个面向大型多模态模型(LMM)的一键式评估模块,用于加速 LMM 开发。该工具以评估模块形式提供,具体支持的模型、基准与使用方式未在原文中说明。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。