美团 LongCat 发布开源双语图像生成模型 LongCat-Image
美团 LongCat 发布开源中英双语图像生成基础模型 LongCat-Image,仅 6B 参数,在多个基准上超越数倍于其规模的开源模型。
美团 LongCat 发布开源中英双语图像生成基础模型 LongCat-Image,仅 6B 参数,在多个基准上超越数倍于其规模的开源模型。
Sebastian Raschka 在 Ahead of AI 发表长文,解读 DeepSeek V3.2 相比 V3/R1 的主要变化。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
DeepSeek 在 GitHub 发布 LPLB,一个基于线性规划、面向 MoE 模型的专家并行负载均衡器,目前处于早期研究阶段。该仓库未披露参数规模、性能数据或具体可用形式。
美团 LongCat 团队发布 13.6B 参数的开源视频生成基础模型 LongCat-Video,统一支持文生视频、图生视频和视频续写三类任务。模型在 Video-Continuation 上预训练,可生成长达数分钟的视频而不出现色彩漂移或质量下降,并通过粗到细策略和 Block Sparse Attention 在数分钟内生成 720p、30fps 视频。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,共 560B 参数、激活 27B,主打实时音视频交互,权重采用 MIT License 发布。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,总参数 560B、激活 27B,基于 Shortcut-connected MoE 架构,支持实时音视频交互与最长 128K token 上下文。
DeepSeek 在 GitHub 开源 DeepSeek-OCR 仓库(https://github.com/deepseek-ai/DeepSeek-OCR),核心思路为 Contexts Optical Compression(上下文光学压缩)。
美团 LongCat 团队开源 LongCat-Audio-Codec,一套面向语音大语言模型的音频 tokenizer 与 detokenizer 方案,并行生成语义与声学 token,可在极低码率下高保真重建音频。
OpenBMB 发布 SciCore-Omics,称其为首个连接组织学图像、空间转录组学和生物语言的三模态基础模型。该模型将三类生物医学数据模态统一到同一基础模型中。
阿里云千问团队推出 Qwen3Guard 多语言护栏模型系列。该系列模型用于内容安全审核,支持多语言场景。
阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni
推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。
美团 LongCat 团队发布并开源 LongCat-Flash-Thinking,总参数 560B 的 MoE 大推理模型,按上下文动态激活 18.6B~31.3B 参数(平均约 27B)。
美团发布并开源 LongCat-Flash-Thinking,总参数 560B 的 MoE 大推理模型,按上下文动态激活 18.6B~31.3B(平均约 27B)参数,权重采用 MIT License。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米 MiMo 团队发布 MiMo-Audio-Tokenizer,一个统一音频分词器,可同时提取语义信息并实现高保真音频重建。该模型已在 GitHub 开源。
通义千问(Qwen)团队发布 Qwen3.8 大语言模型系列,由阿里巴巴集团开发。该系列为 Qwen 团队自研的大语言模型产品线,具体参数规模、上下文长度与可用性信息尚未在原文中披露。
FireRedTeam 推出 FireRedTTS2,一个面向多说话人对话生成的长音频流式 TTS 系统。该系统支持长音频流式合成,可用于多说话人对话场景。
美团 LongCat 团队发布 LongCat-Flash-Chat,一款总参数 560B 的 MoE 非思考基础模型,按上下文动态激活 18.6B∼31.3B 参数,平均约 27B。
美团 LongCat 团队发布 LongCat-Flash-Chat,总参数 560B 的 MoE 模型,按上下文动态激活 18.6B∼31.3B 参数(平均约 27B),通过 Shortcut-connected MoE 扩大计算通信重叠窗口,推理吞吐超 100 tokens 每秒。
QwenLM 发布 Qwen-Image,一个图像生成基础模型,主打复杂文字渲染和精确图像编辑能力,代码发布在 GitHub(https://github.com/QwenLM/Qwen-Image)。
上海人工智能实验室 InternLM 团队发布科学多模态基础模型 Intern-S1,定位为面向科学领域的多模态基础模型。原文未披露参数规模、benchmark 分数及开放方式等具体细节。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
小米 MiMo 推出 lmms-eval,一个面向大型多模态模型(LMM)的一键式评估模块,用于加速 LMM 开发。该工具以评估模块形式提供,具体支持的模型、基准与使用方式未在原文中说明。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
小米 MiMo 在 GitHub 新建 XiaomiMiMo/vllm 仓库,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库基于 vLLM 项目,具体功能、性能数据与可用性尚未在现有信息中披露。
小米发布 MiMo,一个从预训练到后训练全流程优化推理能力的语言模型。该模型旨在释放语言模型的推理潜力,相关代码与模型已托管于 GitHub 的 XiaomiMiMo/MiMo 仓库。
Mistral AI 发布 Mistral Small 3.1,改进文本性能、新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达每秒 150 tokens,并以 Apache 2.0 许可开源。
推荐理由:官方给出基准对比与部署门槛,读者可以据此评估它在小参数量开源模型中的实际位置。
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 新建 profile-data 仓库,用于分析 V3/R1 的计算通信重叠。该仓库聚焦计算与通信过程的 overlap 分析,目前仅给出这一句说明,未披露具体方法、数据或工具细节。
DeepSeek 在 GitHub 开源了轻量数据处理框架 smallpond,构建于 DuckDB 和 3FS 之上。该框架定位为轻量级数据处理方案,目前仓库未披露更多参数与性能细节。
DeepSeek 在 GitHub 发布 FlashMLA 仓库,提供高效的 Multi-head Latent Attention(MLA)内核,地址为 https://github.com/deepseek-ai/FlashMLA。本次材料仅含仓库简介,未提供更多性能或使用细节。
DeepSeek 在 GitHub 开源 DeepEP,一个高效的 expert-parallel(专家并行)通信库,仓库地址为 https://github.com/deepseek-ai/DeepEP。
DeepSeek 在 GitHub 开源了 GPU BLAS 内核库 DeepGEMM,主打简洁与高效。该库以 clean and efficient 为设计目标,面向 GPU 上的 BLAS 运算场景。
Answer.AI 发布 ModernBERT-Large-Instruct,一个在 ModernBERT-Large(395M 参数)上用 FLAN 指令微调的编码器模型,直接用 MLM 头做分类和选择题,无需架构改动。