小米 MiMo-Audio:音频语言模型是少样本学习者
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
通义千问(Qwen)团队发布 Qwen3.8 大语言模型系列,由阿里巴巴集团开发。该系列为 Qwen 团队自研的大语言模型产品线,具体参数规模、上下文长度与可用性信息尚未在原文中披露。
Sebastian Raschka 发布长文教程,用纯 PyTorch 从零讲解并实现 Qwen3 的 Dense 与 Mixture-of-Experts 架构。
美团 LongCat 团队发布 LongCat-Flash-Chat,一款总参数 560B 的 MoE 非思考基础模型,按上下文动态激活 18.6B∼31.3B 参数,平均约 27B。
美团 LongCat 团队发布 LongCat-Flash-Chat,总参数 560B 的 MoE 模型,按上下文动态激活 18.6B∼31.3B 参数(平均约 27B),通过 Shortcut-connected MoE 扩大计算通信重叠窗口,推理吞吐超 100 tokens 每秒。
Sebastian Raschka 基于官方代码和技术报告分析 OpenAI 时隔 GPT-2 后发布的开放权重模型 gpt-oss-120b 和 gpt-oss-20b 的架构变化,包括 RoPE、SwiGLU、MoE、GQA、128 token 滑动窗口注意力、RMSNorm、注意力偏置和 sinks,以及让模型适配单张 GPU 的 MXFP4 量化。
上海人工智能实验室 InternLM 团队发布科学多模态基础模型 Intern-S1,定位为面向科学领域的多模态基础模型。原文未披露参数规模、benchmark 分数及开放方式等具体细节。
OpenAI 发布面向 JavaScript/TypeScript 的开源 Agents SDK,用于构建多智能体工作流,支持 OpenAI API 及其他提供商。
OpenAI Agents SDK(Python)是一个轻量级多智能体工作流框架,支持 OpenAI Responses 和 Chat Completions API 以及 100+ 其他 LLM。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
小米 MiMo 在 GitHub 新建 XiaomiMiMo/vllm 仓库,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库基于 vLLM 项目,具体功能、性能数据与可用性尚未在现有信息中披露。
Mistral AI 发布 Mistral Small 3.1,改进文本性能、新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达每秒 150 tokens,并以 Apache 2.0 许可开源。
推荐理由:官方给出基准对比与部署门槛,读者可以据此评估它在小参数量开源模型中的实际位置。
DeepSeek 在 GitHub 发布新仓库 deepseek-ai/open-infra-index,定位为经过生产验证的 AI 基础设施工具集合,用于高效 AGI 开发和社区驱动的创新。
Answer.AI 发布 ModernBERT-Large-Instruct,一个在 ModernBERT-Large(395M 参数)上用 FLAN 指令微调的编码器模型,直接用 MLM 头做分类和选择题,无需架构改动。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中国方言和英语,并在公开普通话 ASR 基准上达到新的 SOTA。该模型还具备出色的歌词识别能力。
deepseek-ai 在 GitHub 发布新仓库 DeepSeek-R1,链接为 https://github.com/deepseek-ai/DeepSeek-R1。仓库正文无更多描述信息。
DeepSeek 在 GitHub 发布 DeepSeek-V3 模型仓库 deepseek-ai/DeepSeek-V3,仓库正文未提供更多细节。
Answer.AI 与 LightOn 发布 ModernBERT,一个替换 BERT 的 encoder-only 模型家族,含 base(149M 参数)和 large(395M 参数)两个尺寸,上下文长度达 8192 tokens。
推荐理由:发布方给出了速度、上下文长度和训练数据的具体改进点,读者可以据此评估它能否替换现有 BERT 类工作流。
fastai 团队发布免费服务 nbsanity,将 GitHub 仓库或 Gist 中的公开 Jupyter Notebook 渲染为精美网页,只需把 URL 中的 github.com 替换为 nbsanity.com,或使用提供的书签工具。
推荐理由:原文来自开发团队,说明工具的用法、基于 Quarto 的能力边界和限制,读者可据此判断是否适合分享自己的 notebook。
Answer.AI 发布 ShellSage,一款运行在终端里的 AI 系统管理助手,可通过 pip install shell_sage 安装,需配置 ANTHROPIC_API_KEY。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。