Nathan Lambert 播客复盘 Kimi K3 与开源模型生态,反驳蒸馏争议
Nathan Lambert 与 Florian Brand 在季度开源模型总结播客中讨论 Kimi K3 发布后的开源模型格局,称 Kimi K3 在研究类任务上超出预期,但 API 拥堵导致响应明显慢于 GPT。
推荐理由:Lambert 结合上手实测与行业一手观察,拆解开源模型与闭源前沿的差距、蒸馏争议和安全依赖问题,判断较有信息量。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Nathan Lambert 与 Florian Brand 在季度开源模型总结播客中讨论 Kimi K3 发布后的开源模型格局,称 Kimi K3 在研究类任务上超出预期,但 API 拥堵导致响应明显慢于 GPT。
推荐理由:Lambert 结合上手实测与行业一手观察,拆解开源模型与闭源前沿的差距、蒸馏争议和安全依赖问题,判断较有信息量。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,为 2.8T 参数 MoE 模型,权重定于 7 月 27 日开放,在 Vals AI 指数排第 2、Artificial Analysis 智能指数排第 3、Frontend Code Arena 排第 1。
推荐理由:作者基于榜单和架构细节分析 K3 对开源模型经济与中美竞争格局的影响,提供了可参考的行业判断框架。
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
推荐理由:Thinking Machines 发布首个模型 Inkling,开放全部权重并支持 Tinker 微调,可关注其跨模态推理的落地方式。
推荐理由:原文给出多模态能力、开放权重和两个可用入口,读者可以据此了解获取和试用方式。
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 在发布当天通过 Serverless 提供托管推理,支持 1M 上下文窗口和 OpenAI 兼容 API。
推荐理由:原文给出 Inkling 的架构细节、参数规模和初步评测数据,读者可以据此判断其推理与多模态能力是否适合接入。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Nathan Lambert 撰文称,白宫正讨论通过新行政令管理开放权重模型,最可能的行动是禁止或无限期推迟能力超过 GPT 5.5、Claude Opus 4.8 或 GLM-5.2 水平的开源模型,且这一时点可能在 6 个月内到来。
推荐理由:作者基于白宫行政令讨论和模型许可会议细节,分析了开源模型禁令的时间线、知识蒸馏争议及其政策走向。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Aramco Ventures、Vista Equity、General Catalyst 等,另获超 500 MW 算力容量承诺。
推荐理由:融资公告由 CEO 亲述,同时给出客户成本案例和推理栈技术进展,可看出开源模型的实际经济性。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
小米 MiMo 发布并开源终端编程智能体 MiMo Code V0.1,采用 MIT 许可,内置 MiMo V2.5 多模态模型(限时免费、百万 token 上下文)。
推荐理由:官方宣布 MiMo Code V0.1 开源,列出无限上下文、语音输入等具体能力和一行安装命令,可据此评估迁移成本。
Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。
推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。
Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。
推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
QwenLM 发布 open-computer-use,一个基于 MCP 的 Computer Use 服务,供 Qwen Code 及任何 AI Agent 使用。它通过辅助功能 API 控制 macOS、Linux 和 Windows 系统。
推荐理由:原文点明该服务基于 MCP、可跨三大操作系统控制电脑,读者可以据此评估它与 Qwen Code 等 Agent 的结合方式。
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。