vLLM 发布 AFD 插件:为 MoE 推理拆分 Attention 与 FFN
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。
推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹持器录制约 490€ 的演示数据,无需机器人或遥操作设备,即可自动转成 LeRobot 格式的机器人可用数据集。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Sierra 发布 Horizon 平台,让智能体能够追求贷款发起、医疗预授权等长周期目标,跨数天、数周甚至数月主动与客户互动。Horizon 在 Agent OS 之上加入长周期规划与上下文引擎,智能体可从每次互动中学习优化决策,且按业务成果而非 token 计费。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
OpenAI 在 GitHub 上线新仓库 openai/redcard,定位是借助 Codex 帮助用户从工作中抽身。仓库名与正文均未披露具体功能、版本号或可用性细节。
Modem 面向所有用户开放 Stripe 集成 beta,可在 Settings → Integrations → Stripe 通过官方 Stripe App 的 OAuth 只读接入,无需 API key。
vLLM 通过 V1 的公开 connector 接口接入 TileRT 作为专用 decode 引擎,随 TileRT 0.1.5 发布,prefill、调度、前缀缓存与 API 均保持原生 vLLM 不变。
OpenAI 在 GitHub 发布 openai/codex-security 仓库,提供用于查找、验证和修复安全漏洞的 Codex Security CLI 和 TypeScript SDK。npm 包名为 @openai/codex-security。
browser-use 开源 browser-harness-tui 仓库,将 OpenAI Codex fork 后嵌入为内置浏览器智能体。它提供 Terminal 风格的 TUI,并集成原生的 browser-harness 工具。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教育者提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并首发支持 8 种语言。底层由 Gemini 3.5 Flash 提供智能支持,首批覆盖全国 100 所试点学校。
蚂蚁 inclusionAI 在 GitHub 新建仓库 AKernel,定位为面向 Agents 的可编程数据中心级基础设施。该仓库目前仅给出这一句项目描述,未披露模型、参数或性能细节。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 sandboxd,定位为沙箱运行时守护进程(sandbox runtime daemon)。目前仓库仅提供这一句说明,未披露具体功能、支持平台或开源许可等细节。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并预加载所选模型。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
腾讯混元 AI Infra 团队的 HPC-Ops 算子库中的 Attention 和 MoE 内核已合入 vLLM 主分支,成为一等后端,针对 NVIDIA Hopper 架构优化,在 H20 上效果最好。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,非信任来源需显式传入 trust_remote_code=True。
Nous Research 为 Hermes Agent 推出 Telegram Business Mode 插件,以秘书机器人形式运行,每条草拟回复都需经所有者批准后才会发送给客户。该插件采用 observe-with-approval 机制,目前已在 GitHub 开源。
Hugging Face 上线 pi-local-router,这是一个 Pi 扩展,用于在 llama.cpp 与 Hugging Face Inference Providers 之间进行路由。该仓库以 huggingface/pi-local-router 名义发布,目前仅披露了扩展的用途,未公布参数、性能或可用性细节。
Hugging Face 上线新仓库 physics-intern-opencode-plugin,为 Opencode 中的 Physics Intern 提供安装器。正文仅说明该仓库用于在 Opencode 内安装 Physics Intern,未披露模型规模、版本号或可用方式等细节。
Hugging Face 与 Cerebras 展示了一套开源、模块化的实时语音到语音流水线:Nvidia Parakeet 做语音识别,Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 合成语音回复。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项智能体改动都需经实验验证。实验默认以解决率和流失率等业务指标评估,仪表盘展示统计显著性、效果出现时间及稳定性,支持逐步放量后全量发布。Ghostwriter 会分析全部对话、提炼假设并在数分钟内将其转化为实验,使测试频率从每季度一次提升至持续迭代。
Google Research 将建筑级屋顶反射率数据集从 14 个城市扩展至 50+ 个城市,覆盖 9 个国家,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Hugging Face 上线 Codex 插件 physics-intern-codex-plugin,用于 Physics Intern。该仓库为 Codex 提供与 Physics Intern 配合使用的插件能力,目前公开信息仅包含插件名称与用途,未披露模型版本、参数规模或可用方式。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可跨平台发布并回溯至完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。贡献者可通过转换器将 EEE 记录提交至 Community Evals,经组织官方账号提交的结果会显示验证标记。
vLLM Semantic Router 团队推出 Micro-Agent 能力,把单次模型 API 调用变成服务层内有界的多模型协作,用户仍只调用一个模型名 vllm-sr/auto。
OpenAI 在 GitHub 新建仓库 birdingpal,这是一个由 ChatGPT 驱动的鸟类识别助手。该仓库目前仅有一句说明,称 BirdingPal 是用于识别鸟类的 ChatGPT 伙伴,未披露模型版本、参数规模或可用方式等细节。
Midjourney 为 V8.1 草稿模式加入随机风格探索功能,在提示词中加入 --sref random 即可生成 24 张不同风格的图像。开启草稿模式可点击提示词栏的 ⚡ 图标,或在提示词中加入 --draft。
OpenAI 在 GitHub 上线官方 Terraform provider,用于通过基础设施即代码方式管理 OpenAI 资源。该仓库名为 openai/terraform-provider-openai,目前仅有一句简介说明其为 OpenAI 官方 Terraform provider,未披露具体支持的资源类型或版本号。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,从此前的独立 Gemini 2.5 computer use 模型整合进主力 Flash 模型,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动和桌面环境操作的智能体。
推荐理由:原文给出 computer use 内置于 Gemini 3.5 Flash 的能力和安全措施,读者可据此评估在自动化任务中的可用性。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织分配连接器访问权限、可单独开关工具的管理员控制,以及带连接器作用域的 API key,均已 GA。多账号连接器(GA)支持一个连接器绑定多个账号,Connectors Debugger(公开预览)可分 11 步定位 MCP 连接故障。目录现有 60 多个预置集成,并支持自定义 MCP 连接器。
Hugging Face 在 GitHub 上线新仓库 huggingface/hf-claude,用于通过 Claude Code 启动并调用 Hugging Face Inference Providers。该工具把 Claude Code 与 Hugging Face 的推理服务打通,具体支持范围与用法尚未在仓库说明中展开。