vLLM 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
NVIDIA 与 vLLM 团队宣布 Day-0 支持 Nemotron 3.5 Lightning,这是一个面向常驻智能体的开源混合 MoE 模型,总参数 30B、每 token 激活 3B,上下文最长 1M token,从 Nemotron 3 Ultra 蒸馏而来。
NVIDIA 与 vLLM 团队宣布 Day-0 支持 Nemotron 3.5 Lightning,这是一个面向常驻智能体的开源混合 MoE 模型,总参数 30B、每 token 激活 3B,上下文最长 1M token,从 Nemotron 3 Ultra 蒸馏而来。
browser-use 推出 browser-worlds-tinker-rl,结合 Tinker RL 与确定性的 Browser Use Worlds 训练专用浏览器智能体。该仓库面向浏览器智能体的强化学习训练场景,目前已在 GitHub 上线。
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,覆盖多语言、多品牌与多市场场景。该功能结合语音、个性与语言感知行为,并接入 Sierra Agent SDK,支持调整语速、应对打断及对话中切换语音或语言。Sierra 称某智能体搭配自然语音与人格后问题解决率提升近 50%,Voice Personas 现已上线。
vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。
Baseten 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Sierra 发布 Context Engine,将客户关系及其产生的上下文转化为企业竞争优势,并驱动 Horizon 智能体持续数天、数周乃至数月追逐业务结果。
Google Cloud 在 Next '26 的 Agentic Data Cloud 发布中推出两款 AI 数据库智能体。
Google Cloud 的 Database Migration Service(DMS)可自动将 SQL Server 多结果集存储过程转换为 PostgreSQL 的 SETOF refcursor 结构。
Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。
Google 宣布 Data Commons on Spanner Graph 正式可用,并预览新的 Data Commons Platform,用于把企业私有知识与公共数据集知识图谱打通。
Nathan Lambert 的 Interconnects 推出 Artifacts Hub 和 Adoption Dashboard 两个免费工具。
Google Cloud 为 AlloyDB 推出 IAM 群组认证预览版,将身份驱动的访问控制引入企业级工作负载,并与 Cloud SQL 统一安全策略。该功能支持定义最多 200 个 Google Groups,让 AI 智能体传递终端用户身份,使数据库按用户权限授权并记录精确审计日志。Bilt 已采用该方案消除共享凭证风险。
Modem 的 MCP 服务器和公共 API 向所有用户开放,MCP 客户端可连接 https://mcp.modem.dev/mcp,公共 API 位于 api.modem.dev/v1。
browser-use 上线官方插件市场 plugin-marketplace,首个上架的是 xAI 官方插件。该仓库定位为浏览器智能体的插件分发入口,目前仅披露 xAI 这一官方插件来源,具体插件数量与功能未公布。
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中上线。模型改进包括更自然丰富的旋律结构、更高歌词质量与提示词遵循度、更真实且情感细腻的人声与发音,并新增对输出节奏 tempo 和时长的控制。
QwenLM 推出 Qwen-MM-Plugins,目标是让任意 agent harness 实现多模态原生支持。该插件项目来自通义 QwenAudio 相关原创语音项目方向,正文未披露具体模型版本、参数规模或可用方式。
vLLM 与 Speculators 为 P-EAGLE、DFlash、DSpark 三种并行草稿(parallel drafting)算法提供完整开源支持,相关模型已发布在 RedHatAI HuggingFace Hub 的 Speculators Collection 中。
微软发布智能体安全系统 Project Perception,通过红队、蓝队、绿队三类专用智能体组成闭环防御,用 AI 对抗 AI,并将于 8 月 3 日进入公开预览。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face 在 GitHub 开源 pwc-cli 仓库,提供与 Papers with Code 交互的命令行工具,同时支持作为 Skill 和 MCP Server 使用,面向 Agent 和人类用户。
蚂蚁 inclusionAI 在 GitHub 发布 PanelWise,一个自托管的多模型深度研究系统,可将多个独立研究智能体的结果融合为有证据支撑的报告。
蚂蚁 inclusionAI 在 GitHub 新建仓库 buildkit-service,提供面向智能体基础设施的分布式镜像构建与包镜像服务。该仓库定位为 agentic infrastructure 的构建与镜像分发支撑组件,目前公开信息仅包含这一句功能描述。
Nous Research 在 GitHub 新建 hermes-e2e-evidence 仓库,用于存放 hermes-agent CI 发布的临时视觉证据。仓库说明称这些证据为 ephemeral(临时性)内容,由 hermes-agent 的 CI 流程自动发布。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Together AI 推出 Dedicated Model Inference 平台,为在生产中运行开放权重、授权闭源权重和微调模型提供统一服务。
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。
推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹持器录制约 490€ 的演示数据,无需机器人或遥操作设备,即可自动转成 LeRobot 格式的机器人可用数据集。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Sierra 发布 Horizon 平台,让智能体能够追求贷款发起、医疗预授权等长周期目标,跨数天、数周甚至数月主动与客户互动。Horizon 在 Agent OS 之上加入长周期规划与上下文引擎,智能体可从每次互动中学习优化决策,且按业务成果而非 token 计费。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
OpenAI 在 GitHub 上线新仓库 openai/redcard,定位是借助 Codex 帮助用户从工作中抽身。仓库名与正文均未披露具体功能、版本号或可用性细节。
Hugging Face 在 GitHub 上线新仓库 space-demo-kit,用于为 Hugging Face Spaces 渲染精致的 Gradio 风格演示视频。该工具面向 Space 演示场景,帮助生成可直接展示的 demo 视频。
Modem 面向所有用户开放 Stripe 集成 beta,可在 Settings → Integrations → Stripe 通过官方 Stripe App 的 OAuth 只读接入,无需 API key。
vLLM 通过 V1 的公开 connector 接口接入 TileRT 作为专用 decode 引擎,随 TileRT 0.1.5 发布,prefill、调度、前缀缓存与 API 均保持原生 vLLM 不变。
OpenAI 在 GitHub 发布 openai/codex-security 仓库,提供用于查找、验证和修复安全漏洞的 Codex Security CLI 和 TypeScript SDK。npm 包名为 @openai/codex-security。
browser-use 开源 browser-harness-tui 仓库,将 OpenAI Codex fork 后嵌入为内置浏览器智能体。它提供 Terminal 风格的 TUI,并集成原生的 browser-harness 工具。