跳到正文

#部署/工程

今日 41 条
7月8日周三
  1. Hugging Face:Blog(RSS)63

    Hugging Face 发布 native-speed vLLM transformers 后端

    Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。

    推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。

7月7日周二
  1. Hugging Face:Blog(RSS)63

    Hugging Face 模型上线 Microsoft Foundry Managed Compute,数千个开源权重模型可一键部署

    Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。

    推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。

  2. Hugging Face:Blog(RSS)67

    SkyPilot 与 Hugging Face 联合推出 store: hf,Hub 存储成为一等后端,多云读取零出口费

    SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。

    推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。

7月6日周一
7月1日周三
6月30日周二
6月29日周一
6月27日周六
6月25日周四
  1. OpenAI:GitHub 新仓库37

    OpenAI 发布官方 Terraform Provider

    OpenAI 在 GitHub 上线官方 Terraform provider,用于通过基础设施即代码方式管理 OpenAI 资源。该仓库名为 openai/terraform-provider-openai,目前仅有一句简介说明其为 OpenAI 官方 Terraform provider,未披露具体支持的资源类型或版本号。

  2. Google Research47

    Google 用线性弹性缓存优化云成本,Spanner 内存占用降 15.5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。

6月23日周二
6月17日周三
6月16日周二
6月12日周五
6月10日周三
  1. vLLM 官方博客(RSS)75

    vLLM 原生支持 Google DeepMind 26B 扩散语言模型 DiffusionGemma

    Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。

    推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。

6月9日周二
6月5日周五
  1. vLLM 官方博客(RSS)69

    vLLM Semantic Router v0.3 Themis 发布:从信号到有状态的生产级路由

    vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。

    推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。

6月4日周四
  1. vLLM 官方博客(RSS)67

    NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持

    NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。

    推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。

6月3日周三
6月2日周二
  1. vLLM 官方博客(RSS)48

    vLLM Semantic Router 推出 SAAR:面向长时程 LLM 智能体的会话感知路由

    vLLM Semantic Router 新增会话感知智能体路由(SAAR),在语义路由之上加入路由器会话记忆、工具循环硬锁、安全重置边界、前缀缓存感知的切换定价与可回放轨迹。在 21,600 个确定性轮次中,SAAR 将模型切换减少 79.29%,消除 3,836 次不安全切换,物理模型成本估算降低 78.71%;在 2,896 个 AMD ROCm 实时请求中保持会话连续性,未观察到违规。

5月30日周六
5月29日周五
5月28日周四
  1. Mistral AI:News(网页)53

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 栈并升级 Vibe 智能体

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的整合 AI 栈,与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产,并收购 Emmi 补充科学能力。Vibe 智能体升级为统一智能体,可处理收件箱与日历、深度研究、编码到合并 PR 等长程多步任务;Les Ulis 新的 10 MW 推理数据中心计划于 Q3 2026 启用,以增强算力控制与安全。

5月27日周三
5月25日周一
5月23日周六
  1. Mistral AI:News(网页)53

    Mistral AI 收购 Physics AI 公司 Emmi AI 加码工业 AI

    Mistral AI 宣布达成最终协议,收购奥地利 Physics AI 公司 Emmi AI,以强化面向工业企业的 AI 转型能力。Emmi AI 团队超过 30 名研究人员和工程师,5 月加入 Mistral 的 Science 与 Applied AI 团队;其大工程模型可用于实时仿真、数字孪生等场景,双方将共同构建面向工程师的 AI 智能体。