跳到正文

#部署/工程

今日 9 条
9月14日周一
9月13日周日
9月11日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)29

    全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户

    NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。

9月10日周四
  1. SiliconFlow70

    DeepSeek-V4.1-Flash 在 SiliconFlow 上线,提供 Day 0 支持。模型为 552B MoE,prefill 阶段约激活 8B、decode 阶段约激活 16B,支持原生视觉与 1M 上下文窗口,KV cache 占用相比 V4 Flash 约缩小 4 倍,采用 MIT 许可证,主打高吞吐生产级推理。

    推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。

  2. Mistral AI:News(网页)29

    Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。

9月9日周三
  1. Mistral AI:News(网页)54

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。

9月8日周二
  1. Mistral AI:News(网页)66

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。

    推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)51

    NVIDIA 推出 CUDA Rust:编写 GPU kernel 的两条路线

    2026 年 9 月,NVIDIA 宣布投入 Rust 原生 GPU 编程,推出 CUDA Rust,提供两条编写 GPU kernel 的路线。CUDA C++ 和 CUDA Python 仍是成熟的企业级工具链,NVIDIA 将持续把 CUDA Rust 发展和成熟至 2027 年及以后,以应对涵盖推理引擎、服务基础设施、驱动和 Agent runtime 的 AI 系统层需求。

  3. vLLM 官方博客(RSS)65

    vLLM 联合 AgentX 优化真实智能体推理服务,成本较 Opus 5 API 最多低 106×

    vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。

    推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。

  4. vLLM 官方博客(RSS)45

    GLM 5.3 优化第一部分:vLLM 中的 Hybrid HiSparse 卸载

    vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。

9月7日周一
9月5日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    NVIDIA Jetson 如何部署与优化前沿推理模型

    NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。

  2. a16z:News(RSS)43

    a16z 投资 Gimlet Labs:打造首个多芯片推理云

    a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可在同一功耗范围内为前沿模型带来最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把不同模型和工具调度到 GPU、CPU 及专用加速器上,并将编排延伸至数据中心层面,对开发者只暴露单一推理 API。其客户已包括一家前沿实验室和一家超大规模云厂商。

9月4日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)36

    NVIDIA PAIR 虚拟推理路由器:把本地网络上的可用算力扩展给 AI 智能体

    NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。

9月3日周四
  1. Hugging Face:Blog(RSS)63

    Hugging Face 教程:用 TRL 对 LFM2.5-350M 做 100 步 GRPO 微调提升结构化输出

    Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。

    推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。

9月2日周三
  1. Microsoft:Official Blog(RSS)46

    微软:AI 基础设施的“良率”命题——从算力投入转向有用智能产出

    微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。

9月1日周二
8月29日周六
8月27日周四
  1. Google DeepMind:Blog(RSS)54

    Google DeepMind 试点全球首个对前沿专有模型的双盲 AI 评估

    Google DeepMind 推出全球首个针对专有前沿模型的双盲评估,将外部评估限制在密码学安全的"盒子"中,防止模型提前接触测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用机密基准测试一个 Gemini Flash Lite 模型。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)38

    NVIDIA NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施

    NVIDIA 通过 NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施,面向超大规模厂商和 AI 原生公司自研的 XPU 加速器。随着模型规模与推理负载增长,XPU 规模化部署需要高带宽内存(HBM)持续供给算力,并需要足够的封装与硅片面积容纳更多计算单元。

8月26日周三
8月25日周二
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)51

    NVIDIA 发布 CUDA Python 1.0:稳定 API、统一基础与完整平台访问

    NVIDIA 技术博客宣布 CUDA Python 1.0,主打稳定 API、统一基础和对完整平台的访问。文章指出此前 Python 开发者要用 GPU 只有两条现实路径:学 CUDA C++ 写扩展并维护 Python 绑定,或依赖 PyTorch、CuPy、RAPIDS 等上层库,而后者虽有局限却推动了 Python GPU 生态的繁荣。