跳到正文

#部署/工程

今日 49 条
9月13日周日
9月12日周六
9月11日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)29

    全栈 NIM 优化如何在 Nemotron 3 Ultra 上支撑 2.5 倍并发用户

    NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。

9月10日周四
  1. SiliconFlow70

    DeepSeek-V4.1-Flash 在 SiliconFlow 上线,提供 Day 0 支持。模型为 552B MoE,prefill 阶段约激活 8B、decode 阶段约激活 16B,支持原生视觉与 1M 上下文窗口,KV cache 占用相比 V4 Flash 约缩小 4 倍,采用 MIT 许可证,主打高吞吐生产级推理。

    推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。

  2. Mistral AI:News(网页)29

    Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。

9月9日周三
  1. Mistral AI:News(网页)54

    Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。

9月8日周二
  1. Mistral AI:News(网页)66

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。

    推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)51

    NVIDIA 推出 CUDA Rust:编写 GPU kernel 的两条路线

    2026 年 9 月,NVIDIA 宣布投入 Rust 原生 GPU 编程,推出 CUDA Rust,提供两条编写 GPU kernel 的路线。CUDA C++ 和 CUDA Python 仍是成熟的企业级工具链,NVIDIA 将持续把 CUDA Rust 发展和成熟至 2027 年及以后,以应对涵盖推理引擎、服务基础设施、驱动和 Agent runtime 的 AI 系统层需求。

  3. Jensen Huang57

    黄仁勋转发 H100 租金行情并称 NVIDIA 算力是可互换、耐用且高出租率的生产性资产。被引用内容显示,三年前的训练芯片 H100 租金月涨 22% 至 $3.28/小时,与折旧假设相反,市场反而在为这块老芯片支付更高价格。

    引用Ornn@OrnnExchange

    The H100 is a three-year-old training chip. Its rental price is up 22 percent on the month, to $3.28 an hour. Every depreciation schedule assumes a chip this old only loses value. The market is paying up for it instead.

  4. vLLM 官方博客(RSS)65

    vLLM 联合 AgentX 优化真实智能体推理服务,成本较 Opus 5 API 最多低 106×

    vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。

    推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。

  5. vLLM 官方博客(RSS)45

    GLM 5.3 优化第一部分:vLLM 中的 Hybrid HiSparse 卸载

    vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。

9月7日周一
9月5日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    NVIDIA Jetson 如何部署与优化前沿推理模型

    NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。

  2. a16z:News(RSS)43

    a16z 投资 Gimlet Labs:打造首个多芯片推理云

    a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可在同一功耗范围内为前沿模型带来最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把不同模型和工具调度到 GPU、CPU 及专用加速器上,并将编排延伸至数据中心层面,对开发者只暴露单一推理 API。其客户已包括一家前沿实验室和一家超大规模云厂商。

9月4日周五
  1. Unsloth AI71

    Unsloth 发布 GLM-5.3-Flash 的本地 GGUF 优化方案,通过更快解码和 MTP 支持使本地推理提速 1.6 至 3.4 倍,长上下文下最高达 3.3 倍。3-bit 量化可在 128GB 内存设备上通过 Unsloth Desktop 或 llama.cpp 运行,GGUF 权重和指南已发布,开箱即用且无需额外模块或 MTP 文件。

    引用Z.ai@Zai_org

    Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: http://z.ai/blog/glm-5.3-flash Available now across all official platforms: Weights: http://huggingface.co/zai-org/GLM-5.3-Flash API: http://docs.z.ai/guides/llm/glm-5.3-flash Coding Plan: http://z.ai/subscribe ZCode: http://zcode.z.ai/en Chat: http://chat.z.ai AutoClaw: http://autoclaw.z.ai

    推荐理由:原文给出本地推理提速的具体配置和硬件门槛,读者可以直接复用到自己的 GLM-5.3-Flash 部署中。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)36

    NVIDIA PAIR 虚拟推理路由器:把本地网络上的可用算力扩展给 AI 智能体

    NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。

9月3日周四
  1. Hugging Face:Blog(RSS)63

    Hugging Face 教程:用 TRL 对 LFM2.5-350M 做 100 步 GRPO 微调提升结构化输出

    Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。

    推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。

9月2日周三
  1. Microsoft:Official Blog(RSS)46

    微软:AI 基础设施的“良率”命题——从算力投入转向有用智能产出

    微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。

  2. SemiAnalysis 长文 RSS(RSS)64

    SemiAnalysis 深度分析韩国万亿美元主权 AI 投资:Nvidia 受益、Hynix 承压

    SemiAnalysis 深度分析韩国主权 AI 战略:政府以锦标赛制推进“独立 AI 基础模型”项目,从 15 个联合体中选出 Naver Cloud、LG AI Research、SK Telecom、NC AI、Upstage 五队,首轮后淘汰 NC AI 并因使用阿里 Qwen 视觉与音频编码器取消 Naver 资格,递补 Motif Technologies。

9月1日周二