蚂蚁 inclusionAI 发布基于 Qwen3.5-4B 的流式护栏探针 SingProbe
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3.5-4B 之上的内在流式护栏探针,复用基座模型隐藏状态在每个 token 上输出查询意图、响应不安全度和幻觉风险评分。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3.5-4B 之上的内在流式护栏探针,复用基座模型隐藏状态在每个 token 上输出查询意图、响应不安全度和幻觉风险评分。
蚂蚁 inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的轻量流式安全探针,复用基座模型隐藏状态在每个 token 上评分查询意图、回复不安全性和幻觉风险。
vime 联合 RL-Kernel 在 AMD Instinct MI300X 上实现训练与 rollout 的逐位数值一致性,8× MI300X 跑 Qwen3-8B GRPO 实验连续 200 步 mismatch_count = 0、max_abs_diff = 0。
vLLM 通过自适应投机 token 预算、KDA 前缀检查点、零拷贝混合 KDA 批次和延迟 MXFP4 收尾等优化,将 Kimi K3 服务性能从 v0.27.1 提升至 main:延迟降低 56%–60%,吞吐量提升 2.2–2.8 倍,TTFT 降低 72%–85%(并发 1、4、16,8K/1K 负载,TP8)。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。该平台用于满足 ChatGPT 在线存储的规模化需求。
NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。
NVIDIA BioNeMo Inference Runtime(BioIR)可在 NVIDIA GPU 上加速受支持的生物分子结构预测模型,同时保留熟悉的 PyTorch 工作流。它通过优化 kernel 并在适用场景下使用 CUDA Graphs 提升模型速度,面向蛋白质组规模的高通量结构预测任务。
推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。
NVIDIA 正用 Nemotron 与 Palantir Foundry 把供应链经验编码化,其供应链绩效以"wafer-out 到 first token"衡量,分为 time-to-rack 与 time-to-token 两段。time-to-rack 覆盖硅片离开晶圆厂到组装系统抵达数据中心;time-to-token 则涵盖供电、冷却、网络与软件栈。
Together AI 的 kernels 团队为 NVIDIA Vera Rubin NVL72 平台在 ThunderKittens 中新增了 NVFP4 与 FP8 GEMM 支持。
Together AI 宣布 Together GPU Clusters 推出 preemptible compute 公开预览,覆盖所有区域的 Kubernetes 集群。
vLLM 官方博客介绍其分层 KV cache 卸载框架,自 v0.22 起可用,将逐出的 KV 数据保存到主机内存、文件系统、对象存储或远程节点,避免重新计算。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 新支持:只训练 LoRA 适配器并仅同步适配器(rank-1 仅几 MB)到 vLLM,训练器与 vLLM 副本作为独立 HF Jobs 运行在分开的机器上,通过挂载 Storage Bucket 共享适配器路径,无需 NCCL 或共享本地盘。
MiniMax M3 在 AMD Instinct MI355X 上的 vLLM 服务性能大幅提升:SemiAnalysis InferenceX 基准显示,并发 32 时 MXFP8 标准服务从 109.1 升至 342.4 output tokens/s/GPU(3.14×),中位 TTFT 从 1.46 秒降至 0.67 秒。
NVIDIA 技术博客解析了 Encode-Prefill-Decode(EPD)分离架构这一多模态模型推理优化技术,它将视觉编码器阶段与 prefill、decode 阶段分离。该方案对图像密集提示词、中短输出和量化 MoE 模型最有效,配合 NVIDIA Dynamo 可实现最高 5 倍加速。
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,此前 CUDA 应用在 Arm 平台仅通过 Linux 获得支持。该版本还增强了对共享 GPU 的控制能力,并延续每个版本在功能与性能上的改进。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。
2026 年 9 月,NVIDIA 宣布投入 Rust 原生 GPU 编程,推出 CUDA Rust,提供两条编写 GPU kernel 的路线。CUDA C++ 和 CUDA Python 仍是成熟的企业级工具链,NVIDIA 将持续把 CUDA Rust 发展和成熟至 2027 年及以后,以应对涵盖推理引擎、服务基础设施、驱动和 Agent runtime 的 AI 系统层需求。
vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。
推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
vLLM 推出 TT Plugin,通过 out-of-tree 平台插件机制将 Tenstorrent 加速器接入 vLLM,安装后只要 ttnn 可导入即自动注册为 vLLM 平台,OpenAI 兼容 API 与请求格式保持不变。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可在同一功耗范围内为前沿模型带来最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把不同模型和工具调度到 GPU、CPU 及专用加速器上,并将编排延伸至数据中心层面,对开发者只暴露单一推理 API。其客户已包括一家前沿实验室和一家超大规模云厂商。
NVIDIA 技术博客介绍如何在联邦 Kubernetes 与 AI 平台间传递用户身份。现代 AI 平台中用户从中央门户进入、打开受治理数据集、启动 notebook 并调用另一集群中的助手,身份在每一步都跨越控制面与数据面边界,传统单点登录在此失效。
Meta 推出 ZGateway,作为统一 ZippyDB 客户端流量的无状态代理层,承载约 40% 的 ZippyDB 流量,可处理超过 10 亿次/秒的操作,平均用例仅增加约 6% 计算开销。
NVIDIA 推出 PAIR 虚拟推理路由器,可将本地网络中的可用算力扩展给 AI 智能体使用。该方案面向多智能体协作场景:主智能体把复杂任务拆解后分派给专用子智能体,用户也会同时运行多个智能体会话。这种广度优先的方式可提升任务完成速度。
Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。
推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。
NVIDIA 技术博客发布 CUDA 优化实战教程,以一个 RGB 转灰度并计算分块的图像处理管线为例,通过六个增量步骤演示如何用 Compute Sanitizer 和 CCCL 新索引 API 排查越界错误。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理。文章给出五条指南,用于在帕累托前沿上选择草稿长度与草稿机制。
微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。
NVIDIA 技术博客探讨企业如何为 AI 推理负载合理配置 GPU 并优化总体拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 资源规划变得困难。
vLLM-Omni 团队发布 MiniMax H3 服务优化详解,先对完整管线做无损系统级优化,相比 Diffusers 将完整响应延迟降低 30.8%(1.445x)。
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 Apache-2.0 许可的 WebGPU 内核,每个内核以独立版本化仓库形式发布在 Hub 上,包含 manifest、正确性测试、基准案例和 WGSL 着色器模板。
NVIDIA TensorRT Model Connect 提供开源参考实现集合,让开发者用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理与运行时代码编写。
Google DeepMind 推出全球首个针对专有前沿模型的双盲评估,将外部评估限制在密码学安全的"盒子"中,防止模型提前接触测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用机密基准测试一个 Gemini Flash Lite 模型。
NVIDIA 通过 NVLink Fusion 将 NVHBM 引入下一代 AI 基础设施,面向超大规模厂商和 AI 原生公司自研的 XPU 加速器。随着模型规模与推理负载增长,XPU 规模化部署需要高带宽内存(HBM)持续供给算力,并需要足够的封装与硅片面积容纳更多计算单元。
NVIDIA Dynamo 预览版新增影子引擎恢复功能,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 NVIDIA CUDA graphs 的冷启动路径。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
NVIDIA 技术博客宣布 CUDA Python 1.0,主打稳定 API、统一基础和对完整平台的访问。文章指出此前 Python 开发者要用 GPU 只有两条现实路径:学 CUDA C++ 写扩展并维护 Python 绑定,或依赖 PyTorch、CuPy、RAPIDS 等上层库,而后者虽有局限却推动了 Python GPU 生态的繁荣。