Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型
Hugging Face 为 transformers 加入 GGUF 模型支持,用户可从 Hub 选取 GGUF 检查点,通过 from_pretrained 传入 gguf_file 在本地生成。
推荐理由:Hugging Face 把 GGUF 量化模型接入 transformers,读者可据此判断本地推理工作流会如何变化。
Hugging Face 为 transformers 加入 GGUF 模型支持,用户可从 Hub 选取 GGUF 检查点,通过 from_pretrained 传入 gguf_file 在本地生成。
推荐理由:Hugging Face 把 GGUF 量化模型接入 transformers,读者可据此判断本地推理工作流会如何变化。
NVIDIA 在 Dynamo-Triton 中集成 TensorRT 多设备推理,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 推理优化。该能力自 TensorRT 11.0 起获得完整支持,用于应对生成式 AI 超出单 GPU 的算力与显存需求。
SemiAnalysis 长文拆解 MoE 推理的计算与数据搬运,指出 MoE 不只增加参数量,更改变了每个 token 激活哪些张量、哪些数据必须就近放置,以及内存搬运、存储与调度如何影响有效吞吐。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计的相关要求。
NVIDIA 推出 Halos,称其为首个也是唯一一个面向物理 AI 的全栈安全系统,覆盖硬件、软件、AI 行为与部署验证各层。
埃及 AI 生态正从"潜力"走向生产级落地:NVIDIA Deep Learning Institute 在埃及的学习者规模一年内增长超十倍,非洲已宣布或上线四座 AI 工厂,另有 656 兆瓦新增算力在建。
感谢 @sgl_project 的 day-0 支持!🙌 SGLang-Diffusion 现已支持 Qwen-Image-2.1:文生图、多图编辑,以及透明 RGBA 输出。快来试试!🎨
Day-0 support for @Alibaba_Qwen’s Qwen-Image 2.1 is here in SGLang-Diffusion! 🖥️ Native precision on a single RTX 4090 24GB with CPU offload - 1024×1024 generation in 18.7s and image editing in 21.7s with 22.7 GiB peak GPU memory during requests. - On an RTX PRO 6000 96GB: 8.0s generation and 9.6s editing. 🎨 Text-to-image, multi-image editing, and transparent RGBA output—all with one checkpoint. ⚡ Native inference with TP/SP, LoRA, and OpenAI-compatible APIs. 40 denoising steps, one image per request, warmed HTTP latency including PNG output. No quantization. Cookbook and GPU-specific commands below 👇
vLLM 公布 Qwen3.8-2.4T 在 GB300 NVL72 集群上的 PD 分离部署结果:8K/1K 负载下高吞吐场景达每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常达 v0.23 的数十倍。v1 将单个 crate 拆为 workspace,引入无分配合并、bitcannon SIMD 分片、侵入式双向链表合并循环、线程本地词缓存和原生多线程并行。
Simon Willison 发布 llm-keys-ui 0.1,一个用于在不把 API key 粘贴进智能体会话的情况下配置密钥的插件。
「十字路口」编译 Chris Lu 对 YC 2026 夏季批次 236 家公司、470 位创始人的分析。91% 公司与 AI 相关,但模型以下的公司从春季批次的 8% 升至 20%,应用层从 55% 降至 39%;自主 Agent 公司占比从 45% 降至 33%。
NVIDIA 发布 AIPerf,用于对大规模 LLM 推理做基准测试,解决 curl 命令、手写 asyncio 脚本或一次性压测工具受单进程性能、Python GIL 并发上限等问题。该工具面向模型部署后的性能评估场景。
Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.
Introducing Unsloth Desktop 🦥 The first desktop app to run and train models locally. • Open-source. Runs on Mac, Windows and Linux • Supports MLX, diffusion image/video, audio, GGUF • Connect Claude Code and Codex to local LLMs • 50% more accurate, self-healing tool calls + sandboxed code exec • Works for CPU + multiGPU setups - NVIDIA, AMD, Intel, Mac • Train models 2× faster with 70% less VRAM • Private web search, deep research, RAG, MCP and exports (NVFP4, GGUF) • Use Unsloth’s OpenAI-compatible API and cloud models • Securely deploy LLMs remotely and access anywhere Unsloth Desktop is now available on http://unsloth.ai and GitHub. GitHub: https://github.com/unslothai/unsloth Blog and Guide: https://unsloth.ai/docs/desktop
推荐理由:原文给出免配置的本地训练运行入口和适用硬件范围,读者可以据此评估是否替换现有部署流程。
唐杰发文复盘,GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量只用两周,端到端吞吐达 3.2 倍,大量工作由 GLM-5.3 驱动的 Infra Agent 完成。
We’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure
推荐理由:作者复盘了 GLM-5.3 智能体优化推理基础设施的两周过程,提出了可迁移的分层密集反馈方法与工程师角色转变的判断。
GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为超过 80 万行生产级 Rust,AI 智能体编写了大部分代码,跨 128 个 PR 增量合入 main,性能提升数个数量级,主要由一名开发者几个月内完成。
推荐理由:GitHub Copilot 运行时迁移 Rust 的完整复盘,给出智能体并行协作、提示缓存与评审流程的可迁移工程方法。
Google Cloud 宣布 M4N 虚拟机系列在 Compute Engine 正式可用,面向 I/O 密集型高内存负载,提供同类高内存实例中最高的单核 IOPS 和吞吐,Oracle 数据库 TCO 降低超 20%。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7x,在 DeepSeek-R1 上达 2.5x,分别使用 vLLM 搭配 NVIDIA Dynamo 和 TensorRT-LLM。
Emerald AI、Google 与 NVIDIA 宣布发起 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。联盟主张技术中立、按性能衡量灵活性,制定并网前的响应义务、统一技术要求和更快并网通道,汇聚 AI 平台、数据中心、电力公司与电网运营商等价值链成员,以提升现有电网容量利用、缩短 AI 设施并网时间。
Together AI 发布从闭源模型迁移到开源模型的指南,称采用托管服务可将迁移周期从数月到数年缩短为数周到数月。方法分发现、评估、适配、决策、生产五步,核心是用真实流量回放而非通用基准做评估,并按系统提示词、推理参数、上下文工程、微调四个杠杆迭代适配;文中提到部分客户迁移后成本最多降低 70%,可用 10% 流量的金丝雀部署开始上线。
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
SemiAnalysis 分析认为数据中心暂停令严重拖慢美国建设的说法不准确。其模型预测 2027 年美国新增 38GW IT 容量,是 2026 年的两倍以上;约 300 个地方暂停令中实际被直接延迟的容量仅约 2.3GW,其中纽约州约 0.8GW、地方限制约 1,525MW,主要由俄亥俄 AWS 园区等三个项目构成。
NVIDIA 在 AI Infra Summit 上公布 DSX MaxLPS 的首个部署验证结果:Lambda 在五机架 19 节点 HGX B200 集群上,用与 16 节点满功耗相同的电力预算跑出 24% 的集群 token 吞吐提升,从约 400 万 tokens/秒升至 500 万,每瓦性能提升 23%。
NVIDIA 详解 NVLink 6 如何为大规模 AI 工厂提供多层弹性。在超大规模 AI 训练中,集群内每块 GPU 每秒需在数千次集合通信操作中同步梯度;推理阶段非计划停机则直接减少请求处理总量,限制营收。
NVIDIA Groq 3 LPX 通过确定性执行,在 NVIDIA Vera Rubin 平台上实现高交互推理的能效提升。该方案针对 AI 工厂的功耗约束,以每瓦性能而非原始吞吐量作为衡量 AI 平台价值的核心指标。Vera Rubin 平台正是为在有限功耗预算内最大化输出而设计。
Gergely Orosz 采访 OpenAI 七位工程师与工程负责人,报道 Codex 和 ChatGPT Work 如何成为公司内部几乎所有工作的支柱。
NVIDIA 技术博客介绍如何用 NVIDIA FLARE 将联邦学习从单服务器、少量客户端的简单部署扩展到跨 Docker、Kubernetes 和 Slurm 的共享基础设施。随着项目规模增长,挑战从运行算法转向运营共享基础设施:按需分配 GPU、隔离多个研究任务,并让每个参与机构保留对自身数据的控制权。
Novita AI 开源了 Chord,一个面向 BF16 激活、INT4 权重与 group-32 scale 的 W4A16 MoE CUDA 算子,专为 Kimi K2.x 服务形态打造。
vLLM 团队借助 Speculators 训练库,为 2.8T 参数的 Kimi K3 训练出 DSpark 推测解码器,在数学推理上把单流交互速度从约 110 提升到约 435 tok/s/user,并发负载下同等交互性时输出吞吐最高提升约 3.5 倍。
SemiAnalysis 在自建 AgentX 智能体推理基准上发布 Rubin 平台首批经核验的实测结果,称在 170 TPS、自有 TCO 口径下,Vera Rubin NVL72 相比 GB300 Dynamo TRTLLM 实现约 67 倍的总吞吐;在更常见的 60-100 TPS 区间为 1.4-3 倍。
SemiAnalysis 长文分析机器人模型的大脑应放在机上还是数据中心。当前通用机器人模型仅数十亿参数(π0.7 50亿、DreamZero 140亿),远小于 LLM,受实时性、成本、数据和网络约束;Jetson Thor 约为 GB200 的 1/10 FLOPs。
MIT 研究人员提出 HardFlow,一种在部署阶段即可用于预训练生成模型的即插即用方法,让模型在机器人操作、迷宫导航和文本引导图像编辑等任务中实现完美的硬约束满足,同时解的质量持续优于基线方法。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.6-35B-A3B 之上的轻量流式安全防护探针,复用基座模型隐藏状态在每个 token 上打分查询意图、回复不安全性与幻觉风险。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3.5-4B 之上的内在流式护栏探针,复用基座模型隐藏状态在每个 token 上输出查询意图、响应不安全度和幻觉风险评分。
蚂蚁 inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的轻量流式安全探针,复用基座模型隐藏状态在每个 token 上评分查询意图、回复不安全性和幻觉风险。
vime 联合 RL-Kernel 在 AMD Instinct MI300X 上实现训练与 rollout 的逐位数值一致性,8× MI300X 跑 Qwen3-8B GRPO 实验连续 200 步 mismatch_count = 0、max_abs_diff = 0。
SemiAnalysis 长文论证下一代加速器正从 12-hi 转向 8-hi 乃至 4-hi HBM 堆叠,Nvidia Rubin Ultra 将单 GPU HBM 从 288GB 降至 192GB。