Hugging Face 发布 native-speed vLLM transformers 后端
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并预加载所选模型。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
腾讯混元 AI Infra 团队的 HPC-Ops 算子库中的 Attention 和 MoE 内核已合入 vLLM 主分支,成为一等后端,针对 NVIDIA Hopper 架构优化,在 H20 上效果最好。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,非信任来源需显式传入 trust_remote_code=True。
Hugging Face 上线 pi-local-router,这是一个 Pi 扩展,用于在 llama.cpp 与 Hugging Face Inference Providers 之间进行路由。该仓库以 huggingface/pi-local-router 名义发布,目前仅披露了扩展的用途,未公布参数、性能或可用性细节。
Hugging Face 与 Cerebras 展示了一套开源、模块化的实时语音到语音流水线:Nvidia Parakeet 做语音识别,Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 合成语音回复。
vLLM-Omni 将 Qwen3-Omni 拆成 Thinker、Talker、Code2Wav 三阶段流水线,并通过 OpenAI 兼容的 /v1/chat/completions 提供文本与语音生成。
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
Nous Research 在 GitHub 开源 speculators,一个用于构建、评估和存储 LLM 推理投机解码算法的统一库,面向 vLLM。该库将投机解码算法的开发、评测与存储整合到同一套工具中。
vLLM Semantic Router 团队推出 Micro-Agent 能力,把单次模型 API 调用变成服务层内有界的多模型协作,用户仍只调用一个模型名 vllm-sr/auto。
Sebastian Raschka 发布长篇教程,讲解如何用 Ollama 服务 Qwen3.6 35B-A3B 等开源权重模型,并接入 Qwen Code、Codex、Claude Code 三种编码 agent harness,评测代码在 https://github.com/rasbt/local-coding-agent-evals。
Google 宣布将 Multi-Token Prediction(MTP)改造性地部署到已冻结的 Gemini Nano v3 模型上,并已向 Pixel 9 和 10 系列推送。
OpenAI 在 GitHub 上线官方 Terraform provider,用于通过基础设施即代码方式管理 OpenAI 资源。该仓库名为 openai/terraform-provider-openai,目前仅有一句简介说明其为 OpenAI 官方 Terraform provider,未披露具体支持的资源类型或版本号。
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。
MIT 与微软 Azure 研究人员提出智能体工作流优化系统 Murakkab,开发者只需用自然语言描述意图,系统即自动选择模型与工具、并行调度并动态分配云端硬件资源。
vLLM-Omni 已支持 Qwen3-TTS、VoxCPM2、Fish Speech S2 Pro 和 Higgs Audio V3 等 TTS 系统,并针对各模型瓶颈采用不同优化策略。
Together AI 发布多GPU kernel生成基准 ParallelKernelBench(PKB),含87道源自 Megatron-LM、DeepSpeed、TensorRT-LLM 等真实代码库的问题,任务是将 PyTorch + NCCL 参考实现替换为直接通过 NVLink 通信的 CUDA kernel。
Hugging Face 在 GitHub 新建 huggingface/sagemaker-python-sdk 仓库,这是一个用于在 Amazon SageMaker 上训练和部署机器学习模型的库。
vLLM Semantic Router 团队发布 Fusion API,让一条路由可以运行多个面板模型、由 judge 模型分析共识与分歧并合成单个回答。
Hugging Face 在 GitHub 发布 huggingface/sandbox-server 新仓库,为 'hf sandbox' 提供沙盒内静态服务器,支持命令执行、文件传输和端口转发,运行于 Hugging Face Jobs。
vLLM 宣布对 MiniMax M3 家族的 day-0 支持,涵盖 MiniMaxAI/MiniMax-M3 与 MiniMax-M3-MXFP8 两个检查点,支持 1M token 上下文和图像、视频多模态输入。
推荐理由:vLLM 团队自己拆解了 day-0 支持背后的 MSA 内核、缓存和部署细节,读者可以按需套用其部署配方。
Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。
推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。
vLLM 社区发布开源 RL 后训练框架 vime(Apache 2.0),基于 slime 的训练栈和数据生成设计,将 Megatron 训练与 vLLM 推理接入同一条解耦管线。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
vLLM 联合 Red Hat 和 Andrew Ng 的 DeepLearning.AI 推出课程《Fast & Efficient LLM Inference with vLLM》,现已免费上线,时长约 1.5 小时,含 9 节视频和 3 个 JupyterLab 动手实验。
Intel 的 AutoRound 训练后量化算法已完整集成进 vLLM-Omni,支持 W4A16 量化并实现"一次量化、直接部署"流程。Qwen3-Omni-30B-A3B 的 checkpoint 从 66 GB 降至 25 GB,体积减少最多 62%,其 W4A16 版本在 OmniBench 上得分略优于 BF16 参考,文生图质量漂移仅约 1.3%。
vLLM Semantic Router 新增会话感知智能体路由(SAAR),在语义路由之上加入路由器会话记忆、工具循环硬锁、安全重置边界、前缀缓存感知的切换定价与可回放轨迹。在 21,600 个确定性轮次中,SAAR 将模型切换减少 79.29%,消除 3,836 次不安全切换,物理模型成本估算降低 78.71%;在 2,896 个 AMD ROCm 实时请求中保持会话连续性,未观察到违规。
Together AI 详细解析其为 MiniMax M3 做的生产级推理优化,M3 支持 1M token 上下文窗口、原生多模态和 MiniMax Sparse Attention(MSA)架构,MSA 使 prefill 提速超过 9x、decode 提速超过 15x。
小米 MiMo-V2.5 与 MiMo-V2.5-Pro 基于 Hybrid SWA 架构,将 KVCache 存储压缩至 Full Attention 的约 1/7。
Together AI 通过 TensorRT 多 profile 编译、GPU 端条件分支和减少 CPU 拷贝,打造出全球最快的语音转文字技术栈。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的整合 AI 栈,与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产,并收购 Emmi 补充科学能力。Vibe 智能体升级为统一智能体,可处理收件箱与日历、深度研究、编码到合并 PR 等长程多步任务;Les Ulis 新的 10 MW 推理数据中心计划于 Q3 2026 启用,以增强算力控制与安全。
MiMo 宣布 API 降价,Input (Cache Hit) 最高降 99%,Input (Cache Miss) 和 Output 降 60%-80%。
Hugging Face 发布新仓库 huggingface/jobs-actions,支持在 Hugging Face Jobs 上运行 GitHub Actions。该工具将 GitHub 的 CI/CD 工作流接入 Hugging Face 的计算任务环境。
Hugging Face 推出 aokit,一个面向 PyTorch 的轻量级提前编译(ahead-of-time compilation)工具包。该工具包已在 HF Spaces 上结合 ZeroGPU 的演示中被大量使用。
Hugging Face 在 GitHub 新建 endpoints-custom-routers 仓库,提供兼容 HF Endpoints 自定义路由功能的实现,内置多种负载均衡策略。该仓库面向 Endpoints 的自定义路由场景,具体策略种类与可用性原文未披露。
Mistral AI 宣布达成最终协议,收购奥地利 Physics AI 公司 Emmi AI,以强化面向工业企业的 AI 转型能力。Emmi AI 团队超过 30 名研究人员和工程师,5 月加入 Mistral 的 Science 与 Applied AI 团队;其大工程模型可用于实时仿真、数字孪生等场景,双方将共同构建面向工程师的 AI 智能体。