Multiverse Computing 提出 Quantization-Aware Healing:60B 4-bit 模型在 9 项基准中 7 项反超全精度原版
Multiverse Computing 发布论文 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型做 KL 蒸馏。
Multiverse Computing 发布论文 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型做 KL 蒸馏。
Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。
Meta 发布 MetaRoCE,一个为 AI 工作负载在商品化以太网上从零设计的 RDMA 传输协议,将通过 OCP 开放规范、参考软件实现和合规测试套件。
Meta 在工程博客发布自研训练芯片 MTIA 300,这是 MTIA 家族中首款针对推荐与排序模型训练优化的加速器。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络已成为首要性能瓶颈。NVIDIA 在技术博客中解析 Spectrum-X Ethernet 如何针对这一瓶颈改写传统以太网的规则。
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配可扩展该平台的长上下文交互能力。Vera Rubin NVL72 面向从小型到大型、开源与闭源的最广泛 AI 工作负载,兼顾高吞吐与交互性。
NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。
vLLM 官方博客解析投机解码的 draft-and-verify 机制,对比 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种起草方法的差异。
vLLM 推出基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 个 8xH100 节点(32 训练、16 推理)上以 BF16 完成 Kimi K2 的权重传输仅需 7.53 秒。
NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
SkyRL 提出 IsoExec,通过跨框架统一执行抽象消除 RL 训练与推理引擎之间的数值不匹配,包含执行契约与对齐的批不变内核两部分,已在 SkyRL 中结合 vLLM 和 Megatron 实现。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。
推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。
一个约束感知 GPU 分配器在相同硬件与负载下,相比 FIFO 调度器将 GPU 利用率最多提升 33 个百分点,优先级加权产出在全部场景中上升,最高增幅 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均增长 52%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
Together AI 在平台上推出端点级 LLM A/B 测试功能,让团队用真实用户流量比较候选模型与现网模型,而非只看 benchmark 或影子流量。实验挂在端点上,须有一个 control 和一至多个 variant,variant 部署权重须为 0,百分比为固定流量份额且与副本数无关。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。
推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。
vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。
推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
Moonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway
NVIDIA 发布 Magpie Multilingual TTS 开放权重模型(364M 参数),支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,可在自有基础设施部署并微调。
NVIDIA 与 vLLM 团队宣布 Day-0 支持 Nemotron 3.5 Lightning,这是一个面向常驻智能体的开源混合 MoE 模型,总参数 30B、每 token 激活 3B,上下文最长 1M token,从 Nemotron 3 Ultra 蒸馏而来。
Meta 发布 30B 参数多模态开源模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,主打本地智能体用途如编码、文档分析和个人助理。
推荐理由:发布方提供了架构细节、完整基准对比和多种部署路径,读者可以据此评估它在本地智能体场景的适配性。
vLLM 详解 Decode Context Parallelism(DCP):将 KV cache 沿序列维度切分到各 GPU,而非像 TP 那样按注意力头切分,从而突破 GQA 和 MLA 模型下 KV cache 复制导致的内存瓶颈。
vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。
Baseten 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
企业 AI 的下一个真正约束是 GPU 利用率而非模型智能,闲置 GPU 与停飞飞机一样按日历小时累积成本、却只按计算小时产生产出。
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。
vLLM 联合 PyTorch、oneDNN 和 KleidiAI 社区完成 Arm CPU 服务栈的上游优化,新增预构建 wheel 与 Docker 镜像、chunked prefill、前缀缓存、INT8 W8A8/W4A8 推理,并支持 GPT-OSS、Whisper 和 Qwen 3.5/3.6。
Together AI 联合佐治亚理工、UIUC 和 CMU 推出 ThunderAgent,一种高吞吐智能体推理调度系统,论文被 ICML 2026 接收为 Spotlight。
vLLM 与 Speculators 为 P-EAGLE、DFlash、DSpark 三种并行草稿(parallel drafting)算法提供完整开源支持,相关模型已发布在 RedHatAI HuggingFace Hub 的 Speculators Collection 中。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。