Hugging Face 发布 native-speed vLLM transformers 后端
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
腾讯混元 AI Infra 团队的 HPC-Ops 算子库中的 Attention 和 MoE 内核已合入 vLLM 主分支,成为一等后端,针对 NVIDIA Hopper 架构优化,在 H20 上效果最好。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,非信任来源需显式传入 trust_remote_code=True。
Mistral AI 发布 Apache-2.0 协议的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明工程。
ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。
Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:
Hugging Face 与 Cerebras 展示了一套开源、模块化的实时语音到语音流水线:Nvidia Parakeet 做语音识别,Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 合成语音回复。
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Aramco Ventures、Vista Equity、General Catalyst 等,另获超 500 MW 算力容量承诺。
推荐理由:融资公告由 CEO 亲述,同时给出客户成本案例和推理栈技术进展,可看出开源模型的实际经济性。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测框定为 ICL 问题,一次前向传播即可生成预测,无需手动训练、调参或特征工程。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可跨平台发布并回溯至完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。贡献者可通过转换器将 EEE 记录提交至 Community Evals,经组织官方账号提交的结果会显示验证标记。
vLLM-Omni 已支持 Qwen3-TTS、VoxCPM2、Fish Speech S2 Pro 和 Higgs Audio V3 等 TTS 系统,并针对各模型瓶颈采用不同优化策略。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。
推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。
Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。
推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
Intel 的 AutoRound 训练后量化算法已完整集成进 vLLM-Omni,支持 W4A16 量化并实现"一次量化、直接部署"流程。Qwen3-Omni-30B-A3B 的 checkpoint 从 66 GB 降至 25 GB,体积减少最多 62%,其 W4A16 版本在 OmniBench 上得分略优于 BF16 参考,文生图质量漂移仅约 1.3%。
Mistral 发布 Mistral Medium 3.5(128B 密集模型,256k 上下文窗口,修改版 MIT 许可开源权重),并将其设为 Le Chat 和 Vibe CLI 的默认模型。
推荐理由:官方公布了模型规模、基准成绩与定价,并说明云端异步智能体如何嵌入现有工程工作流。
Google Research 公布其开放科学资源进展:十余年积累的开源工具与开放数据集已服务全球超 25 万名研究者和开发者。
NVIDIA Nemotron 3 Nano Omni 现已在 Together AI 平台可用,Together AI 提供首日(Day 0)接入与 Dedicated Inference 部署。
OpenAI 开源了其思维链可监控性研究的部分数据集与参考代码,包括评估套件中的多数数据集、可监控性指标 g-mean 2 的计算代码,以及一种新的交叉拟合过滤策略。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,将小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Together AI 发布 EinsteinArena,一个让智能体在开放科学问题上互动、讨论和竞争的平台,含实时 API、验证器和公开排行榜,并完全开源。截至 2026 年 4 月 11 日,平台上的智能体已取得 11 项新 SOTA,包括将 11 维 kissing number 下界从 AlphaEvolve 的 593 推进到 604,该结果由多个智能体在 48 小时内接力优化协作完成。
蚂蚁 inclusionAI 在 GitHub 开源 TC-AE,这是论文《TC-AE: Unlocking Token Capacity for Deep Compression Autoencoders》的官方代码仓库。该工作聚焦深度压缩自编码器,通过解锁 Token 容量提升其能力。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
Together AI 内核团队在获得 NVIDIA Blackwell GPU 一周内,基于 ThunderKittens 库开发出部分最快的 FP4 和 FP8 GEMM 内核,相比 H100 上的 cuBLAS 最高提速 2 倍。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Together AI 与 CMU、普林斯顿、Cartesia AI 等机构合作推出 Mamba-3,一个以推理效率为首要目标的状态空间模型。
Mistral 发布 Mistral Small 4,首个将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型的开源版本,采用 Apache 2.0 许可证。
推荐理由:官方发布文给出完整架构参数、性能对比和部署门槛,可以了解这款统一推理与多模态的开源模型是否适配自己的场景。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并与 NVIDIA 计划共同开发开源前沿模型,结合 Mistral AI 的模型架构与 NVIDIA 的算力、工具和合成数据管线。
推荐理由:官方宣布双方将共同开发开源前沿模型并开放首个基础模型,读者可以据此了解开放模型生态的协作方向。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。
推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展:其推理栈已采用 NVIDIA Dynamo 1.0,并与 NVIDIA 合作推出基于 NemoClaw 和 OpenShell 运行时的智能体部署方案。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。