Prime Intellect Compute 算力交易平台正式全面公开
Prime Intellect 宣布其全球 GPU 资源聚合与调度平台 Prime Intellect Compute 全面公开,目标是打造算力交易所。
Prime Intellect 宣布其全球 GPU 资源聚合与调度平台 Prime Intellect Compute 全面公开,目标是打造算力交易所。
Prime Intellect 发布 OpenDiLoCo,一个对 DeepMind DiLoCo 方法的开源实现与扩展,代码见 https://github.com/PrimeIntellect-ai/OpenDiLoCo,论文见 https://arxiv.org/abs/2407.07852。
Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。
推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。
Prime Intellect 推出 TOPLOC,一种用于无信任可验证推理的局部敏感哈希方法,通过对最后隐藏状态张量的 top-k 值进行多项式编码生成证明,再由验证方重算校验。
Prime Intellect 发布面向消费级 GPU 和公网 100ms 延迟的分布式推理栈预览,并开源三个代码库 PRIME-IROH、PRIME-VLLM 和 PRIME-PIPELINE。
Prime Intellect 发布 PCCL(Prime Collective Communications Library),一个为跨全球分布式训练构建的容错集合通信库。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布 Environments Hub,一个开放的社区平台,用于创建、分享和复用强化学习环境与评测,上周 private beta 已有超过 30 名研究者和公司贡献环境,现向所有人开放。
Prime Intellect 发布 Lab,一个面向智能体后训练的全栈平台,将 Environments Hub 与 Hosted Training、Hosted Evaluations 整合,覆盖从大规模智能体 RL 到推理评估的完整流程。
推荐理由:原文给出了平台组成、已完成的训练规模和定价部署细节,读者可以据此判断它能否替代自建训练基础设施。
Prime Intellect 公布与 NVIDIA 的合作细节,用 NVIDIA Blackwell、即将推出的 Vera Rubin 机架级系统和 Dynamo 推理层支撑其开放超级智能栈。
Prime Intellect 与 Browserbase 合作推出 BrowserEnv,用 Browserbase 的可扩展浏览器基础设施训练浏览器和计算机使用 Agent,该基础设施曾支持 Microsoft Fara-7B 和 Google Gemini 2.5 CUA 的工作。
Prime Intellect 宣布其自我改进智能体训练平台 Lab 结束 beta,正式全面开放。平台以环境为核心抽象,提供托管训练、托管评估、Environments Hub、adapter 部署和 Prime Inference 等组件,覆盖评估、训练、检查、部署的完整循环;beta 期间数百名用户已运行超 10,000 个训练任务。
Prime Intellect Lab 为 NVIDIA Nemotron 3 Ultra 提供 day-0 后训练支持,该模型为 550B 参数 MoE、55B 激活参数,在 RULER@1M 上达 95%、SWE-bench Verified 达 65–70.4%。
Prime Intellect 发布 prime-rl 0.6.0,可在 28 个 H200 节点上以最高 131k 序列长度、sub-5 分钟 step 时间和 256 rollouts 批大小训练 GLM-5 等万亿参数 MoE 模型执行 SWE 任务。
Prime Intellect 发布 verifiers 0.2.0 预览版,以 verifiers.v1 命名空间预览重写后的核心,将环境拆解为 taskset、harness 和 runtime 三部分,支持任意 taskset 搭配兼容 harness 运行。
DeepSeek 与华为合作,为昇腾 AI 芯片发布 TileLang 等开源编程工具,包括计算库和芯片间数据搬运库,TileLang 源自北京大学研究者,现已成为 DeepSeek 做 AGI 研究的主要工具。
METR 发布对开源权重模型 DeepSeek-V3 的评估报告(2025年2月12日),未发现其具备超越 Claude 3.5 Sonnet 和 GPT-4o 等现有模型的危险自主能力。
SGLang 团队推出 Mini-SGLang,一个仅 5k 行 Python 代码的轻量级 LLM 推理框架,源自 SGLang 项目,旨在降低现代推理系统的学习门槛并支持快速研究原型。
SGLang 团队与蚂蚁集团 DeepXPU 团队宣布在 SGLang 内实现 Diffusion LLM(dLLM)框架,并 Day-0 支持 LLaDA 2.0。
推荐理由:原文给出 SGLang 支持 Block Diffusion LLM 的实现思路和实测吞吐数据,读者可据此评估 dLLM 推理方案的可用性。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。
SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
Novita AI 发布基于 SGLang 部署 GLM4-MoE 模型的端到端推理优化方案,TTFT 最高降低 65%,agentic coding 负载下 TPOT 提升 22%,结果在 H200 集群 TP8、FP8 配置下验证。
SGLang RL 团队联合 InfiXAI、蚂蚁 Asystem & AQ Infra、slime、RadixArk 团队,在 slime 框架上落地了 INT4 QAT 端到端流程,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性与稳定性。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 与 Qwen3-VL-235B 完成极致延迟优化。
SGLang-Diffusion 团队公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE 与多请求服务稳定性。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。
NVIDIA 与 SGLang 团队公布在 GB300 NVL72 上优化 DeepSeek R1-NVFP4 长上下文推理的进展,128K/8K 场景下 SGLang 达到 226.2 TPS/GPU,较 GB200 提升 1.53 倍。
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。
LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。
推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,作为传统 NCCL broadcast 的补充,兼容所有主流开源模型。
AMD 与 SGLang 团队联合发布博客,展示基于 SGLang 和 MoRI 通信库的 DeepSeek-R1 分离式推理在 AMD Instinct MI355X 上实现有竞争力的 TCO,结果由 SemiAnalysis 的 InferenceX 基准平台验证。
Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。