Prime Intellect 发布 INTELLECT-2:首个通过全球分布式强化学习训练的 32B 模型
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
Prime Intellect 发布关于递归语言模型(RLM)的研究文章,认为它是 2026 年应对超长上下文的范式。RLM 让模型通过持久 Python REPL 检查和转换输入数据,并把任务委派给可调用工具、可并行的 sub-LLM,而不直接摘要上下文。
Prime Intellect 发布 prime-rl 0.6.0,可在 28 个 H200 节点上以最高 131k 序列长度、sub-5 分钟 step 时间和 256 rollouts 批大小训练 GLM-5 等万亿参数 MoE 模型执行 SWE 任务。
Prime Intellect 宣布完成 $130M A 轮融资,由 Radical Ventures 领投,NVIDIA Ventures、Intel Capital、Dell Technologies Capital 等参投,总融资超过 $150M。
METR 于 2024 年 9 月 12 日发布对 OpenAI o1-mini 和 o1-preview 的初步评估:在通用自主任务套件上两者未超过已评估的最佳公开模型 Claude 3.5 Sonnet,但 METR 表示无法在有限的评估时间内自信地给出能力上界。
METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。
MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。
推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。
METR 发布对 DeepSeek-R1 的危险自主能力评测,未发现其具备超出 Claude 3.5 Sonnet、GPT-4o 等现有模型的危险能力。
METR 提出用任务长度(按人类专家耗时衡量)来度量 AI 能力,发现 6 年来模型能以 50% 可靠性自主完成的任务长度呈指数增长,翻倍时间约 7 个月。当前模型对耗时 4 分钟以内任务成功率近 100%,超过约 4 小时则不足 10%;Claude 3.7 Sonnet 的 50% 成功率时间视界约一小时。
推荐理由:METR 用人类任务时长衡量智能体能力,给出 6 年约 7 个月翻倍的指数趋势及其外推含义。
METR 对 Claude 3.7 Sonnet 开展初步评估,未发现危险水平的自主能力证据,但模型在提供真实分数信息的 5 项 RE-Bench AI 研发任务上表现出较强能力。
METR 研究者 Vincent Cheng 与 Thomas Kwa 复现了 Google DeepMind 论文第 5 节,用 Claude 4 Sonnet。
METR 研究者发布关于 QA 设置下监控能力(monitorability)的早期研究笔记,测试智能体如何在完成主任务(GPQA 生物题)的同时隐秘完成副任务(数学题)而不被 LLM 监控器发现。
METR 对 DeepSeek 和 Qwen 共六个模型进行初步评估,发现 2025 年年中的 DeepSeek 模型自主能力水平与 2024 年末的前沿模型相当。
METR 基于其时间视野论文,用 logistic 模型分析 GPQA、MATH、Mock AIME、LiveCodeBench、OSWorld、WebArena、Tesla FSD 等 9 个基准,发现各领域普遍呈指数或略超指数增长。
METR 发布研究,复现并改进 Anthropic 的 CoT 忠实性评估,测试 Claude Sonnet 3.7、Claude Opus 4 和 Qwen 3 235B。
SGLang 团队与蚂蚁集团 DeepXPU 团队宣布在 SGLang 内实现 Diffusion LLM(dLLM)框架,并 Day-0 支持 LLaDA 2.0。
推荐理由:原文给出 SGLang 支持 Block Diffusion LLM 的实现思路和实测吞吐数据,读者可据此评估 dLLM 推理方案的可用性。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
METR 研究者进行了一场 2 小时桌面推演,三名研究员模拟拥有约 200 小时时长 AI(预计 12-18 个月后的水平),其他条件保持在 2026 年 2 月。参与者估计相比现有模型约有 3-5 倍提升,并发现优先级排序、组织管理和人类反馈成为主要瓶颈,长任务适合安排在夜间由智能体完成。
METR 发布时间视界估计新版本 TH1.1,任务套件从 170 个增至 228 个(8 小时以上长任务从 14 增至 31 个),评估基础设施从自研 Vivaria 迁移到 UK AI Security Institute 开发的 Inspect,并重新估计了 14 个模型的时间视界。
METR 对 GPT-OSS-20B、GPT-OSS-120B、Qwen-3-8B、Qwen-3-32B 四个推理模型做少量指令跟随微调(240 条样本、约 100K-300K tokens),在分布外任务集 CoTControl 上的 CoT 可控性从平均 2.9% 升至 8.8%。
Novita AI 发布基于 SGLang 部署 GLM4-MoE 模型的端到端推理优化方案,TTFT 最高降低 65%,agentic coding 负载下 TPOT 提升 22%,结果在 H200 集群 TP8、FP8 配置下验证。
METR 提出"支出视界"指标,用人类与智能体在优化问题上成本收益曲线的交点来量化智能体优化能力。以 NanoGPT speedrun 为例,人类每提升 1% 训练速度约需 16 小时劳动。
NVIDIA 与 SGLang 团队公布在 GB300 NVL72 上优化 DeepSeek R1-NVFP4 长上下文推理的进展,128K/8K 场景下 SGLang 达到 226.2 TPS/GPU,较 GB200 提升 1.53 倍。
METR 研究人员检视漏洞、数学和算法发现的公开时间序列,判断 LLM 是否加速了整体发现率。漏洞发现明显加速,如 cURL CVE 从 2025 年的 9 个增至 2026 年 6 月 24 日前的 36 个(其中 15 个标注 AI);数学发现有所加速但难以客观衡量,arXiv 数学提交部分领域 12 个月内翻倍;算法优化未见明显加速。
推荐理由:原文汇总多个公开时间序列,比较 AI 对不同领域发现速度的影响,提供了可核查的数据和方法。
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
SGLang 和 Miles 宣布对 NVIDIA Nemotron 3 Ultra 提供 Day-0 支持。该模型为开源 MoE 混合 Transformer-Mamba 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 权重,面向长程自主智能体优化。
推荐理由:原文给出架构、部署配置和 RL 训练细节,读者可以据此评估该模型在长程智能体场景的可用性。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
Z Lab、Modal 与 SGLang 联合发布 DFlash 推测解码模型及 SGLang 新默认 Spec V2 引擎,为 Qwen 3.5 397B-A17B 提供更低延迟的 LLM 推理服务。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms,降幅 53%。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
SGLang 团队为 GLM-5.2 NVFP4 检查点优化推理,在 8xB300(bs=1)上实现超过 500 TPS,两周内完成。默认开启的 Spec V2 重叠调度带来 11% 端到端 TPS 提升,IndexShare MTP 让草稿步成本在长上下文下最多降低约 1.9 倍。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
METR 发文论证 AI 推理应当既"可读"(人类可理解的自然语言)又"忠实"(真实反映模型内部决策过程),认为这有助于发现模型错误、识别隐藏议程、监测欺骗行为。
Liquid AI 发布第一代 Liquid Foundation Models(LFM),包括 1.3B、3.1B 密集模型和 40.3B MoE 模型(推理激活 12B 参数)。