Prime Intellect 发布 INTELLECT-MATH:7B 数学推理模型训练提速 10 倍
Prime Intellect 通过对合成推理轨迹做微调来改进在线强化学习的策略初始化,训练出 7B 数学推理模型 INTELLECT-MATH,在多个数学推理基准上超过 Eurus-2-7B-PRIME,并以 10 倍更少的 GPU 小时达到同等性能(47 步 RL 对比 592 步)。
Prime Intellect 通过对合成推理轨迹做微调来改进在线强化学习的策略初始化,训练出 7B 数学推理模型 INTELLECT-MATH,在多个数学推理基准上超过 Eurus-2-7B-PRIME,并以 10 倍更少的 GPU 小时达到同等性能(47 步 RL 对比 592 步)。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布 INTELLECT-2,以 QwQ-32B 为基座,用 GRPO 和可验证奖励进行全球首个 32B 参数的无许可分布式强化学习训练,任何人可贡献异构算力。
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,在异步、异构的分布式算力网络上训练,性能较 QwQ-32B 在数学与编码基准上有提升。
推荐理由:官方发布首个通过全球分布式强化学习训练的 32B 推理模型,并开源训练框架、代码和数据,适合关注开源分布式训练路线的读者。
Prime Intellect 发布 PCCL(Prime Collective Communications Library),一个为跨全球分布式训练构建的容错集合通信库。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM 4.5 Air 基座上经过 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平,超越许多更大的前沿模型,如 AIME24 90.8 分、AIME25 88.0 分、GPQA-Diamond 74.4 分。
推荐理由:原文同时放出模型权重、训练框架和全部环境,读者可以看到大规模 RL 后训练的完整可复用配方。
Prime Intellect 宣布其自我改进智能体训练平台 Lab 结束 beta,正式全面开放。平台以环境为核心抽象,提供托管训练、托管评估、Environments Hub、adapter 部署和 Prime Inference 等组件,覆盖评估、训练、检查、部署的完整循环;beta 期间数百名用户已运行超 10,000 个训练任务。
Prime Intellect 开源了 renderers,一个让开发者完全控制 RL 与多轮推理对话格式的独立 Python 库。它把聊天模板变成可编程对象,支持消息渲染为 token id、解析补全结果、按来源消息归属 token 以做 loss masking,并可在不重新渲染模型采样历史的情况下扩展多轮 rollout,带来打包训练序列 3x 冗余节省。
Prime Intellect 发布研究文章,提出在 RL 训练中同时用 SFT(正恒定优势、无额外前向开销)让模型预测工具输出,即 ECHO 方法。
Prime Intellect 为 prime-rl 引入一等算法层,内置 GRPO、MaxRL、On-Policy Distillation、Self-Distillation、SFT distillation 和 ECHO 六种算法,可按环境分别选择,单次运行即可在不同环境训练不同算法。
Prime Intellect 宣布完成 $130M A 轮融资,由 Radical Ventures 领投,NVIDIA Ventures、Intel Capital、Dell Technologies Capital 等参投,总融资超过 $150M。
Prime Intellect 发布 research-environments,为 23 个开源智能体任务集提供统一 taskset API,涵盖约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务,总计约 365,000 个环境,配套约 135,000 个预构建任务镜像。
METR 时间跨度论文主要作者 Thomas Kwa 撰文澄清对该研究的常见误读,指出时间跨度是指以 50% 成功率可替代的串行人类劳动时长,而非 AI 可独立工作的时间,且测量误差较大、跨领域差异可达数量级,如视觉计算机使用任务低 40-100x。
METR 研究人员对 NanoGPT speedrun 的 77 条记录分类,2024 年 5 月至 2026 年 3 月间 36 名贡献者将训练时间从 45 分钟降到 1.43 分钟,共 31x 提速。
SGLang RL 团队联合 InfiXAI、蚂蚁 Asystem & AQ Infra、slime、RadixArk 团队,在 slime 框架上落地了 INT4 QAT 端到端流程,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性与稳定性。
Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。
METR 审阅了 OpenAI 在发布 gpt-oss-120b 前开展的对抗性恶意微调(MFT)实验方法,共提出 17 条建议,其中 6 条为高紧急度,覆盖 Preparedness Framework (v2) 中生物化学与网络安全两个追踪类别。
LlamaIndex 在 LlamaParse 平台发布 beta 版 Turbo 抽取档位,主打低延迟实时工作流。
LlamaIndex 发文讲解如何为文档抽取结果选择置信度阈值,实现自动接受与人工复核的划分,目标是在给定精度(如 97%)下最大化自动化比例。
LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。
表格 OCR 通过版面感知处理、结构解析和 schema 对齐提取,把 PDF、扫描件中的表格转为 JSON、CSV 或 Excel 等机器可读格式。其流程分为表格检测、结构识别和数据提取三阶段,需处理合并单元格、多行记录和无边框表格等难点。
企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。
AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。
Liquid AI 提出基于进化算法的 STAR 方法,可自动合成定制化神经网络架构,并已用其生成数百种设计,在质量上超过强 Transformer 与混合架构基线,同时缓存和参数量更小。
斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。
斯坦福 Marlowe 超算配备 248 块 NVIDIA H100 GPU、31 个计算节点,横跨全部七所学院服务 190 多个研究组,30 天平均分配率 95%,累计交付 315 万 GPU-hours。
Fireworks 宣布 Kimi K3 支持其 Serverless Training 的 Multi-LoRA 服务与训练,进入私测阶段。K3 是总参数约 2.8T 的 MoE 模型,原文称其为首个达到 3T 规模的开源权重模型。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。