AMD Instinct GPU 迎来 Miles 强化学习框架 ROCm 支持
Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。
Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。
METR 审阅了 OpenAI 在发布 gpt-oss-120b 前开展的对抗性恶意微调(MFT)实验方法,共提出 17 条建议,其中 6 条为高紧急度,覆盖 Preparedness Framework (v2) 中生物化学与网络安全两个追踪类别。
LlamaIndex 在 LlamaParse 平台发布 beta 版 Turbo 抽取档位,主打低延迟实时工作流。
LlamaIndex 发文讲解如何为文档抽取结果选择置信度阈值,实现自动接受与人工复核的划分,目标是在给定精度(如 97%)下最大化自动化比例。
LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。
表格 OCR 通过版面感知处理、结构解析和 schema 对齐提取,把 PDF、扫描件中的表格转为 JSON、CSV 或 Excel 等机器可读格式。其流程分为表格检测、结构识别和数据提取三阶段,需处理合并单元格、多行记录和无边框表格等难点。
企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。
AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。
Liquid AI 提出基于进化算法的 STAR 方法,可自动合成定制化神经网络架构,并已用其生成数百种设计,在质量上超过强 Transformer 与混合架构基线,同时缓存和参数量更小。
斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。
斯坦福 Marlowe 超算配备 248 块 NVIDIA H100 GPU、31 个计算节点,横跨全部七所学院服务 190 多个研究组,30 天平均分配率 95%,累计交付 315 万 GPU-hours。
Fireworks 宣布 Kimi K3 支持其 Serverless Training 的 Multi-LoRA 服务与训练,进入私测阶段。K3 是总参数约 2.8T 的 MoE 模型,原文称其为首个达到 3T 规模的开源权重模型。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Epoch AI 的 AI chip sales 数据页追踪并估算主要 AI 芯片的销量与出货量,以及估算的总算力、成本和功耗。数据主要来自公司财报评论、分析师估算和媒体报道,提供按芯片类型、组织和按芯片时间线的 CSV 及 ZIP 打包下载,更新至 Aug. 27, 2026,并附 H100e 算力口径等常见问题说明。
Epoch AI 通过标注知名 AI 模型训练所用的芯片来识别 ML 硬件,并补充了虽未见于这些系统训练记录、但依据描述、支持的数值格式或同族关系可判定为 ML 用途的硬件。该数据集为每块芯片记录数据手册信息,涵盖算力、裸片面积等,并借助新闻报道或硬件价格档案补充发布时价格;并非所有硬件都有完整或适用的信息,因此部分字段常为空。
Epoch AI 开放定制研究合作,可承接 AI 趋势报告、模型评测、数据收集与基准开发等项目,曾与 OpenAI 合作开发 FrontierMath、与 Google DeepMind 合著 Rosetta Stone 论文、与 EPRI 联合发布 AI 电力需求研究。
Epoch AI 测算,自 2023 年以来,达到同等 AI 性能水平的成本在数学、科学和技巧类游戏五项基准上平均每季度下降约 47%,约合每年 13 倍,降速超过电力、算力、电池和 DNA 测序的历史降幅。该机构还指出,美国 GDP 增长因统计遗漏 Nvidia 在美国产生的收入而被低估约 0.3 个百分点,到 2028 年这一缺口可能扩大至 2 个百分点。
Epoch AI 分析显示,自 2024 年年中以来,最大 AI 数据中心 IT 电力容量纪录每 10 个月翻一番。2025 年第四季度全球 AI 数据中心总电力容量约达 30 GW,相当于纽约州峰值用电量。GPU 约占前沿 AI 数据中心电力消耗的 40%。
Epoch AI 的 AI Data Centers 数据库已覆盖 86 个站点、约占全球 AI 算力的 44%,并同步更新了界面与全球覆盖范围。其研究显示,自 2024 年中期以来,最大 AI 数据中心的 IT 电力容量纪录每 10 个月翻一番;一座典型 1GW AI 数据中心需 380 亿美元前期 CapEx 和 9 亿美元年 OpEx。
Epoch AI 更新了覆盖 170 多款 AI 加速器的机器学习硬件数据,并发布报告估算华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国内存,2028 年份额可能降至约 1%。其 AI 数据中心探索器现已覆盖 86 个站点、约占全球 AI 算力的 44%,同时贸易数据分析显示 2024–25 年存在约 30 亿美元芯片经马来西亚流入中国的迹象。
Epoch AI 评估,受美国出口管制限制最关键扩产手段,华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国存储,2028 年这一份额可能降至约 1%。该机构还估计,截至 2025 年约有 29 万至 160 万 H100 等效算力(中位数 66 万)被走私至中国,约占中国总算力的三分之一。
Epoch AI 的财务数据库用财报与公司披露估算 AI 芯片的算力、功耗与支出,并追踪超大规模厂商的 AI 建设融资。其测算显示,微软、亚马逊、Alphabet、Meta、Oracle 的合计现金资本开支预计在 2026 年 Q3 超过经营现金流;HBM 占 AI 芯片组件成本的 63%,高于 2024 年 Q1 的 52%。
Epoch AI 更新了其 AI 公司数据库,涵盖前沿 AI 主要参与者的收入、融资、员工和算力数据,并推出 AI Chip Users Explorer,首次展示五家领先实验室的算力使用估算(以 Nvidia H100-equivalents 计)。
Epoch AI 的公开数据库已追踪 1950 年至今超过 3600 个机器学习模型,并发布多项扩展性研究。其测量显示 GPT-5.6 Terra 和 Sol 的首次 token 延迟随上下文长度呈二次增长,而 Claude Sonnet 5 和 Opus 5 接近线性。此外,全球 AI 芯片内存带宽年增 4.1 倍,2025 年 Q4 已达约 7000 万 TB/s。
Epoch AI 的 Epoch Capabilities Index(ECI)是一个综合指标,用超过 50 个基准的分数生成单一通用能力量表,模型在更难基准上表现越好,ECI 分数越高。其领域版 ECI 沿用通用 ECI 的基准难度与斜率、仅重新拟合 LLM 能力参数,Cyber ECI 因纳入通用 ECI 之外的网络安全基准而更新频率更低。ECI 代码已在公开仓库发布。
Epoch AI 与 Ipsos 合作在 KnowledgePanel 上开展 AI 使用民调,于 2026 年 7 月 10-19 日访问 1,103 名在职美国成年人,并新增个体级微观数据下载(SPSS .sav 与 CSV)。
Epoch AI 上线"AI companies"数据集,追踪处于 AI 前沿的基座模型公司的营收、融资、员工数、算力支出和使用量数据,来源为公司披露、高管表态与媒体报道。数据集于 2026 年 9 月 29 日更新,提供全量 ZIP 及算力支出、融资轮次、员工、营收、使用量等分项 CSV,可通过 Python 直接读取。
Epoch AI 的 AI 数据中心数据枢纽收录 93 个数据中心,基于高分辨率卫星图像、许可和公开文件追踪建设时间线,提供交互地图。
Epoch AI 上线 AI 模型数据集,收录文献综述、Papers With Code、高被引论文及顶会论文等来源的模型,覆盖发布时达到 SOTA、引用超 1000 次或月活超百万的模型。数据集提供 notable、large-scale、frontier 及全量模型四类 CSV 下载,最新更新于 2026 年 9 月 30 日,并附参数规模、数据集大小与训练算力的测算文档。
CBRE 高管警告 AI 初创公司,若想获得数据中心场地,必须找到有实力的合作伙伴为租约付款提供担保,否则将面临艰难竞争。