Epoch AI 开放 AI 数据集:追踪 3600 多个机器学习模型与 AI 算力
Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。
Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。
Epoch AI 的趋势报告显示,自 2010 年以来知名 AI 模型的训练算力每年增长 4.5 倍,算法效率则每年提升 3 倍,训练成本年增 3.5 倍、功耗每年翻倍。
CMU 研究者发布 CHAI,一个基于批判式人机监督的视频描述管线,与 100+ 专业视频创作者合作一年构建,对应 CVPR 2026 论文(Highlight,Top 3%)。
CMU 提出 V-pretraining,在持续预训练中把固定的自监督任务构造规则换成可学习的任务设计器,下游样本只用于训练设计器,学习者仍只接收自监督梯度。
CMU 博客解读 Forking-Sequences 训练范式:不再逐窗口编码,而是在单次前向传播中编码解码整条序列的所有预测创建日期,无需新增参数。该范式在 MLP、RNN、LSTM、CNN、Transformer 和 State Space 六种编码器上验证,LSTM 编码器的 sCRPS 最高提升 49.3%,梯度方差线性下降。
Baseten 发布训练 SDK Loops(早期访问),支持 256K+ 序列长度、2T+ 参数模型训练与异步 RL,训练完成后一条命令即可部署到 Baseten 推理栈。
Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。
推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
一批成立不满一年的数据公司估值急速膨胀,诞生了25亿美金的 UniPat 和多家3-8亿美金估值的公司,被作者概括为给模型制作练习题的生意,即采集专家解题轨迹或搭建 RL environment 交给模厂做专项训练。
研究提出 Desired-Update-Aligned Synthetic Data(DASA),用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,直接用于下游微调,无需人类可读文本形式。
针对神经定理证明器依赖人工形式化陈述、类型检查器存在"严谨性幻觉"的问题,研究者提出智能体框架 Sage,用四阶段分解生成流水线配合双信号语义纠错循环,将 Lean 4 编译器诊断与多维语义反馈结合。
研究量化了预分词边界带来的压缩代价:在英文维基百科上,边界规则使最优 token 数增加 28.3%–36.8%,BPE 比受限下界高 2.1%,但比无限制下界高 10.9%。
研究提出用行、列尺度场这一介观层级刻画 Transformer 权重,即权重矩阵各通道的中位数中心化对数 RMS 剖面,配合全局尺度与平衡核心可精确表示矩阵。在四个规模的公开 Pythia checkpoint 和三个初始化家族的受控实验中,平衡后测得的核心幅度剖面相似,混合桥模型能预测留出运行中池化形状相对场宽的偏离。
研究在 NASA C-MAPSS 涡扇基准上,用同一实现、架构、初始化、优化器和训练预算,对比同步环形 gossip 与 FedAvg、本地训练及集中式训练训练堆叠 LSTM 故障检测器的效果。
研究者提出 GapFT,按源检查点的单样本结果筛选训练数据,专门微调 Pass@K 与 Pass@1 之间的差距,即策略单次失败但 K 次采样内能解决的问题。
今年纽约气候周上,AI 热潮成为主导,许多气候科技初创公司转向迎合 AI 叙事以获取融资。据 PitchBook 数据,气候科技风投交易总额连续四个季度上升,今年第一季度突破 140 亿美元,主要由数据中心建设带动的建筑环境、电网基础设施和可调度能源等领域推动。但也有创始人认为,数据中心热潮正让其他有前景的气候科技领域被忽视。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。
HPE 提出企业 AI 从按 token 消费转向自建容量的判断框架:当需求稳定、可预测且规模足够时,拥有算力可能比逐次购买更经济。文中引用 Deloitte 2026 企业 AI 状况报告称,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计半年内翻倍。企业需先回答三个问题:需求是否稳定、在什么使用水平下自建更划算、能否通过采用与治理让容量保持高产。
New historic NanoGPT record at 39.9s (-27.7s) from @DevenPzak , obliterating the prior record of 67.6s! This record introduces a new paradigm of thinking to NanoGPT: instead of optimizing matmuls or adding more expressive operations, optimize at the individual flop level with incredibly clever engineering and ML judgement. If a flop is low value on a particular step, skip it. Specifically: -(~8s) Sampled softmax. If a token doesn’t appear in a batch, skip its lm_head fwd/bwd some fraction of the time. -Sparse values. Only run an optimizer step for ngram embeddings that occurred in the batch. Set beta1 to zero to enable this. Beta2 is applied retroactively when the row is later used. -Sparse updates. Only update ngram and value embeddings once every 4 steps instead of once every 2. -Sparse communication. Shard the n-gram table across GPUs, and only pass the rows receiving updates on each step. -Sparse optimizer states. For the n-gram table, reduce from 2 floats in Adam optimizer per param, to 1 float per 768 params. -Hand-rolled flash attention for 64 dim heads. There are several additions that add accuracy too: -(~4s) EMA during last 300 steps, combined with lifting final_lr to 0.3 instead of 0.15. -(~1s) A new optimizer, Anvil2, which expands muon via a second tracked momentum buffer, improves the ortho coefficients, and modifies the cautious weight decay application. -A couple additional dynamic skip connections in the network. The most striking consequence of the ‘flop aware paradigm’ is you can grow parameters arbitrarily large, only limited by the available memory, since you can selectively choose how to expend flops on those parameters on each step. NanoGPT has kept active parameters below 124M, but total is unbounded, and has grown to 640M through embedding sparsity over the last year. This PR takes that to its logical conclusion on the 8xH100, scaling up to 65B sparse embedding parameters, which accounts for 25% of the PR’s gains. At frontier scale, where one is not bounded by an 8xH100, one could imagine where this paradigm could lead. https://github.com/KellerJordan/modded-nanogpt/pull/360 As this was a very notable PR, I spoke with Deven for an hour to learn how he did it. Here’s his story on the changes: https://hyperstition.cc/training-nanogpt-in-39-9-seconds
AMD 以 82 亿美元收购 World Labs。World Labs 创始人李飞飞在博客中表示,公司自 2024 年成立以来构建了图像、视频与空间重建的模型训练团队,并在收购 SceniX 后推进机器人仿真能力。
AMD 宣布以约 82 亿美元全股票交易收购由李飞飞联合创立的 AI 研究实验室 World Labs,交易预计今年年底完成。World Labs 于 2024 年成立,数月内估值达 10 亿美元,2025 年推出首个商业产品世界生成模型 Marble,可根据提示词生成可交互 3D 世界。
推荐理由:AMD 以约 82 亿美元全股票收购 World Labs,读者可了解交易结构、团队去向及其对 AI 硬件与模型协同的影响。
微软亚洲研究院新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向推进工作。实验室与新加坡经济发展局(EDB)合作开展联合博士培养,并于 2026 年 2 月共同举办物流与交通 AI 高管圆桌会;医疗健康领域已落地多模态医疗 AI 与自进化诊断智能体的合作研究。
Databricks 提出用 Data and AI Platform 打通制造业产品价值链,让跨阶段数据问题从人工查票变成一次查询。平台通过 zero-copy Open Sharing 和 Lakehouse Federation 直接访问源系统数据,无需为每个用例新建 ETL 管道或复制数据;需要镜像时可用连接器和云对象存储将数据汇入 lakehouse。
一个做研究的机会:持续学习:多智能体并行 worker;以及合成数据、环境和评估,用来衡量前沿能力。我们赚的钱足够资助新研究,希望做出持久的贡献,并公开分享我们的研究。
The Perplexity Research Fellowships are a great opportunity to advance frontier research around architecture design, multi-agent collaboration, synthetic data, and beyond! Priority deadline of Sep 30. https://jobs.ashbyhq.com/perplexity/ab076e26-adf1-414f-a006-7b1bdc9247c8 Feel welcome to mention my name in your application!
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,提供 CloudFormation 和 Terraform 模板、跨账户适配器提升流程、生产安全配置及文档预分类路由模式。
华为发布 openPangu 2.0 代码,覆盖预训练、监督微调和强化学习后训练。此次发布扩展了其开放 AI 模型计划,该计划围绕昇腾硬件上的原生训练与推理构建,相关模型组件正逐步添加到开源平台。
MIT 研究团队借助可在小数据集上工作的机器学习算法,调整 mRNA 疫苗脂质纳米颗粒(LNP)中的辅料配方,使疫苗在室温下可稳定保存一年,在约 100 华氏度下保存两个月。
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户记录代表谁、受众何时可激活等五个执行问题展开。每个术语都给出营销侧与数据工程侧的两套定义,例如“实时”在营销眼中是每 15 分钟刷新,在数据团队眼中则是秒级更新,涉及新基础设施与持续成本。文章建议在开工前先对齐“客户”“受众就绪”“信号新鲜度”等含义,避免误解变成活动返工。
我觉得 Opus 5.5 不抽大麻,做不出这种东西。 看完你就懂 PPO, GRPO, DPO! Better than expected.
HuggingFace 上发布了一个用 Claude Opus 5.5 生成的覆盖 2194 种疾病的模拟医患对话数据集,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
开源 RL 环境就是赢。当然是在 Hugging Face 上!
was looking for a quiet weekend but xiaomi dropped their rl envs repo last night to put in perspective, if you have to buy some tasks like this its usually hundred to thousand dollars per task so this repo is literally worth millions https://huggingface.co/datasets/XiaomiMiMo/MiMo-V2.6-RL-oss
特斯拉在得州和加州工厂让工人穿戴动作捕捉服为 Optimus 人形机器人采集训练数据,部分工人因担心机器人最终取代自己而抵触,特斯拉已将数据采集转交给专门团队并设立“训练中心”。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
这是几个月前我还在 Google 时录制的,真的是一次非常有趣的对话!
How does this only have 21,000 views in 8 days? Chat with @JeffDean (then Google) and Bill Jia about large scale AI models. https://youtu.be/BVQSWeK2Nrw?si=MvMXdAEqjQE4HBOb
在 AI x Science 领域,生物技术公司正沿两条路径适应 AI:Foundries 用新一代测序、高通量显微和物理自动化将实验数据生成速度提升一个数量级,AI 让数据可读可预测,但差异化资产仍是实验数据本身;Navigators 则把 AI 嵌入公司日常流程,驱动更优决策与更快流程,无需专有模型或大规模数据集。