Genspark 与 Fireworks Lab 将 MiniMax M3 后训练为 Gen-1 Slides,质量比肩 Opus 5、成本约为其 1/17
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Epoch AI 的 AI chip sales 数据页追踪并估算主要 AI 芯片的销量与出货量,以及估算的总算力、成本和功耗。数据主要来自公司财报评论、分析师估算和媒体报道,提供按芯片类型、组织和按芯片时间线的 CSV 及 ZIP 打包下载,更新至 Aug. 27, 2026,并附 H100e 算力口径等常见问题说明。
Epoch AI 通过标注知名 AI 模型训练所用的芯片来识别 ML 硬件,并补充了虽未见于这些系统训练记录、但依据描述、支持的数值格式或同族关系可判定为 ML 用途的硬件。该数据集为每块芯片记录数据手册信息,涵盖算力、裸片面积等,并借助新闻报道或硬件价格档案补充发布时价格;并非所有硬件都有完整或适用的信息,因此部分字段常为空。
Epoch AI 开放定制研究合作,可承接 AI 趋势报告、模型评测、数据收集与基准开发等项目,曾与 OpenAI 合作开发 FrontierMath、与 Google DeepMind 合著 Rosetta Stone 论文、与 EPRI 联合发布 AI 电力需求研究。
Epoch AI 测算,自 2023 年以来,达到同等 AI 性能水平的成本在数学、科学和技巧类游戏五项基准上平均每季度下降约 47%,约合每年 13 倍,降速超过电力、算力、电池和 DNA 测序的历史降幅。该机构还指出,美国 GDP 增长因统计遗漏 Nvidia 在美国产生的收入而被低估约 0.3 个百分点,到 2028 年这一缺口可能扩大至 2 个百分点。
Epoch AI 分析显示,自 2024 年年中以来,最大 AI 数据中心 IT 电力容量纪录每 10 个月翻一番。2025 年第四季度全球 AI 数据中心总电力容量约达 30 GW,相当于纽约州峰值用电量。GPU 约占前沿 AI 数据中心电力消耗的 40%。
Epoch AI 的 AI Data Centers 数据库已覆盖 86 个站点、约占全球 AI 算力的 44%,并同步更新了界面与全球覆盖范围。其研究显示,自 2024 年中期以来,最大 AI 数据中心的 IT 电力容量纪录每 10 个月翻一番;一座典型 1GW AI 数据中心需 380 亿美元前期 CapEx 和 9 亿美元年 OpEx。
Epoch AI 更新了覆盖 170 多款 AI 加速器的机器学习硬件数据,并发布报告估算华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国内存,2028 年份额可能降至约 1%。其 AI 数据中心探索器现已覆盖 86 个站点、约占全球 AI 算力的 44%,同时贸易数据分析显示 2024–25 年存在约 30 亿美元芯片经马来西亚流入中国的迹象。
Epoch AI 评估,受美国出口管制限制最关键扩产手段,华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国存储,2028 年这一份额可能降至约 1%。该机构还估计,截至 2025 年约有 29 万至 160 万 H100 等效算力(中位数 66 万)被走私至中国,约占中国总算力的三分之一。
Epoch AI 的财务数据库用财报与公司披露估算 AI 芯片的算力、功耗与支出,并追踪超大规模厂商的 AI 建设融资。其测算显示,微软、亚马逊、Alphabet、Meta、Oracle 的合计现金资本开支预计在 2026 年 Q3 超过经营现金流;HBM 占 AI 芯片组件成本的 63%,高于 2024 年 Q1 的 52%。
Epoch AI 更新了其 AI 公司数据库,涵盖前沿 AI 主要参与者的收入、融资、员工和算力数据,并推出 AI Chip Users Explorer,首次展示五家领先实验室的算力使用估算(以 Nvidia H100-equivalents 计)。
Epoch AI 的公开数据库已追踪 1950 年至今超过 3600 个机器学习模型,并发布多项扩展性研究。其测量显示 GPT-5.6 Terra 和 Sol 的首次 token 延迟随上下文长度呈二次增长,而 Claude Sonnet 5 和 Opus 5 接近线性。此外,全球 AI 芯片内存带宽年增 4.1 倍,2025 年 Q4 已达约 7000 万 TB/s。
Epoch AI 的 Epoch Capabilities Index(ECI)是一个综合指标,用超过 50 个基准的分数生成单一通用能力量表,模型在更难基准上表现越好,ECI 分数越高。其领域版 ECI 沿用通用 ECI 的基准难度与斜率、仅重新拟合 LLM 能力参数,Cyber ECI 因纳入通用 ECI 之外的网络安全基准而更新频率更低。ECI 代码已在公开仓库发布。
Epoch AI 与 Ipsos 合作在 KnowledgePanel 上开展 AI 使用民调,于 2026 年 7 月 10-19 日访问 1,103 名在职美国成年人,并新增个体级微观数据下载(SPSS .sav 与 CSV)。
Epoch AI 上线"AI companies"数据集,追踪处于 AI 前沿的基座模型公司的营收、融资、员工数、算力支出和使用量数据,来源为公司披露、高管表态与媒体报道。数据集于 2026 年 9 月 29 日更新,提供全量 ZIP 及算力支出、融资轮次、员工、营收、使用量等分项 CSV,可通过 Python 直接读取。
Epoch AI 的 AI 数据中心数据枢纽收录 93 个数据中心,基于高分辨率卫星图像、许可和公开文件追踪建设时间线,提供交互地图。
Epoch AI 上线 AI 模型数据集,收录文献综述、Papers With Code、高被引论文及顶会论文等来源的模型,覆盖发布时达到 SOTA、引用超 1000 次或月活超百万的模型。数据集提供 notable、large-scale、frontier 及全量模型四类 CSV 下载,最新更新于 2026 年 9 月 30 日,并附参数规模、数据集大小与训练算力的测算文档。
CBRE 高管警告 AI 初创公司,若想获得数据中心场地,必须找到有实力的合作伙伴为租约付款提供担保,否则将面临艰难竞争。
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
VC Tomer Tunguz 撰文分析 AI 时代企业数据外流风险,引用 Satya Nadella 的“反向信息悖论”与 Palantir CEO Alex Karp 关于前沿实验室“窃取业务权重与 alpha”的言论。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
ARC Prize 公布 2025 年赛事合作伙伴生态,Lambda、Modal、Google Cloud、Groq、Hyperbolic、Strong Compute、RunPod 提供算力支持,AI21 提供模型额度,Granola 提供生产力工具。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Eugene Yan 撰文分析复杂度偏见为何存在,指出复杂方案通过信号化努力、掌控力、创新和功能多样性而更受论文评审和晋升机制青睐,而简单方案更易采用、构建、扩展和运维。文章举例说明简单机器学习方法常不逊于复杂方法,如点积在推荐检索上优于神经协同过滤、树模型在 45 个中型表格数据集上超过深度神经网络,并建议聚焦问题复杂度而非方案复杂度,善用奥卡姆剃刀。
Eugene Yan 发文探讨数据与机器学习管道的测试为何频繁失效,并以行为日志到批量推理的示例管道演示单元、schema 和集成测试。
Eugene Yan 总结了提升机器学习项目成功率的四种机制:为每个项目设置 pilot 和 copilot 以发现关键缺陷,copilot 约投入 pilot 10% 的时间。
Eugene Yan 基于多篇行业论文和技术博客,总结出构建内容审核与欺诈检测系统的五个模式:通过 human-in-the-loop 收集 ground truth、数据增强、级联模式拆分问题、结合监督与无监督学习、以及可解释性。
Eugene Yan 总结撰写数据标注指南的方法,提出好指南应回答 Why、What、How 三层问题:任务为何重要、任务是什么、术语如何定义、标注员如何决策、任务如何执行。文章引用 Google 和 Bing Search 的指南实例,包括查询意图分类、页面质量评估因素、匹配质量决策树和标注示例讲解,并建议用 Cohen's kappa 衡量标注员之间的一致性来迭代改进指南。
Eugene Yan 总结了将大语言模型集成到系统与产品中的七大实用模式:Evals、RAG、微调、缓存、Guardrails、防御性 UX 和收集用户反馈,按提升性能与降低成本/风险、靠近数据与靠近用户两个维度组织。
在 Factual Inconsistency Benchmark(FIB)上,先用 Wikipedia 摘要微调 3 个 epoch 再在 FIB 上微调 10 个 epoch,PR AUC 达 0.85,比仅在 FIB 上微调提升 23%。