Tomer Tunguz 分析 AI 模型公司的每兆瓦收入与模型工厂逻辑
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Claude Code 面向企业遗留代码库的现代化改造,结合 AI 代码生成与深度代码库理解,在保持业务逻辑完整的前提下支持可扩展迁移。它能生成依赖图、识别死代码、按复杂度与业务影响排定重构优先级,并自动为重构代码创建单元测试、补充回归测试。该工具可接入现有 CI/CD 流水线与版本控制系统,满足企业级安全与合规要求。
Tomer Tunguz 撰文指出前沿 AI 市场正分化为封闭阵营,实验室通过选择伙伴、限制访问来管控最强模型。
推荐理由:作者梳理了前沿模型从按 token 出售转向准入管控的多方实例,并给出开源与 Nvidia 反制力量的行业分析。
Anthropic 发布工程长文,介绍用 Claude 构建能规划、行动与协作的 AI 智能体,并称 Claude 在客户支持到编程等智能体场景中表现优于其他模型。
Tomer Tunguz 分析五年写作数据后认为,AI 自动化草稿并未减少人工编辑,而是提高了同等工作量的产出上限。行级句编辑中位数稳定在每篇约 136 处,而发布文章的质量下限上升最快,第 10 百分位评分从 2.59 升至 3.81,涨幅约为第 90 百分位的两倍。
Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。
推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。
作者估算未来五年美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设总投入约 5 万亿美元,其中约 4 万亿美元新债务相当于美国公司债市场扩容 34%,超过全球私募信贷市场规模,并等于美国市政债市场的 91%。
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。
Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。
推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。
Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。
推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。
Anthropic 公布 Claude 订阅方案:Free 档 $0,Pro 档年付 $17/月($200 一次性付清)、月付 $20,Max 档 $100/月起,可选 Pro 5 倍或 20 倍用量。
Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。
推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。
Anthropic 推出 Agent Skills,用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力。同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。
推荐理由:Anthropic 官方页面说明 Skills 的构建方式、跨平台复用和内置能力,读者可以据此判断是否将其纳入自己的工作流。
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
推荐理由:原文来自官方,给出了四大 Office 应用中的具体能力和可用性细节,读者可据此评估是否替换现有办公工作流。
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线 CoreWeave Cloud,并计划提供面向智能体的 NVIDIA Vera CPU,同时发布连接训练、评估与改进的 CoreWeave Forge。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。
推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。
Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。
Google 发布开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials,起步支持规范版本 2.2 和 2.4。
HeyGen 与 Google Cloud 合作,把 180 亿参数以上的数字人视频扩散模型 Avatar IV 迁移到八芯片 Trillium(v6e)主机上,速度比首个可用版本提升 1.86 倍。
Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。
推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 为目标模型完成多项优化,支持 4K+ token 文本与 15K+ token 多模态输入的嵌入推理。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。
推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。
Google 宣布 Agent Development Kit(ADK)for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能完全对齐,并新增 Android 端侧扩展。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证,同时在实验室测试中保持蛋白的生物功能。
推荐理由:原文给出水印在湿实验中不影响蛋白功能、并开放代码与权重的关键细节,读者可据此评估其对生物安全筛查的实际价值。
Base Bridge(TVL 约 $3.22B)v2.3→v2.4 升级兼容性审查发现多项高危风险:动态 quorum 可降至 4 且紧急暂停由 2-of-3 多签控制,未形式化验证的 Groth16 SNARK 验证器可能接受无效状态根,迁移脚本未校验 L2 侧 pendingMessageHashes 为空。
开发者正在打造原生 Mac 应用 DraftKey,主打在现有 macOS 文本框内做端侧 AI 自动补全与指令式改写,而非跳转到浏览器标签页或聊天窗口。该应用要求 macOS 14+、Apple Silicon 和 8GB 内存,本地模型下载约 1.12GB。作者认为日常写作的高摩擦在于切换上下文,本地优先更适合快速补全和改写,但也承认部分文本框受 macOS 平台限制。
作者发布开源 Rust 工具库 TeaQL Tool,将 52 个常用工具封装在统一的 T::xxx() 门面之后,覆盖 ID、时间、JSON、哈希、HTTP 等操作,底层复用 uuid、chrono、serde_、reqwest 等成熟 crate。