Pragmatic Engineer 播客对话 Cockroach Labs CTO Peter Mattis:分布式数据库与 AI 时代的工程实践
Pragmatic Engineer 发布与 Cockroach Labs 联合创始人兼 CTO Peter Mattis 的访谈。Mattis 是 GIMP 原始创作者,曾参与 Gmail 和 Google 分布式存储。
Pragmatic Engineer 发布与 Cockroach Labs 联合创始人兼 CTO Peter Mattis 的访谈。Mattis 是 GIMP 原始创作者,曾参与 Gmail 和 Google 分布式存储。
TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。
Trail of Bits 发布一份零知识证明,在所有指标上超过 Google 两周前发布的椭圆曲线量子密码分析证明:830 万总操作数、1,164 个 qubit、报告的 Toffoli 门数为 0。
Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。
推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。
Tomasz Tunguz 撰文称 harness 对编码基准和成本的影响大于模型。Endor Labs Agent Security League 测试显示。
推荐理由:文章用同一模型在不同 harness 下的分数差和缓存成本数据,说明运行时框架对编码表现和账单的影响可能超过模型本身。
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
Eugene Yan 回顾 2024 年,将 2023 年的原型规模化落地为服务客户的 ML/LLM 生产系统,并发布 6 篇长文,其中与友人合写的《What We've Learned From a Year of Building with LLMs》还由 O'Reilly 出版成书。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。
HPE 提出企业 AI 从按 token 消费转向自建容量的判断框架:当需求稳定、可预测且规模足够时,拥有算力可能比逐次购买更经济。文中引用 Deloitte 2026 企业 AI 状况报告称,2025 年员工 AI 使用率上升 5%,至少 40% 的 AI 项目进入生产的公司比例预计半年内翻倍。企业需先回答三个问题:需求是否稳定、在什么使用水平下自建更划算、能否通过采用与治理让容量保持高产。
一样。@useblacksmith 一直是超棒的赞助商,但我们得分散负载。 我的计划是让 codex 决定哪些测试真正需要跑,大幅削减 CI,改为每小时跑一次测试。
CI has become the top bottleneck of every engineering team I talk to (including Lindy). Our CI spend has become stratospheric.
The H100 is a three-year-old training chip. Its rental price is up 22 percent on the month, to $3.28 an hour. Every depreciation schedule assumes a chip this old only loses value. The market is paying up for it instead.
微软提出 AI 基础设施的“良率命题”,主张衡量标准应从建了多少算力转向产出多少有用智能。文中指出单个智能体任务消耗的 token 可达普通对话的 3400 倍以上,而全球 AI 渗透率仅为劳动人口的 18%,且以聊天为主。微软认为内存、网络与功耗的瓶颈需通过跨层协同设计解决,而非在单层堆叠资源。
SemiAnalysis 基于 ClusterMAX 3.0 对 25 家 neocloud、32 个集群约 4 个月的安全测试,指出多数 neocloud 存在严重安全缺陷,并复盘 OpenAI 智能体攻击 Hugging Face 与 JFrog Artifactory 的事件时间线。
Synopsys 的 Ravi Subramanian 在 DAC 2026 音频访谈中讨论了芯片设计中的物理学与 EDA 工具,重点谈及 3DIC 与热管理。他指出典型移动 SoC 约 2 到 25 亿门,而典型汽车 ECU 芯片约 70 亿门,功耗已直接影响到电动车续航。随着芯片变大,机械应力等原本的二三阶效应正变成一阶效应,签核需同时考虑机械与电学性能。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。