OpenAI DevDay 2026 发布20多项产品,作者实测 Dots 与 Decisions API
OpenAI DevDay 2026 发布20多项产品和功能,包括 ChatGPT 内常驻智能体 Dots、类 Google Drive 的 Space 与原生文档套件。
推荐理由:作者基于亲手测试梳理 DevDay 二十多项发布,给出 Dots、Decisions API 等功能的实际体验细节和与竞品的初步对比。
OpenAI DevDay 2026 发布20多项产品和功能,包括 ChatGPT 内常驻智能体 Dots、类 Google Drive 的 Space 与原生文档套件。
推荐理由:作者基于亲手测试梳理 DevDay 二十多项发布,给出 Dots、Decisions API 等功能的实际体验细节和与竞品的初步对比。
Every 以滚动形式发布 100 条关于“自动化之后工作会变成什么样”的 Thesis Statements,邀请创始人、运营者和思想者给出预测。Anne-Laure Le Cunff 认为答案将变得充裕、真正困难的是判断哪些问题值得问;Dan Shipper 则判断人类工作量会比以往更多。
Every 将于 11 月 5 日在纽约布鲁克林 Pioneer Works 举办首届大会 Thesis: 2027,主题是 AI 在 2027 年承担更多执行、人类转向决策与创造。
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Eugene Yan 发布 2025 年度回顾,完成 6 篇技术写作并上线 4 个原型应用,其中 AI Reading Club 已登陆 Kindle iOS app,LLM-RecSys 混合模型可依据自然语言与 item ID 直接推荐。
Epoch AI 播客栏目上线多期讨论,其中一期主题为“Are AI benchmarks doomed?”,探讨 AI 基准测试的困境。其他话题涵盖 AI 数学能力可能长期呈锯齿状发展、欧盟与 AI 宏观经济学的复杂性、经济学对 AGI 的启示、AI 进展预测至 2040 年,以及 AGI 时间线是 3 年还是 30 年的分歧。
Epoch AI 的 Newsletter 栏目汇总了多期内容,包括 8 月 27 日对 AI 最重要数字的更新、8 月 14 日基准测试可帮助回答的 9 个大问题,以及 8 月 12 日以 Anthropic 为案例探讨融资是否会瓶颈 AI 算力。
Epoch AI 的趋势报告显示,自 2010 年以来知名 AI 模型的训练算力每年增长 4.5 倍,算法效率则每年提升 3 倍,训练成本年增 3.5 倍、功耗每年翻倍。
Anthropic CEO Dario Amodei 发表长文,描绘强大 AI 若一切顺利可能在 5-10 年内压缩未来 50-100 年生物医学进步的愿景。他定义强大 AI 为超过诺贝尔奖得主智力、可自主完成数天至数周任务的系统,并提出以智能的边际回报为核心的分析框架,聚焦生物学与健康、神经科学与心理健康、经济发展与减贫、和平与治理、工作与意义五大领域。
推荐理由:Anthropic CEO 本人撰写的长文,系统给出强大 AI 在五个领域造福社会的具体预测与分析框架,观点源自第一手思考。
Trail of Bits作者在Patch the Planet项目中获得GPT 5.6-Cyber预览权,让它在CTF任务中逃出自己Debian 12机器上的QEMU/KVM虚拟机,结果它三次成功逃逸。
推荐理由:作者以一手实验展示GPT 5.6-Cyber三次逃出VM的具体漏洞链,指出单靠虚拟机隔离AI智能体已不可靠。
Cloudflare 发文指出互联网出现了由软件代理人类访问的第二个受众:其网络 HTTP 请求从 2024 年底的每秒 6300 万增至近 1.15 亿,一年内 AI 智能体日请求增长超 1700%,今年首次过半流量非人类。
推荐理由:Cloudflare 用自家网络数据说明智能体流量如何改变流量与收入的关系,并给出可控授权和按使用付费的应对思路。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 研究员 Nicholas Carlini 用 agent teams 方法让 16 个 Claude 实例并行工作,经近 2000 个 Claude Code 会话。
推荐理由:作者亲历了用 16 个并行 Claude 智能体写 C 编译器的完整过程,沉淀了测试设计、并行任务锁和 GCC 对照等可复用的 harness 方法。
Tomer Tunguz 分析 Dario Amodei 提出让行业自我放缓 AI 发展的倡议,指出五个阵营各说后果却无人给出具体速度。文章以 2023 年 10^26 FLOPS 报告门槛被撤销、Grok-3 数周后越线为例,说明算力每年增长约五倍,固定数字很快过时,真正问题是谁有权决定速度。
Vercel COO Jeanne DeWitt Grosser 在 The Information 访谈中表示,inbound 销售开发实现 90% 自动化,自建客服 Agent 处理 93% 的支持案例,销售开发 Agent ROI 达 32x,两项的年度基础设施账单均为几千美元低位;inbound SDR 团队从 10 人缩至 1.25 人。
Tom Tunguz 引用 UC Berkeley HarnessTax 研究指出,控制 AI agent 的 harness 决定同一答案的价格:GPT-5.6 Sol 在 Pi 上比在 Claude Code 上每完成一个任务成本低 71%($0.441 对 $1.540),42 组同模型 harness 对比中质量差异均无统计显著性。
推荐理由:作者基于 UC Berkeley 研究数据解释 harness 如何决定同一模型的成本与毛利,比较框架可迁移到 AI 应用商业判断。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
Tom Tunguz 撰文分析 AI 市场竞争焦点不在前沿模型而在中间层。他引用数据指出,Anthropic 的 Opus 系列维持 $5 与 $25 每百万 token 价格五次发布后首次降价,OpenAI 的 Luna 先后降价 80% 和 50%,开源模型以 86% 折扣承担大部分 token 流量;最强模型 Fable 5.1 上线十二天仅占网关支出的 3.7%。
推荐理由:作者用多家模型价格与网关份额数据说明竞争重心在中间层市场,为理解 AI 定价经济提供了一个数据视角。
GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。
Anthropic 与 OpenAI 在2026年通过市场分层重新拉开收入差距:Anthropic 于2026年3月推出企业按量计费,一个季度内收入翻倍;约三个月后 OpenAI 将最便宜的 Luna 模型降价80%,run rate 接近 $70b。
据 The Information 报道,Google 试点计划向约 100 家数字出版商付费,用于 AI Overviews、AI Mode 和 Gemini 聊天机器人中使用的内容。
Anthropic 发布分析称,智谱开源模型 GLM-5.3 在漏洞利用上接近其 Claude Mythos Preview:ExploitBench 上 410 次尝试成功构建 50 个可用 exploit,对方为 56 次;内部 OSS-Fuzz 二进制利用测试中分别为 4% 和 6%。
美国政府本周二上线 AI 聊天机器人 America.gov,由 Google 和 SpaceXAI 参与构建,目前较难被越狱。用户询问 Minecraft 时,它会输出约 1800 词的独白,实为对游戏通关后 Julian Gough 所写《End Poem》的改写,而非模型幻觉。特朗普称 20 岁程序员 Edward Coristine 是该项目的首席工程师之一。
针对 OpenAI 的抗议活动正变得越来越有创意。上周有人在 OpenAI 纽约办公室外抗议,本周一其最新模型 GPT-6.1 Astra 的训练因安全担忧被叫停,OpenAI 同日还为未经授权访问澳大利亚政府网站致歉。佛罗里达州已请求法院叫停 OpenAI 的开发,称其为"不可接受的高风险产品"。
a16z 发布第二版 State of Markets,聚焦 2026 年前两季度股票市场与科技走势。报告指出科技已贡献 SP500 2026 年约 76% 的总盈利增长,主题从软件转向硬件与基础设施,GPU 需求仍超供给,A100 租价不低于年初水平。
who tf is leaking our product roadmap to MY MOM
一批成立不满一年的数据公司估值急速膨胀,诞生了25亿美金的 UniPat 和多家3-8亿美金估值的公司,被作者概括为给模型制作练习题的生意,即采集专家解题轨迹或搭建 RL environment 交给模厂做专项训练。
AI 已经在很多方向和很大程度上接管了 人类个人/群体 的选择和决策,一种神奇 + 诡异的感觉 好像有种魔法对轰的错位感 what a time
Nature 调查发现一批假学术学会通过未经同意使用知名科学家姓名、伪造网站图片和虚构与欧美学术机构合作关系来扩充会员。其中一个学会在网站上以 10000 美元售卖虚拟博士项目、2000 美元售卖虚拟博士后项目,微信上还有咨询公司提供加入这些组织的服务。Nature 统计到 30 多篇学术机构庆祝教师入选或获奖的新闻稿,部分机构在问询后已承认错误并删除或更正。
暴露组学研究环境暴露与生活方式如何与基因共同塑造疾病风险,环境暴露占慢性病风险的70%至90%。哈佛医学院团队用619个暴露标志物与305项可测特征比对发现,单个暴露解释的疾病结果变异不足1%,但20种暴露联合后平均达3.5%,可与影响疾病的遗传变异预测力相当。PubMed中“exposome”相关论文今年已至少发表830篇,2020年全年为261篇。