a16z 分析:记录系统厂商进军 AI Agent,垂直 AI 创业公司仍有机会
a16z 作者 Seema Amble 分析认为,AI 让记录系统(system of record)更重要而非更不重要,Salesforce 与 Anthropic 合作的 Claudeforce 让 Claude 成为工作入口而 Salesforce 仍控制 CRM 数据。
a16z 作者 Seema Amble 分析认为,AI 让记录系统(system of record)更重要而非更不重要,Salesforce 与 Anthropic 合作的 Claudeforce 让 Claude 成为工作入口而 Salesforce 仍控制 CRM 数据。
MIT 终身幼儿园小组博士生 Ila Kumar 主张社区共创式设计,让经历童年创伤、涉入儿童福利系统的年轻人从设计之初就参与技术开发。她与 Stepping Forward LA 合作开发以视觉拼贴替代文字沟通的应用,并与 Justice Resource Institute 合作设计支持青少年参与自身治疗计划制定的移动应用。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。
推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
A man in Australia asked his agent (Claude running on OpenClaw) to book him a spot in a popular gym class. The agent found a software vulnerability that let it book the class weeks further ahead than should have been possible. When the user then asked if it could move him up the waitlist, the agent discovered the API had no authorisation checks on cancelling other people’s reservations, so it cancelled the person in the first spot and moved him up the list. Some people will call this misalignment, but his agent was perfectly aligned to him - it was only trying to help its user get what he wanted. The most important thing about this story, in my opinion, is that it gives you a window into what is about to start happening on a massive scale once millions of people have an agent trying to get their beloved users the best seats, bookings, appointments or reservations through absolutely any means necessary.
MIT 施瓦茨曼计算学院与政治学、EECS 系共享教职的 Bailey Flanigan,开发出随机抽选公民议会参与者的算法,用于解决自愿报名者无法代表整体人口的问题。她以 AI 议题的公民议会为例:自愿参与者可能偏向年轻、受教育程度高且对技术感兴趣的人群,导致其他群体代表性不足。其工具在个体参与机会平等、抗操纵性与透明度之间平衡代表性。
Vibe research will be the biggest trend in 2026. I am starting to see people casually do it. AI is getting good enough to do this as well.
Together AI 发文解释推理服务 99.9% 可用性的实际含义,自述为 Cursor、Decagon、Cartesia、Yutori 等团队提供推理。文章按层拆解故障模式(计算、网络、存储、软件),说明 99%、99.9%、99.99% 各等级分别要求抗节点故障、抗单数据中心故障和抗区域故障,强调多活双设施部署与自持基础设施的差异。
Thinking Machines Lab 发表文章,主张构建延伸人类意志与判断的 AI,认为当前多数模型集中训练后固化,未受使用者塑造。公司提出训练强模型、提供可微调模型权重的工具、开发原生多模态交互模型、发布研究等四个技术方向,并将对齐视为分散在多元模型生态中的持续过程。
Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。
推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者无论技术背景如何,都在活动结束前构建出可用的 AI 智能体。有参会者称三小时完成了原本需要六个月的工作,另一位来自 $2B+ 科技公司的参会者表示,把 Ghostwriter 指向知识库后,15 分钟就一次性生成了智能体。Sierra 总结的三大要点是:任何人都能成为"海盗"、通才回归、以及 10 倍员工。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,指出优化理论、演化生物学、竞争市场与机器学习都指向同一结论:专业化不可避免。
《科学美国人》6 月 16 日发布“The Young American Scientists”专题,MIT 校长 Sally Kornbluth 及多位师生校友撰文谈好奇心驱动科学。
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队从处理排队转向根因修复和产品洞察。Wilson 的 AI 智能体可追问身高与偏好来推荐手套等具体产品,Minted 则用 AI 打通各客户平台识别趋势。Sierra 博客称客户对话正从成本项变为产品改进与业务增长的洞察来源。
Sierra 复盘其 2024 年 12 月提出的结果定价(outcome-based pricing)理念,指出自那以来 S&P 500 上涨约 30%,而代表 SaaS 指数的 WCLD 下跌约 15%,市场正在消化企业软件从团队生产力工具转向交付结果的 AI 智能体。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。
推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Answer.AI 联合创始人 Rachel Thomas 与 KAMI Think Tank 的 Kamayani Gupta 对谈生命科学中 AI 应用的风险与局限,本文为整理稿。
Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。
推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。
Sierra 在进入第三年之际宣布 ARR 超过 1.5 亿美元,此前用七个季度达到 1 亿美元 ARR,并迎来首个 5000 万美元季度。
我提出的一个观点没有被传达出来: - 扩展当前的东西会持续带来改进。特别是,它不会停滞。 - 但某个重要的东西会继续缺失。
here are the most important points from today's ilya sutskever podcast: - superintelligence in 5-20 years - current scaling will stall hard; we're back to real research - superintelligence = super-fast continual learner, not finished oracle - models generalize 100x worse than humans, the biggest AGI blocker - need completely new ML paradigm (i have ideas, can't share rn) - AI impact will hit hard, but only after economic diffusion - breakthroughs historically needed almost no compute - SSI has enough focused research compute to win - current RL already eats more compute than pre-training