#现象/趋势
#现象/趋势
今日 2 条
Sakana AI@SakanaAILabsAI 评分3535Anthropic:Research(发表成果 · 网页)精选AI 评分6969 Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前
Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。
推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。
Suno:Blog(网页)精选AI 评分6868 Suno 回应 RIAA 版权诉讼:学习不等于侵权
Suno 发文回应 6 月 24 日 RIAA 成员唱片公司对其提起的版权侵权诉讼,称诉讼在事实和法律上均有缺陷,模型学习风格与 patterns 的过程如同孩子听摇滚后写新歌,学习不是侵权。
推荐理由:Suno 官方回应 RIAA 诉讼,说明其训练数据来源与防复制机制,可了解音乐生成版权争议中当事方的核心主张。
Suno:Blog(网页)AI 评分2626 Suno 推出 Spark 孵化器计划,资助独立音乐人
Suno 推出名为 Spark 的孵化器计划,通过资助金、导师指导和专属营销支持,帮助独立音乐人完成音乐项目。入选艺术家将获得创作资助与营销资金,受邀在写作营与成熟艺术家合作,并可为 Suno 新功能提供反馈,同时保留作品的创作控制权与商业权利。该计划即日起开放申请。
Suno:Blog(网页)AI 评分3333 Dream Relic 如何用 Suno 为超现实视觉世界赋予声音
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。
Suno:Blog(网页)AI 评分3131 sad alex 谈用 Suno 当创作草稿本:写歌、短视频与创作自主权
洛杉矶唱作人 sad alex 在 Suno 博客访谈中表示,她只把 Suno 当作解决问题的工具,用于男女声切换、补充自己不会演奏的弦乐或电吉他,以及为卡住的 demo 搭出可参考的成品雏形。她强调只上传自己 100% 拥有版权的歌曲,并认为 AI 本质上无法像人一样向前思考,歌曲的新鲜感与演唱的感染力仍来自人。
Sakana AI:Blog(网页)AI 评分3131 英国王立协会特集号解读世界模型最前沿与 AI 未来,Sakana AI 参与卷首文章
英国王立协会《Philosophical Transactions of the Royal Society A》发布特集号「World Models in Natural and Artificial Intelligence」,Sakana AI CEO David Ha 参与卷首文章共著。
Berkeley RDI:Blog(AI 安全与评测)AI 评分2222 UC Berkeley Agentic AI Summit 2025 回顾:超 2000 人到场、约 4 万人线上参与
UC Berkeley 举办的 Agentic AI Summit 2025 吸引超 2000 人到场、约 4 万人通过直播线上参与,全部会议录像已开放观看。主办方 Berkeley RDI 宣布该峰会明年将再度举办,具体细节待公布。
METR:Research(网页)AI 评分4343 METR 研究:任务替代如何导致 AI 生产力提升(uplift)的三种度量出现显著分歧
METR 提出 AI 生产力提升(uplift)的三种度量——旧任务 uplift、价值 uplift 与新任务 uplift,并论证在简化假设下三者满足「旧任务 uplift ≤ 价值 uplift ≤ 新任务 uplift」。
METR:Research(网页)AI 评分5050 METR 调查:349 名技术工作者自报 AI 带来 1.4–2 倍工作价值提升
METR 在 2026 年 2–4 月调查 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),自报 AI 工具带来的工作中位价值变化为 1.4–2 倍,中位速度变化为 3 倍。
METR:Blog(网页)AI 评分5454 METR 解释负责任扩展政策(RSP)的构成要素与价值
METR(ARC Evals)发文阐述负责任扩展政策(RSP)的基本理念,认为广泛采用高质量 RSP 能显著降低 AI 灾难性风险,但自愿承诺不足以充分遏制风险,不能替代监管。
METR:Blog(网页)AI 评分4040 METR 谈前沿 AI 模型风险应披露哪些信息
METR 提出前沿 AI 风险透明度框架,主张企业披露训练与开发过程信息,而非仅公开部署时的 system cards。其列举的风险领域包括内部与外部能力差距、模型是否追求错位目标、模型能否破坏安全研究,以及少数员工能否窃取模型权重或植入后门。METR 同时提醒透明度存在权衡,如可能促使开发者回避发现安全问题,并建议采用仅向政府或外部安全研究者披露、经可信中介脱敏汇总等部分透明方案。
Stanford HAI News(网页)AI 评分3434 斯坦福 HAI:AI 如何加速科学发现,从 Evo 2 到虚拟细胞
斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。
Cursor Blog精选AI 评分7070 Cursor 团队分享如何搭建云端智能体开发环境
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。
Claude:Blog(网页)精选AI 评分8181 Anthropic 详解 Claude Opus 5.5 为何适配更长、更高上下文的编码会话
Anthropic 发文说明 Claude Opus 5.5 针对更长、上下文更重的编码会话做了成本优化,估计典型按 token 计费的工作负载运行成本比 Opus 5 低约 40%。
推荐理由:原文用 Claude Code 六个月聚合数据解释长上下文会话成本结构,并给出保护缓存读取的可操作建议。
Cognition 模型 / Devin 博客(网页)精选AI 评分6767 Cognition 发布 Devin 2025 年度绩效复盘:上线 18 个月的真实部署经验
Cognition 在 Devin 上线 18 个月之际发布年度绩效复盘,称其已进入数千家公司的工程团队,累计合并数十万个 PR。
推荐理由:Cognition 以自家客户数据和指标复盘 Devin 的强弱项,为评估智能体实际部署效果提供了可参照的框架。
Cognition 模型 / Devin 博客(网页)AI 评分6161 Cognition 复盘构建 Devin 云 Agent 的经验:为什么自建比想象中难
Cognition 基于两年多构建 Devin 的经验,指出容器化方案存在共享内核安全风险,也无法跨异步间隙保存状态,他们用 microVM 隔离和 hypervisor 级全机状态快照解决。
Augment Code 博客(网页)AI 评分4444 Augment Code:AI 原生转型的四个阶段,从智能体采纳到智能体编排
Augment Code 提出 AI 原生转型分四个阶段:约 70% 组织仍停留在第一阶段(将智能体接入日常工作流),不到 10% 让智能体自主拥有工作,几乎无人达到第四阶段全智能体编排。在软件开发生命周期六个环节中,代码生成、验证、构建失败诊断三个环节已由智能体主导,代码审查中低风险改动可自动批准。某企业客户开发者每周因代码审查阻塞的时间占比从 30% 降至 10% 以下。
Augment Code 博客(网页)AI 评分4646 Augment Code:单模型工程时代已经结束
Augment Code 本月在 Claude 和 GPT-5 之外新增 Gemini 3.1 Pro,成为其第三个可选模型,并称单模型工程时代已经结束。过去十三个月里领先模型三次易主,GPT-5.4 的每条消息价格比此前所用模型便宜约 2.6 倍。其做法是把模型、harness(Context Engine)与编排层(Intent)解耦,切换模型只需改一个设置而非迁移。
Augment Code 博客(网页)AI 评分5656 DX CTO Justin Reock 谈 AI 转型是系统性问题
DX CTO Justin Reock 在 We Built What 节目中称 AI 转型的关键在系统而非个人:DX 对 500 家公司的纵向研究显示 PR velocity 中位提升 7.5%、均值 13%、最高 70%。
Augment Code 博客(网页)AI 评分4545 Augment Code 调研 219 位工程负责人:48% 代码已由 AI 生成,仅 19 家更新了岗位定义
Augment Code 调研 219 位工程负责人发现,其团队 48% 的代码已由 AI 生成,55% 担心团队失去对代码库的共同理解,63% 表示工程师向管理者提出技能相关性担忧,在 201-1000 人团队中该比例升至 89%。
ARC Prize:官方博客AI 评分6464 ARC Prize 发布首日更新:Kaggle 登顶并回应主要质疑
ARC Prize 发布上线 24 小时的首日更新:社媒累计浏览 67.5 万,登顶 Kaggle 竞赛榜,已有 700 名 Kaggle 参赛者、70 次提交,当前最高分 18%。
Tomer Tunguz 博客(VC 分析)AI 评分4949 AI 的迷你钢厂:本地分类器分流让 Mac 承担 78% 的 AI 工作
把后台 AI 工作先交给设备端小型分类器判断难易,只将最难任务上送云端,单台 Mac 的吞吐量提升约 25%,队列等待从 73 秒降至 4 秒。过去七天该 Mac 承担了 78% 的 AI 工作、日峰值达 88%,平均任务时长从 47 秒降到 19 秒。作者将其类比 Nucor 的迷你钢厂,认为配备蒸馏模型的笔记本、手机与边缘设备将成为企业内的“迷你钢厂”,只按云端价格支付最难的那五分之一。
Tomer Tunguz 博客(VC 分析)精选AI 评分6969 Tomer Tunguz 分析 AI 领域的开源模型替代潮
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
Tomer Tunguz 博客(VC 分析)精选AI 评分6565 Tomer Tunguz 谈 Anthropic Fable 带来的 AI 玻璃天花板
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
Tomer Tunguz 博客(VC 分析)AI 评分4343 AI 应用的黄金时代:从 Fable 下架、Nadella 生态论到 Salesforce 收购 Fin
AI 应用正进入黄金时代,三件事印证了这一判断:美国政府下令下架 Fable、Nadella 提出生态护城河不在模型本身、Salesforce 以 36 亿美元收购 Fin。构建 AI 应用需掌握三项新能力:挑选合适模型、设计爬坡循环、评估模型与循环的组合表现,核心是每 token 预算能榨出多少智能。
ARC Prize:官方博客AI 评分6161 ARC Prize 三个月未破,大奖提升至 $600k 并宣布改进 ARC-AGI
ARC Prize 发布 2024 竞赛三个月更新:ARC-AGI 基准仍未被攻破,SOTA 从 34% 升至 46%(MindsAI 通过测试时微调语言模型达成),Kaggle 上有 921 支队伍、7,368 次提交。
Tomer Tunguz 博客(VC 分析)精选AI 评分6161 Tom Tunguz 分析 HN 讨论:Qwen 3.6 35B-A3B 与 Pi 领跑本地编码栈
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
Tomer Tunguz 博客(VC 分析)AI 评分5656 Databricks ARR 达 69 亿美元、增速 80%,与 Snowflake 差距扩至 16 亿美元
Databricks 年化经常性收入达 69 亿美元,同比增长 80%,Snowflake 约 53 亿美元、增长 34%,两者差距从 3 月的 4.9 亿美元扩至 16 亿美元。
ARC Prize:官方博客AI 评分6363 ARC Prize 主办讲座:结合深度学习与程序合成攻克 ARC-AGI
ARC Prize 主办线上活动,Mike Knoop 和 François Chollet 讲解为何纯深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路径。
Tomer Tunguz 博客(VC 分析)AI 评分5353 Tomer Tunguz 分析推理转售业务的三种定价模型与毛利守卫策略
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
Tomer Tunguz 博客(VC 分析)AI 评分5757 Tomer Tunguz 分析 AI 支出何时超过工程师薪酬:2029 年三种情景
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
Tomer Tunguz 博客(VC 分析)精选AI 评分6060 Tomer Tunguz 分析 2026 年 CIO 的选择:只投 AI 栈,砍掉其余
Tomer Tunguz 撰文称 2026 年 CIO 的优先级清晰:资金流向 AI 栈,其余被削减。
推荐理由:作者用公开市场分板块数据拆解 AI 时期的软件股分化,指出决定估值的是品类而非增速,分析框架可复用。
ARC Prize:官方博客精选AI 评分6868 ARC Prize 分析 DeepSeek R1-Zero 与 R1 测试结果:R1-Zero 比 R1 更重要
ARC Prize Foundation 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得 14% 和 15.8%,与 o1 低算力的 20.5% 接近,而 GPT-4o 为 5%。
推荐理由:ARC Prize 一手实测了 R1-Zero 与 R1 在 ARC-AGI-1 上的表现,提出 SFT 与纯 RL 的角色区分这一可讨论的判断。
Tomer Tunguz 博客(VC 分析)AI 评分5959 Tomer Tunguz:大多数 AI 工作可以等,路由应先于模型选择
作者认为构建 agent 的团队应把路由设计放在第一位、模型选择放在最后。他提出三层结构:技能分类器识别任务意图、路由器根据复杂度等特征决定执行层级、模型选择器在层级内挑最便宜的合格模型。
Tomer Tunguz 博客(VC 分析)AI 评分5353 The Economist 用世界价值观调查测 25 个前沿 AI 模型的世界观
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
Tomer Tunguz 博客(VC 分析)精选AI 评分6464 Tomer Tunguz 解析 $10B 前向部署工程潮:三种模式与护城河逻辑
AI 公司在 12 个月内投入 $9.75b 于前向部署工程(FDE),相当于 Accenture 年度人力成本的四分之一。
推荐理由:原文把 $9.75b FDE 投入拆成三种资本结构,并解释部署取代模型能力成为瓶颈后的护城河逻辑。
Tomer Tunguz 博客(VC 分析)AI 评分3737 Theory Ventures 成立三周年:AI 压缩时间如何重塑风投与推理市场
Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。
Tomer Tunguz 博客(VC 分析)精选AI 评分6060 Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间
Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。
推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。
Tomer Tunguz 博客(VC 分析)AI 评分5757 Tomer Tunguz:AI harness 正成为企业数据竞争的新战场
VC Tomer Tunguz 撰文分析 AI 时代企业数据外流风险,引用 Satya Nadella 的“反向信息悖论”与 Palantir CEO Alex Karp 关于前沿实验室“窃取业务权重与 alpha”的言论。