#大佬观点
#大佬观点
今日 3 条
Sakana AI@SakanaAILabsAI 评分3535
Peter McCrory@PeterMcCroryAI 评分2727如今机器人能完成哪些工作?这对未来数年的经济结构又意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。
Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分6363 Gary Marcus 访谈 Fordham 法学教授 Zephyr Teachout,谈 OpenAI 可能触犯哪些现行法律
Gary Marcus 发布对 Fordham 法学教授 Zephyr Teachout 的访谈,讨论 OpenAI 是否可依现行法律被追责。
推荐理由:法学教授逐条对照现行法律分析 OpenAI 智能体入侵与致害事件,说明现有联邦和州法律并非真空,可迁移到其他公司的责任判断。
TensorZero:实验与工程博客AI 评分4747 TensorZero:把 LLM 应用看作 POMDP,而不是 Agent
TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。
Suno:Blog(网页)AI 评分2626 Suno 专访钢琴家 Eric Christian:用 AI 在几秒内听到交响乐规模的旋律
纽约钢琴家兼作曲家 Eric Christian 在 Suno 专访中表示,Suno 是他检验新旋律的最后一步,能在几秒内听到作品按他设想的交响乐规模呈现,而过去做管弦乐 mockup 要花数小时。他已向 200 个国家的演奏者售出超过 10 万份乐谱,并称对古典音乐人而言这类工具是"适应或淘汰"的选择。
Suno:Blog(网页)AI 评分2828 Matt Steffanina 谈用 Suno 掌控舞蹈视频背后的音乐
洛杉矶舞者、编舞师兼 DJ Matt Steffanina 在 Suno 博客访谈中表示,他用 Suno 为舞蹈内容创作原创音乐,把概念落地的时间从数天缩短到几分钟。他此前围绕他人音乐积累了数十亿播放量却不拥有底层资产,转向自制并拥有音乐后获得了更多机会与长期控制权。他近期在市中心地下通道拍摄的舞蹈视频即用 Suno 生成一首 house 曲目,成为其表现最好的 Hooks 之一。
Suno:Blog(网页)AI 评分3333 Dream Relic 如何用 Suno 为超现实视觉世界赋予声音
AI 视觉艺术家 Dream Relic(Broc Vaughn)借助 Suno 的 Create 功能,把积压多年的歌词变成歌曲,用于 TikTok、Hooks、Spotify 及一张即将发行的全长专辑。一条深夜发布的视频引来数百条求歌名评论,让他重新重视音乐创作。他认为提示词与反复打磨等创作方向仍然关键,目标是让人感受作品而非关注工具。
Suno:Blog(网页)AI 评分3131 sad alex 谈用 Suno 当创作草稿本:写歌、短视频与创作自主权
洛杉矶唱作人 sad alex 在 Suno 博客访谈中表示,她只把 Suno 当作解决问题的工具,用于男女声切换、补充自己不会演奏的弦乐或电吉他,以及为卡住的 demo 搭出可参考的成品雏形。她强调只上传自己 100% 拥有版权的歌曲,并认为 AI 本质上无法像人一样向前思考,歌曲的新鲜感与演唱的感染力仍来自人。
METR:Blog(网页)AI 评分4040 METR:AI 模型在公开发布前就可能带来危险
METR 指出,仅靠部署前测试不足以管理 AI 风险,因为模型在内部使用、训练或存储阶段就可能造成危害。模型权重可能被窃取滥用,实验室员工可能内部误用,AI 智能体也可能自主追求非预期目标。METR 建议加强更早期的危险能力测试与能力预测、模型权重安全与内部监控,并提升透明度与举报人保护。
METR:Blog(网页)AI 评分4949 METR:为什么 AI 推理的可读性与忠实性对安全开发强大 AI 有价值
METR 发文论证 AI 推理应当既"可读"(人类可理解的自然语言)又"忠实"(真实反映模型内部决策过程),认为这有助于发现模型错误、识别隐藏议程、监测欺骗行为。
METR:Blog(网页)AI 评分4141 METR 谈如何传播令人意外或微妙的研究发现
METR 发文说明其在传播令人意外或微妙的研究发现时如何权衡取舍,并以近期"Early-2025 AI 对资深开源开发者生产力影响"的随机对照试验为例。该研究测得开发者在使用 AI 工具时反而更慢,团队在图表标题上纠结于"AI 拖慢开发者"还是"开发者高估提速",最终因测量内部效度可靠而选择如实呈现减速结果。METR 表示作为独立非营利机构,其可不受知识产权或利润约束公开重要结果。
METR:Blog(网页)AI 评分5050 METR 外部评审 Anthropic 2026 年 2 月风险报告“自动化 R&D 风险”章节
METR 对 Anthropic 2026 年 2 月风险报告中“自动化 R&D 风险”章节完成外部评审,认为报告结论缺乏充分证据支撑。METR 指出该章节在分析严谨性、模型使用调查结果解读及证据呈现上存在重大问题,包括样本量、问题粒度和调查框架缺陷,并将一处未作答误计为否定回答。
Stanford HAI News(网页)AI 评分5252 斯坦福 HAI 发布政策简报探讨世界模型治理为何是 AI 下一个政策挑战
斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。
Fireworks AI(网页)AI 评分5050 Fireworks AI:从租用闭源前沿模型到训练自有模型,企业迈向专业化智能的三阶段路径
Fireworks AI 发文梳理企业迈向专业化智能的三阶段路径:先租用闭源前沿模型并围绕其搭建提示词、上下文与 harness 工程,再引入更便宜的开源模型优化成本与延迟,最终为真正属于自己的问题训练定制模型。文中以 Kimi K3 与 GPT 5.6 Sol 在 OSWorld 2.0、UIPad 上的对比为例,说明基准只能用于初筛,自建评测才是性能的最佳指标。
Dario Amodei:Blog(网页)AI 评分4949 Anthropic CEO Dario Amodei 谈 Claude 3.5 Sonnet 与 AI 安全竞赛
Anthropic 于 6 月 20 日发布 Claude 3.5 Sonnet,官方称其在推理、编程和部分数学任务上超越 OpenAI 的 GPT-4o。CEO Dario Amodei 在 TIME 采访中表示,公司已获高个位数十亿美元融资,但仍视自己相对巨头为弱势一方,并称未看到 scaling laws 放缓的证据。
Dario Amodei:Blog(网页)AI 评分3737 Stripe 播客对话 Anthropic CEO Dario Amodei:ARR 达 50 亿美元与智能体未来
Anthropic CEO Dario Amodei 在 Stripe 的 "A Cheeky Pint" 播客中与 John Collison 对话,谈及 Anthropic 年化收入(ARR)增长至约 50 亿美元。他讨论了 AI 模型表现出的"资本逐利冲动"、对智能体未来的预测、模型生意的经济学,以及 19 世纪活力论(vitalism)概念。
Cognition 模型 / Devin 博客(网页)精选AI 评分7575 Cognition 复盘多智能体系统实践:写入保持单线程、其他智能体贡献智能
Cognition 发布长文复盘,认为多智能体系统目前只在写入保持单线程、其他智能体贡献智能的模式下有效。
推荐理由:Cognition 一线团队复盘了真正跑通的多智能体模式,给出干净的审查上下文和单线程写入等可迁移经验。
Augment Code 博客(网页)AI 评分5656 DX CTO Justin Reock 谈 AI 转型是系统性问题
DX CTO Justin Reock 在 We Built What 节目中称 AI 转型的关键在系统而非个人:DX 对 500 家公司的纵向研究显示 PR velocity 中位提升 7.5%、均值 13%、最高 70%。
Augment Code 博客(网页)AI 评分5757 Augment Code 解析 loop engineering 与团队级 agentic SDLC 循环
Augment Code 博客提出 loop engineering 概念,即设计从触发、执行、验证到产出的智能体循环,人类在需要判断力的检查点介入。
Tomer Tunguz 博客(VC 分析)精选AI 评分6565 Tomer Tunguz 谈 Anthropic Fable 带来的 AI 玻璃天花板
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
ARC Prize:官方博客AI 评分6363 ARC Prize 主办讲座:结合深度学习与程序合成攻克 ARC-AGI
ARC Prize 主办线上活动,Mike Knoop 和 François Chollet 讲解为何纯深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路径。
Tomer Tunguz 博客(VC 分析)AI 评分5353 Tomer Tunguz 分析推理转售业务的三种定价模型与毛利守卫策略
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
Tomer Tunguz 博客(VC 分析)AI 评分3131 Glean CISO Sunil Agrawal 谈如何防御 AI 驱动的攻击者
Glean CISO Sunil Agrawal 将做客 Office Hours,讨论攻击者使用前沿模型进行侦察、钓鱼、深度伪造和漏洞生成时的安全准备。对话于太平洋时间 7 月 9 日周四上午 9 点举行,聚焦 AI 压缩目标理解与攻击面测绘时间、攻击语法与语气线索消失、深度伪造通话改变审批与支付信任控制面等议题。
Tomer Tunguz 博客(VC 分析)AI 评分5252 Tomer Tunguz 详解 AI 智能体的记忆架构与 preflight 检查
Tomer Tunguz 介绍其正在实验的智能体记忆架构:查询先经 preflight 从约 90 个技能文件中按意图检索相关技能载入上下文窗口,再由本地 Ornith 35B(经 Ollama 运行于 Apple Silicon)执行,约 80% 的常规任务留在本地,困难任务路由到 frontier 模型。
Tomer Tunguz 博客(VC 分析)AI 评分4141 AI 是糟糕的枪手,却是出色的编辑
投资人 Tomer Tunguz 认为 AI 是糟糕的枪手但出色的编辑:AI 的声音不属于作者,且所有人共用同一个枪手,用多了文章会失去音乐性。他如今用 AI 当编辑,帮自己打磨导语与核心段,其对冷门统计分析的记忆近乎无懈可击。为应对读者对 AI 写作的质疑,他刻意在文中加入 & 符号、自造词和语法花饰等个人印记。
Tomer Tunguz 博客(VC 分析)AI 评分5151 AI 智能体应该活多久?Tomer Tunguz 主张日常助手 24 小时重置
Tomer Tunguz 分析长会话智能体的问题:对话轮次堆积导致注意力退化,临时指令变成永久残留,长期读写权限还会被恶意邮件投毒劫持日程。他提出日常协调者只活 24 小时,任务委派给仅存活约 30 秒的单一用途子智能体,午夜由离线摘要器把持久偏好写入 preferences.md 后清空对话,并附上两个系统提示词示例。
Tomer Tunguz 博客(VC 分析)精选AI 评分7070 Tomer Tunguz 分析 AI 模型公司的每兆瓦收入与模型工厂逻辑
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
Tomer Tunguz 博客(VC 分析)精选AI 评分6161 Tomer Tunguz 分析前沿 AI 市场的准入分化:访问权取代价格成为新稀缺
Tomer Tunguz 撰文指出前沿 AI 市场正分化为封闭阵营,实验室通过选择伙伴、限制访问来管控最强模型。
推荐理由:作者梳理了前沿模型从按 token 出售转向准入管控的多方实例,并给出开源与 Nvidia 反制力量的行业分析。
Tomer Tunguz 博客(VC 分析)精选AI 评分7272 Tomer Tunguz 分析 Meta Muse Spark 双轨定价如何把广告模式引入 AI
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Google Developers Blog(RSS)AI 评分4242 为什么 Go 是 AI 辅助软件工程的理想语言
Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。
World Labs:官网AI 评分2929 李飞飞:有了空间智能,AI 将理解真实世界
李飞飞提出“空间智能”概念,即 AI 在 3D 空间中感知、推理并行动的能力,认为这将让机器真正理解并与物理世界交互。该内容来自 World Labs 官网,原文发布于 2024 年 5 月 16 日。
World Labs:官网AI 评分2121 World Labs:Christoph Lassner 谈 GenAI 时代的内容 3.0
World Labs 发布 Christoph Lassner 的分享,探讨生成式 AI 如何催生一种角色与世界可动态演化的新媒介,以及这对叙事和数字内容未来的意义。
World Labs:官网AI 评分5252 李飞飞:空间智能是 AI 的下一个前沿
李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。
World Labs:官网AI 评分5252 World Labs 撰文论述 3D as code:3D 表征将成为人与机器交互空间的通用接口
World Labs 发表长文,提出 3D 表征之于空间世界的角色类似代码之于软件,是人与机器生成、编辑、模拟和共享世界的通用接口。文章论证代码与 3D 在人机协作和机器间互通上的结构相似性,指出神经 graphics 类似编程语言、模拟引擎类似芯片,并对比了将状态内嵌于单一生成模型与采用因子化混合运行时的取舍。
Preferred Networks:AI 研究与产品AI 评分1212 Preferred Networks 联合创始人致辞:从应用、基础模型到芯片全栈布局计算
Preferred Networks 联合创始人表示,公司将覆盖从应用、基础模型到计算基础设施与半导体的每一层计算栈,用应用与基础模型预判未来负载并反哺芯片设计,同时以基础设施方向指导模型与应用开发。公司称将与各行业伙伴推进技术开发与社会落地,并以“Learn or Die”为价值观持续推动技术创新。
Dario Amodei:Blog(网页)AI 评分22 Google Scholar 页面加载失败提示与登录验证界面
Google Scholar 当前无法完成操作,页面提示“系统暂时无法执行此操作,请稍后重试”。界面同时要求用户完成人机验证以证明不是机器人,并提供登录入口以访问个人资料、我的图书馆、指标、快讯和设置等功能。
Dario Amodei:Blog(网页)精选AI 评分6868 Dario Amodei 撰文回应 DeepSeek 并为芯片出口管制辩护
Anthropic CEO Dario Amodei 发文认为 DeepSeek 的发布不削弱美国对华芯片出口管制的理由,反而使其更重要。他提出缩放定律、移动曲线、转移范式三个动态,称 DeepSeek-V3 是沿预期成本下降曲线的合理结果而非独特突破,R1 则复现了 OpenAI o1 的思路。
推荐理由:作者以成本曲线分析逐条回应 DeepSeek 低成本冲击的说法,读者可借此检验出口管制论点的实际依据。
Dario Amodei:Blog(网页)精选AI 评分6767 Dario Amodei 撰文呼吁加速 AI 可解释性研究
Dario Amodei 发表长文《The Urgency of Interpretability》,主张可解释性研究与模型能力正在赛跑,必须在强大 AI 到来前理解模型内部机制。
推荐理由:作者本人是可解释性研究的当事方,文中给出技术进展、2027目标和政策主张,读者可以据此了解这个方向的路线图。
Dario Amodei:Blog(网页)精选AI 评分7575 Dario Amodei 发布长文阐述 AI 指数级进展下的政策主张
Anthropic CEO Dario Amodei 发表长文,认为 AI 规模化定律推进迅速而政策制定太慢,呼吁在监管与公共安全、宏观经济与税收、科学创新、国家权力与公民自由、地缘政治五个领域重构政策。
推荐理由:Dario Amodei 以第一人称提出五领域 AI 政策主张并附 Anthropic 立法提案,读者可以据此了解行业头部公司对监管的立场。
Dario Amodei:Blog(网页)精选AI 评分7171 Dario Amodei 提出放缓前沿 AI 能力步伐的三步计划
Anthropic 创始人 Dario Amodei 撰文呼吁在继续推进 AI 的同时放缓模型能力提升速度,给安全工作留出时间,并称 recursive self-improvement 自今夏起已在行业内加速、6–12 个月内类似 OAI-HF 的智能体群体可能造成更大规模破坏。
推荐理由:作者以当事方身份提出分阶段放缓前沿模型能力的三步计划,并宣布 Anthropic 单方面承诺引入嵌入式第三方评估者。