Google DeepMind复盘WeatherNext如何帮助NHC提前五天预测飓风Melissa牙买加登陆
Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。
推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。
Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。
推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS、ParaThinker、GroupThink、Hogwild!
Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
Jack Clark 在 Import AI 455 撰文称,他认为 2028 年底前出现无人类参与的自动化 AI 研发(AI 自主训练后继模型)的概率超过 60%,2027 年的概率约为 30%。
you can outsource your thinking but you cannot outsource your understanding
安全研究员 Johann Rehberger 分析 Anthropic 发布的 Mythos Preview 模型:据其公告,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,Mythos Preview 成功 181 次,还发现了 27 年历史的 OpenBSD SACK 漏洞和 17 年历史的 FreeBSD NFS RCE。
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Ethan Mollick 撰文指出,AI 能力被聊天机器人界面拖累,一篇让金融从业者用 GPT-4o 做估值任务的研究发现,AI 输出的大量文本增加了认知负荷,抵消了部分生产力收益。
Answer.AI 联合创始人 Rachel Thomas 与 KAMI Think Tank 的 Kamayani Gupta 对谈生命科学中 AI 应用的风险与局限,本文为整理稿。
Ethan Mollick 撰文认为 AI 已进入由 Claude Code、OpenAI Codex 等 Agent 驱动的管理 AI 新阶段,多项基准如 GPval、Humanity's Last Exam 显示能力持续指数级提升。
Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。
推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
这篇发表于 Lawfare 研究论文系列的长文提出核心观点:先进 AI 默认不会帮消费者以更低成本实现法律结果。作者指出三大瓶颈,包括 UPL 等监管壁垒、诉讼与交易中的对抗性军备竞赛,以及法官和律师等人类参与的速度上限,并以数字化未能降低 discovery 成本为历史类比。文章最后梳理了职业监管改革、裁判方式改革和律师角色演变等改革建议,说明法律行业的制度回应将决定 AI 的影响方向。
Steve Yegge 提出 AI 正像能量吸血鬼一样耗干开发者。他认为 Opus 4.5/4.6 加 Claude Code 让 AI 编码真实带来约 10x 生产力提升,但由此产生的价值要么被雇主全部捕获导致过劳,要么引发全员摸鱼、公司被竞争对手淘汰。
Sierra 在进入第三年之际宣布 ARR 超过 1.5 亿美元,此前用七个季度达到 1 亿美元 ARR,并迎来首个 5000 万美元季度。
Steve Yegge 撰文分析 Anthropic 内部运作方式,称过去四个月与近 40 名员工深谈后,判断其正处在以全员高透明、即时协作和即兴式探索为特征的黄金时代。
Arvind Narayanan 在其基于 YouTube 视频的长文中指出,Moravec 悖论(对人类难的任务对 AI 容易,反之亦然)从未被实证检验,它更像是 AI 研究社区对值得关注问题的选择效应,其进化论解释也可疑。
Steve Yegge 依据对 AI 指数级进步的判断,提出软件生存的“选择压力”模型,核心论点是节省 token 即节省认知的软件更可能在 Karpathy 所说的 Software 3.0 时代存活。
Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。
推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。
安全研究员 Johann Rehberger 提出偏差正常化概念,指行业正逐渐把过度依赖 LLM 输出的不安全做法变成常态,视不可靠模型输出为可信。
我提出的一个观点没有被传达出来: - 扩展当前的东西会持续带来改进。特别是,它不会停滞。 - 但某个重要的东西会继续缺失。
here are the most important points from today's ilya sutskever podcast: - superintelligence in 5-20 years - current scaling will stall hard; we're back to real research - superintelligence = super-fast continual learner, not finished oracle - models generalize 100x worse than humans, the biggest AGI blocker - need completely new ML paradigm (i have ideas, can't share rn) - AI impact will hit hard, but only after economic diffusion - breakthroughs historically needed almost no compute - SSI has enough focused research compute to win - current RL already eats more compute than pre-training
Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。
推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。
Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。
推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。
Ethan Mollick 在 One Useful Thing 发文,认为 AI 使用正从共同协作转向「召唤巫师」式的被动接收。
推荐理由:作者以论文重审、表格改造等一手实测为基础,提出从协作到巫师式 AI 使用的关系转变与验证难题。
Arvind Narayanan 撰文澄清《AI as Normal Technology》的核心论点:AI 能力提升与社会影响之间存在长因果链,收益和风险在部署而非开发阶段实现,因此应聚焦部署环节并以韧性应对不可预测的影响。
Johann Rehberger 在 Embrace The Red 发布"The Month of AI Bugs"月度总结,汇总该月披露的 AI 相关漏洞。原文未列出具体模型、厂商或漏洞数量等细节。
Ethan Mollick 提出「Mass Intelligence」时代正在到来,超过十亿人日常使用 AI 聊天机器人,ChatGPT 周活超 7 亿。
Sayash Kapoor 在 AI as Normal Technology 系列长文中提出,尽管论文数量在 1900 至 2015 年间增长 500 倍,实际科学进步却在持平或放缓,这一生产进步悖论意味着 AI 可能进一步扩大差距。
Sayash Kapoor 撰文主张 AGI 不是里程碑,公司的 AGI 宣告对企业、开发者、政策制定者和安全都没有可操作意义。文章以 o3 为例指出即使系统满足某些 AGI 定义,其经济影响仍需数十年扩散才能实现,并建议区分能力与权力、政策应聚焦促进安全扩散而非追逐 AGI。
Arvind Narayanan 发表超过 1.5 万字的新论文《AI as Normal Technology》,提出应把 AI 视为可被人控制的普通技术,而非超人智能实体,并将扩展为下一本书,HTML 和 PDF 版本发布在 Knight First Amendment Institute 网站。
Sam Altman 在 ChatGPT 两周年之际发文回顾 OpenAI 近九年历程:ChatGPT 于 2022 年 11 月 30 日发布,用户已从约 1 亿周活增长到超过 3 亿。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic、Google Gemini 下一代模型遇阻后业内关于模型 scaling 已死的叙事转向,认为现在断言模型 scaling 终结为时尚早,且业内高管的预测受商业利益影响,不应盲从。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 起 2024 全球选举 AI 使用案例,发现其中 39 起无欺骗意图,且欺骗性内容不用 AI 也能以几百美元内成本复制。
Narayanan 等人撰文分析英国 NHS 肝移植匹配算法对年轻患者的系统性偏差。算法以预测患者有/无移植后 5 年存活率之差计算 TBS 评分,5 年上限低估了年轻患者终身获益,45 岁以下患者无论病情多重都难以获得优先排序,2024 年《柳叶刀》研究确认了这一偏差,患者群体早在 2015 年就通过官方渠道提出过警告。
《AI Snake Oil》新书上周出版,目前已售出约 8000 册,作者就读者常见疑问作出回应。作者表示对预测式 AI 持负面看法,认为其受限于预测人类行为的社会学固有边界;对生成式 AI 则长期看好,称其几乎对所有知识工作者有用,但落地过程混乱、滥用普遍。作者还称已不再认同 AI 安全、e/acc 或 AI 伦理任何一方标签,认为阵营对立适得其反。
深度神经网络参数量巨大却仍能泛化,Lilian Weng 从压缩与模型选择角度梳理了相关理论。文章讨论了奥卡姆剃刀、最小描述长度(MDL)原理与 Kolmogorov 复杂度,并补充了 Lottery Ticket Hypothesis 一节。
Sam Altman 在其博文中提出,人类与机器的融合已经开始数年,且将是一个渐进过程而非单一时刻。他认为手机、社交媒体和搜索引擎背后的算法已在塑造人类行为,而超级智能 AI、基因增强和脑机接口终将实现。他主张融合是最好结果,人类应认真对待全球协调,并称自己曾难以抵抗算法的注意力劫持。