Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前
Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。
推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。
Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。
推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。
英国王立协会《Philosophical Transactions of the Royal Society A》发布特集号「World Models in Natural and Artificial Intelligence」,Sakana AI CEO David Ha 参与卷首文章共著。
METR 研究者 Thomas Kwa 提出一个仅 8 个参数的简化模型,预测在现有算力增长与算法进步速度下,AI 研发将在 2032 年底实现超过 99% 的自动化。该模型基于 33 参数的 AI Futures 模型(AIFM)简化而来,采用更保守的假设,多数模拟显示到 2035 年 AI 效率提升 1000 倍至 1000 万倍、研究产出提升 300 至 3000 倍。
METR 研究员 Nikola Jurkovic 让 Opus 4.6 用简单 ReAct 脚手架复刻 Slay the Spire 和 Balatro 的 CLI 版本,得到基本可玩但有不少缺陷的实现。
METR 提出 AI 生产力提升(uplift)的三种度量——旧任务 uplift、价值 uplift 与新任务 uplift,并论证在简化假设下三者满足「旧任务 uplift ≤ 价值 uplift ≤ 新任务 uplift」。
METR 研究员 Parker Whitfill 与 Tom Cunningham 联合 7 位经济学家发布论文《The Economics of Recursive Self-Improvement》,用一系列简化模型分析 AI 如何加速 AI 研发,以及反馈效应是否强到足以形成"自我维持的加速"。
METR 在 2026 年 2–4 月调查 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),自报 AI 工具带来的工作中位价值变化为 1.4–2 倍,中位速度变化为 3 倍。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
https://x.com/i/article/2104955648664584192
MIT 研究人员系统评估了算法单一化的主要反对意见,认为系统性排斥等论点并不成立,并用数学证明单一化主要造成信息回声室、阻碍探索。在招聘场景中,将多个招聘算法组合成单一“ensemble”可克服这一局限,有时表现不逊于甚至优于多算法并存的 polyculture。研究发表于 Philosophical Perspectives。
Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki 等 20 多位 AI 研究者在一篇新论文中警告,自我改进的 AI 可能引发“智能爆炸”。
这是一份很不错的报告,探讨了最重要的问题之一:AI 可能如何影响科学与创新?它如今已经在产生什么影响? 干得漂亮,Mihai 和团队。
I've had the most wonderful time working on this project for the last few months. This was (equally) co-led w/ @JMateosGarcia , @alexolegimas and a fantastic team.
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件,Opus 4.7 用 14 小时、251 美元推理成本完成了人类需 2-17 周的任务,25 个目标程序中 17 个有满分运行。
Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。