跳到正文

#现象/趋势

今日 1 条
今天10月1日周四
  1. Anthropic:Research(发表成果 · 网页)69

    Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前

    Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。

    推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。

9月30日周三
  1. METR:Notes(网页)47

    METR 研究者的简化 AI 时间线模型:预测约 2032 年底实现 99% AI 研发自动化

    METR 研究者 Thomas Kwa 提出一个仅 8 个参数的简化模型,预测在现有算力增长与算法进步速度下,AI 研发将在 2032 年底实现超过 99% 的自动化。该模型基于 33 参数的 AI Futures 模型(AIFM)简化而来,采用更保守的假设,多数模拟显示到 2035 年 AI 效率提升 1000 倍至 1000 万倍、研究产出提升 300 至 3000 倍。

  2. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

9月29日周二
  1. MIT News(RSS)46

    MIT 研究:算法单一化的影响取决于具体细节

    MIT 研究人员系统评估了算法单一化的主要反对意见,认为系统性排斥等论点并不成立,并用数学证明单一化主要造成信息回声室、阻碍探索。在招聘场景中,将多个招聘算法组合成单一“ensemble”可克服这一局限,有时表现不逊于甚至优于多算法并存的 polyculture。研究发表于 Philosophical Perspectives。

9月19日周六
9月17日周四
8月13日周四
7月27日周一
6月22日周一
  1. Import AI66

    Import AI 462:AI说服力超越人类专家、自我维持AI时间线与DeepMind探讨通向ASI的路径

    Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。