跳到正文

#推理

今日 5 条
9月30日周三
  1. ARC Prize:官方博客67

    ARC-AGI-3 交互式推理基准发布

    ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。

    推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。

  2. ARC Prize:官方博客69

    ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力

    ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。

    推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。

  3. ARC Prize:官方博客33

    ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能

    ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。

  4. Tomer Tunguz 博客(VC 分析)70

    Tomer Tunguz 解析 AI 消耗的三波浪:从聊天、单智能体到 meta-harness

    Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。

    推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。

  5. Tomer Tunguz 博客(VC 分析)59

    Tomer Tunguz 分析 OpenAI 3 倍研究产出实为机器三班倒与每日 600 美元推理成本

    Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。

  6. Baseten Base Labs:模型研究29

    Kimi K3

    月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。

  7. Meta AI:Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。

    推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。

  8. Fireworks AI(网页)68

    Fireworks Research 发布 Ember-1:以 Kimi K3 为基础实现同等质量下更省 token

    Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。

    推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。

  9. Dario Amodei:Blog(网页)74

    Dario Amodei 发文《技术的青春期》:剖析强大 AI 的五类风险并给出应对路线

    Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。

    推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。

  10. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。

  11. Artificial Analysis 完整文章(网页)78

    Claude Sonnet 5.5 登上 Artificial Analysis 智能指数第 2 名,token 用量创测量新高

    Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数得分 56(max 档较 Sonnet 5 提升 18 分),仅次于 Opus 5.5 (max)。

    推荐理由:原文给出 Sonnet 5.5 在智能指数、token 用量和成本上的具体数据,读者可据此对比其与 Opus 5.5 和 GPT-6 系列的实际取舍。

  12. Artificial Analysis 完整文章(网页)73

    GPT-6.1 Sol 发布 7 天后替代 GPT-6 Sol,智能指数仅比 GPT-6 Astra 低 1 分

    Artificial Analysis 评测 GPT-6.1 Sol:智能指数比 GPT-6 Sol 高 4 分,距 GPT-6 Astra 仅 1 分,每任务成本 $0.72 不到 GPT-6 Astra 的四分之一。

    推荐理由:原文给出 Intelligence Index 得分、Cost per Task 与各基准的逐项对比,读者可据此判断 GPT-6.1 Sol 在成本效率前沿上的位置。

  13. ARC Prize:官方博客43

    ARC Prize 2026 - ARC-AGI-3 竞赛排行榜

    ARC Prize 2026 - ARC-AGI-3 竞赛当前排行榜显示,Tufa Labs 以 45.33 分位居第一,Yi-Chia Chen 以 40.80 分排名第二,Daniel Franzen 以 27.24 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。

  14. Anthropic:Research(发表成果 · 网页)76

    物理学家 Matt von Hippel 复盘 Claude 用 bootstrap 方法算出 N=4 超对称 Yang-Mills 九环振幅

    物理学家 Matt von Hippel 发起挑战后,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 配合 Claude Science 平台算出了 planar N=4 super Yang-Mills 的九环六粒子振幅。

    推荐理由:作者亲历发起挑战到被 Claude 算出九环结果的全过程,给出预算、验证方式和人类团队对比等一手细节。

  15. Anthropic:Research(发表成果 · 网页)82

    Anthropic 红队评测:GLM-5.3 具备端到端漏洞利用能力且防护易被绕过

    Anthropic 前沿红队发布对智谱 GLM-5.3 的评测,发现它能自主构建端到端网络漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

    推荐理由:Anthropic以第一手评测数据给出GLM-5.3的攻击能力与防护绕过率,读者可据此权衡开源权重模型在网络攻防两侧的风险。

  16. Tomer Tunguz 博客(VC 分析)57

    Tomer Tunguz 解析 GPU 租金翻倍而 AI 成本仍下降的原因

    GPU 租赁价六个月内从 $4.40 涨到 $8.08 每卡时,但 AI 价格仍在下降。文章归因于数据中心建设推高电力、材料和信贷成本,需求激增放大竞价;同时模型效率快速提升,Claude Opus 5.5 运行成本降 40%,同一基准的通过成本从 $0.55 降至 $0.0015。Microsoft 称每 GPU 生成的 token 年增 90%,效率与成本两股力量大致相当。

9月29日周二
  1. Apple Machine Learning Research(RSS)47

    语言模型的通信瓶颈:树结构表达式序列化的往返研究

    Apple 研究者提出往返协议,测试语言模型将树结构算术表达式序列化为自然语言后能保留多少信息。评估 16 个模型的所有两两组合发现,通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本可将所有开源权重模型提升至未训练 Gemini-3.1-Pro 之上。