跳到正文

#推理

今日 85 条
9月30日周三
  1. ARC Prize:官方博客57

    ARC Prize 成立非营利基金会,Greg Kamradt 出任主席并筹备 2025 年赛事

    ARC Prize 宣布转型为 501(c)(3) 非营利基金会,2024 年联合负责人 Greg Kamradt 出任主席并加入董事会。ARC-AGI-2 基准与论文将于 2025 年第一季度末发布并用于 2025 年赛事,ARC-AGI-3 已在开发中;2024 年赛事有超过 1400 支队伍提交 1.7 万份方案,基金会还计划与前沿实验室合作并在 1 月中旬启动募资。

  2. ARC Prize:官方博客44

    ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准

    ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。

  3. ARC Prize:官方博客69

    ARC Prize 实测 o3 与 o4-mini 在 ARC-AGI 上的表现

    ARC Prize Foundation 发布 o3 和 o4-mini 在 ARC-AGI 上的首次公开评测:o3-medium 在 ARC-AGI-1 Semi Private Eval 得 53%,o4-mini-medium 得 42%,两者在 ARC-AGI-2 上均低于 3%。

    推荐理由:ARC Prize 官方实测给出了 o3 与 o4-mini 在 ARC-AGI 两代基准上的准确率、成本和 high 推理不完整覆盖的数据细节。

  4. ARC Prize:官方博客66

    ARC Prize 发布 ARC-AGI-2 技术报告,前沿模型得分不足 5%

    ARC Prize 发布 ARC-AGI-2 技术报告,推出比 ARC-AGI-1 更细粒度评估抽象推理的新基准。400 人实测 1,417 个任务全部可被人类解出,平均每题约 2.3 分钟;发布时所有前沿模型成功率不足 5%,而同类模型在 ARC-AGI-1 上通常达 20%-50%。

    推荐理由:原文给出人类与当前模型在同一新基准上的实测对比,读者可以据此评估推理能力的差距所在。

  5. Tomer Tunguz 博客(VC 分析)37

    Theory Ventures 成立三周年:AI 压缩时间如何重塑风投与推理市场

    Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。

  6. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  7. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  8. ARC Prize:官方博客66

    ARC Prize 发布 ARC-AGI-3 Preview 30 天总结:人类轻松通关,AI 智能体进展艰难

    ARC Prize 基金会总结 ARC-AGI-3 Preview 上线 30 天的发现,首个交互式推理基准显示人类大多能通关游戏,AI 智能体则难以高效推进。竞赛收到 12 份提交,冠军 StochasticGoose 得分 12.58%,完成 18 个关卡,团队还提出以行动效率衡量智能,并计划增加撤销、离线引擎等改进。

    推荐理由:原文给出了人类与 AI 在交互式推理基准上的行动效率差距和评分框架,读者可以据此理解智能评测的新方向。

  9. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  10. ARC Prize:官方博客81

    OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 最高分并超越人类动作效率基线

    ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。

    推荐理由:ARC Prize 官方实测数据完整,读者可以据此比较 GPT-6 Astra 在两种评测条件下的得分、成本与人类动作效率差异。

  11. Anthropic:Newsroom(网页)63

    Anthropic 解释 Claude 文本水印的工作原理

    Anthropic 宣布未来的 Claude 模型生成文本将带水印,以遵守欧盟 AI Act 对 AI 生成内容标记的要求,采用 Google DeepMind 2024 年 Nature 论文中的 SynthID-Text 方法,并随 2026 年 7 月约 190 个签署方的 EU Code of Practice 一同公布。

    推荐理由:官方解释了水印只改变选词随机性来源这一原理,以及质量、价格、检测 API 和各类边界情况的影响。

  12. Tomer Tunguz 博客(VC 分析)65

    Tom Tunguz 分析:谁在真正购买 SOTA 模型

    Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。

    推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。

  13. Tomer Tunguz 博客(VC 分析)70

    Tom Tunguz 实测 Qwen3.8-27B 本地模型, birds fly like bumblebees 而非飞机

    Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。

    推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。

  14. ARC Prize:官方博客67

    ARC-AGI-3 交互式推理基准发布

    ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。

    推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。

  15. ARC Prize:官方博客69

    ARC-AGI-2 基准发布,设计用于测试 AI 推理系统的符号解释与组合推理能力

    ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。

    推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。

  16. ARC Prize:官方博客33

    ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能

    ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。

  17. Tomer Tunguz 博客(VC 分析)70

    Tomer Tunguz 解析 AI 消耗的三波浪:从聊天、单智能体到 meta-harness

    Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。

    推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。

  18. Tomer Tunguz 博客(VC 分析)59

    Tomer Tunguz 分析 OpenAI 3 倍研究产出实为机器三班倒与每日 600 美元推理成本

    Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。

  19. Baseten Base Labs:模型研究29

    Kimi K3

    月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。

  20. Eugene Yan:Writing58

    Eugene Yan 详解九个机器学习系统设计模式

    Eugene Yan 总结九个机器学习系统设计模式,包括原始数据只处理一次、Human-In-The-Loop 标注、数据增强、难负例挖掘、问题重构、级联、数据飞轮、业务规则层和上线前评估。每条模式给出优缺点并结合 Meta、DoorDash、Twitter、Stack Exchange、ChatGPT 等案例,并探讨这些模式在 LLM 系统中的适用性。

  21. Eugene Yan:Writing37

    关于 Attention 与 Transformer 的一些直觉理解

    文章用图书馆检索的类比解释 Attention 中的 query、key、value 向量:query 与各 key 做点积衡量相关性,经 softmax 归一化后对 value 加权求和。相比把整句压进固定向量的 encoder-decoder 循环模型,Attention 让解码器每步都能看到整个输入句,缓解信息瓶颈与长距离依赖,并支持并行计算。多头机制则让模型同时关注多个词。