ARC Prize 推出每日谜题:用 Wordle 式玩法挑战 ARC-AGI 基准
ARC Prize 推出 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,玩家可分享解题用时与尝试次数。MindsAI 团队在突破 40% 门槛三天后把分数提升到 43%,目前已有超 700 支队伍、近 4000 次提交。
ARC Prize 推出 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,玩家可分享解题用时与尝试次数。MindsAI 团队在突破 40% 门槛三天后把分数提升到 43%,目前已有超 700 支队伍、近 4000 次提交。
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
ARC Prize 上线 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,Play 页面成为其主页,点击 Start 后开始计时并统计尝试次数。该功能无奖金,结果可分享至 X/Twitter、Discord 等平台,官方称这是 v1,后续将根据反馈加入教程等功能。
Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。
ARC Prize 2024 赛程过半,ARC-AGI 世界纪录提升 13%,达到 46%,由 Jack Cole 与团队 MindsAI 连续第三次刷新。Kaggle 参赛者已超 11,000 人,目前有 4 支队伍得分超过 30%。
Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。
推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。
Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。
ARC Prize 用同一基线测试框架实测 OpenAI o1-preview 和 o1-mini:o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet(21%)相当,但单任务平均耗时 4.2 分钟,约为 Sonnet 的 10 倍,400 道公开题共花 70 小时,而 GPT-4o 和 Sonnet 只需 30 分钟。
推荐理由:ARC Prize 用同一测试框架给出 o1 在 ARC-AGI-Pub 的基线分数和耗时对比,并分析了测试时计算扩展的效率问题。
Black Forest Labs 宣布 FLUX.2 [klein] 4B 将预装在 ASUS 下一代 ProArt RTX 笔记本的 MuseTree 应用中,该产品线在台北 Computex 2026 上亮相。
AI 应用正进入黄金时代,三件事印证了这一判断:美国政府下令下架 Fable、Nadella 提出生态护城河不在模型本身、Salesforce 以 36 亿美元收购 Fin。构建 AI 应用需掌握三项新能力:挑选合适模型、设计爬坡循环、评估模型与循环的组合表现,核心是每 token 预算能榨出多少智能。
ARC Prize 发布 2024 竞赛三个月更新:ARC-AGI 基准仍未被攻破,SOTA 从 34% 升至 46%(MindsAI 通过测试时微调语言模型达成),Kaggle 上有 921 支队伍、7,368 次提交。
Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。
ARC Prize 启动 2024 美国大学巡回宣讲,将走访斯坦福、MIT、UC Berkeley 等十余所高校,联合 AI 学生与研究者推进开放 AGI 进展。联合创始人 Mike Knoop 和 François Chollet 将现场讲解 ARC-AGI 的历史、动机、技术路径与未来方向。10 月 24 日另设一场面向公众的线上活动,内容与校内场次相同。
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
ARC Prize 团队本月走访了 13 所美国大学,与超过 1,500 名学生和教授交流 AGI 进展并推广 ARC Prize。团队还将于明天举办线上活动,由 ARC-AGI 创作者 François Chollet 讲解可能攻克 ARC 并赢得大奖的技术路径。
Databricks 年化经常性收入达 69 亿美元,同比增长 80%,Snowflake 约 53 亿美元、增长 34%,两者差距从 3 月的 4.9 亿美元扩至 16 亿美元。
ARC Prize 主办线上活动,Mike Knoop 和 François Chollet 讲解为何纯深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路径。
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
ARC Prize 2024 Kaggle 竞赛代码提交已于 11 月 10 日截止,共 1,451 支队伍提交 19,423 份代码方案,Kaggle 与 ARC Prize 团队已启动排行榜验证。论文提交截止 11 月 12 日,开源截止 11 月 24 日,仅开源方案有资格获奖并进入排行榜,获奖者将于 12 月 6 日公布。ARC Prize 2025 竞赛计划于明年第一季度启动。
Glean CISO Sunil Agrawal 将做客 Office Hours,讨论攻击者使用前沿模型进行侦察、钓鱼、深度伪造和漏洞生成时的安全准备。对话于太平洋时间 7 月 9 日周四上午 9 点举行,聚焦 AI 压缩目标理解与攻击面测绘时间、攻击语法与语气线索消失、深度伪造通话改变审批与支付信任控制面等议题。
ARC Prize 官方公布 2024 年获奖名单并发布技术报告,共 1,430 支团队提交 17,789 份方案,大奖仍未被认领。the ARChitects 以 53.5% 获第一名并获 2.5 万美元,Kaggle 竞赛期间 ARC-AGI-1 SOTA 从 33% 升至 55.5%(MindsAI 因未开源不符获奖资格)。
Theory 宣布与 Kleiner Perkins、Redpoint、Sequoia 共同投资 Sail Research 的 A 轮。Sail 做异步推理,把请求分发到 DeepSeek、Qwen、Kimi、GLM 等开源模型并按任务选最便宜可用的模型,其 GLM-5.1 每 token 成本比 Anthropic Haiku 低 6 倍。
ARC Prize 介绍 2024 年 ARC Prize 竞赛末期两个登上 ARC-AGI 公开榜单新 SOTA 的开源方案。
Anthropic 发布 Claude 认证咨询与系统集成合作伙伴名单,并开放 Claude Partner Network 加入。
OpenAI 新版 o3 在 ARC-AGI 半私评测集上以 1 万美元算力上限取得 75.7%,高算力(172 倍)配置得分 87.5%,成为公共榜首。
推荐理由:官方测试方披露了 o3 各算力档的得分与每任务成本,并给出对其程序搜索机制的独立分析。
Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。
推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。
Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
ARC Prize 宣布转型为 501(c)(3) 非营利基金会,2024 年联合负责人 Greg Kamradt 出任主席并加入董事会。ARC-AGI-2 基准与论文将于 2025 年第一季度末发布并用于 2025 年赛事,ARC-AGI-3 已在开发中;2024 年赛事有超过 1400 支队伍提交 1.7 万份方案,基金会还计划与前沿实验室合作并在 1 月中旬启动募资。
Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。
推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。
Anthropic 为 Claude 推出插件市场,收录 340 个插件,可将工具、技能与集成打包为一键安装。
推荐理由:原文列出了插件市场的实际内容和安装方式,读者可以据此挑选适合自己的 Claude 扩展组合。
Tomer Tunguz 撰文称 2026 年 CIO 的优先级清晰:资金流向 AI 栈,其余被削减。
推荐理由:作者用公开市场分板块数据拆解 AI 时期的软件股分化,指出决定估值的是品类而非增速,分析框架可复用。
ARC Prize Foundation 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得 14% 和 15.8%,与 o1 低算力的 20.5% 接近,而 GPT-4o 为 5%。
推荐理由:ARC Prize 一手实测了 R1-Zero 与 R1 在 ARC-AGI-1 上的表现,提出 SFT 与纯 RL 的角色区分这一可讨论的判断。
Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。
推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。
Anthropic 上线活动页面,汇总即将举办的活动、直播与往期会议录像,包括 10 月 14 日的 Claude Founder House Stockholm 和 10 月 6 日的 Claude Founder House San Francisco。页面还列出 Claude in Production、从手动编码到多智能体编排等网络研讨会系列,并提供开发者月度通讯订阅。
作者认为构建 agent 的团队应把路由设计放在第一位、模型选择放在最后。他提出三层结构:技能分类器识别任务意图、路由器根据复杂度等特征决定执行层级、模型选择器在层级内挑最便宜的合格模型。
ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。
Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。
推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
Anthropic 分享了为 claude.ai、Claude Code 和 Cowork 构建隔离管控(containment)机制的工程经验,核心问题是如何在智能体能力增强、潜在影响范围扩大的同时限制其爆炸半径。相关文章还涉及 Claude Code 自动模式、长时运行智能体的 harness 设计,以及 Claude Opus 4.6 在 BrowseComp 中的评测意识等议题。