跳到正文

全部动态

今日 46 条
9月30日周三
  1. Tomer Tunguz 博客(VC 分析)49

    AI 的迷你钢厂:本地分类器分流让 Mac 承担 78% 的 AI 工作

    把后台 AI 工作先交给设备端小型分类器判断难易,只将最难任务上送云端,单台 Mac 的吞吐量提升约 25%,队列等待从 73 秒降至 4 秒。过去七天该 Mac 承担了 78% 的 AI 工作、日峰值达 88%,平均任务时长从 47 秒降到 19 秒。作者将其类比 Nucor 的迷你钢厂,认为配备蒸馏模型的笔记本、手机与边缘设备将成为企业内的“迷你钢厂”,只按云端价格支付最难的那五分之一。

  2. Tomer Tunguz 博客(VC 分析)69

    Tomer Tunguz 分析 AI 领域的开源模型替代潮

    Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。

    推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。

  3. ARC Prize:官方博客46

    ARC Prize 推出每日 ARC-AGI 谜题

    ARC Prize 上线 Daily Puzzle,每天 UTC 12 点从 ARC-AGI 任务中选出一道作为当日谜题,Play 页面成为其主页,点击 Start 后开始计时并统计尝试次数。该功能无奖金,结果可分享至 X/Twitter、Discord 等平台,官方称这是 v1,后续将根据反馈加入教程等功能。

  4. Black Forest Labs:Blog(网页)57

    Black Forest Labs 发布 FLUX VTO 目录级规模虚拟试穿模型

    Black Forest Labs 发布 FLUX VTO 虚拟试穿模型,现已公开可用,并加入 FLUX MCP。单次生成低于 4 秒,可自托管实现亚秒级响应,最多可给同一模特叠加 4 件服装,并保留人物身份与服装的 logo、印花、缝线和配件细节。默认审核政策下不支持泳装和内衣,官方提示精确的身材与服装尺码功能仍在演进,输出适合作为视觉搭配参考。

  5. Tomer Tunguz 博客(VC 分析)65

    Tomer Tunguz 谈 Anthropic Fable 带来的 AI 玻璃天花板

    Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。

    推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。

  6. Black Forest Labs:Blog(网页)43

    Martin Scorsese 出任 Black Forest Labs 顾问,用 FLUX 做电影分镜

    Martin Scorsese 成为 Black Forest Labs 顾问,并已用 FLUX 进行电影分镜创作。他表示该工具能更清晰高效地把脑海中的画面分享给美术指导、艺术设计和摄影指导,在前期制作中加快进度而不牺牲质量与工艺。Black Forest Labs 称其视觉智能模型可同时服务叙事者、建筑师、设计师与工程师,并预告将推出新的 FLUX 模型。

  7. ARC Prize:官方博客68

    ARC Prize 测评 OpenAI o1 在 ARC-AGI-Pub 的表现

    ARC Prize 用同一基线测试框架实测 OpenAI o1-preview 和 o1-mini:o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet(21%)相当,但单任务平均耗时 4.2 分钟,约为 Sonnet 的 10 倍,400 道公开题共花 70 小时,而 GPT-4o 和 Sonnet 只需 30 分钟。

    推荐理由:ARC Prize 用同一测试框架给出 o1 在 ARC-AGI-Pub 的基线分数和耗时对比,并分析了测试时计算扩展的效率问题。

  8. Tomer Tunguz 博客(VC 分析)43

    AI 应用的黄金时代:从 Fable 下架、Nadella 生态论到 Salesforce 收购 Fin

    AI 应用正进入黄金时代,三件事印证了这一判断:美国政府下令下架 Fable、Nadella 提出生态护城河不在模型本身、Salesforce 以 36 亿美元收购 Fin。构建 AI 应用需掌握三项新能力:挑选合适模型、设计爬坡循环、评估模型与循环的组合表现,核心是每 token 预算能榨出多少智能。

  9. Black Forest Labs:Blog(网页)34

    Envato 如何基于 FLUX 打造创意 AI 引擎

    Envato 与 Black Forest Labs 合作,将 FLUX 模型接入其创意平台,FLUX 已占平台图片生成总量的约 25%,累计生成超 5100 万张图片。FLUX.2 发布当天即上线生产环境,其在写实、电影感和产品图场景中比同类模型高出约 10%,下载率高出平台均值 16%。平台按任务智能路由请求,其中素材变体生成可在 8 秒内输出 5 张图片。

  10. ARC Prize:官方博客30

    ARC Prize 2024 美国大学巡回宣讲启动

    ARC Prize 启动 2024 美国大学巡回宣讲,将走访斯坦福、MIT、UC Berkeley 等十余所高校,联合 AI 学生与研究者推进开放 AGI 进展。联合创始人 Mike Knoop 和 François Chollet 将现场讲解 ARC-AGI 的历史、动机、技术路径与未来方向。10 月 24 日另设一场面向公众的线上活动,内容与校内场次相同。

  11. ARC Prize:官方博客34

    ARC Prize 2024 代码提交关闭,进入排行榜验证阶段

    ARC Prize 2024 Kaggle 竞赛代码提交已于 11 月 10 日截止,共 1,451 支队伍提交 19,423 份代码方案,Kaggle 与 ARC Prize 团队已启动排行榜验证。论文提交截止 11 月 12 日,开源截止 11 月 24 日,仅开源方案有资格获奖并进入排行榜,获奖者将于 12 月 6 日公布。ARC Prize 2025 竞赛计划于明年第一季度启动。

  12. Tomer Tunguz 博客(VC 分析)31

    Glean CISO Sunil Agrawal 谈如何防御 AI 驱动的攻击者

    Glean CISO Sunil Agrawal 将做客 Office Hours,讨论攻击者使用前沿模型进行侦察、钓鱼、深度伪造和漏洞生成时的安全准备。对话于太平洋时间 7 月 9 日周四上午 9 点举行,聚焦 AI 压缩目标理解与攻击面测绘时间、攻击语法与语气线索消失、深度伪造通话改变审批与支付信任控制面等议题。

  13. Anthropic:Research(发表成果 · 网页)60

    Anthropic 开放 Claude 真实使用数据,支持外部研究者独立开展研究

    Anthropic 试点让 Stanford SALT Lab、Oxford 和 METR 三个外部团队通过隐私保护工具 Anthropic Insights,独立分析约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话,并公开各项目汇总数据和意向表单。

    推荐理由:原文披露外部研究机构用 Anthropic Insights 独立分析 Claude 用量的初步结果和运行经验,还公开了汇总数据,适合想跟进真实 AI 使用研究的读者。

  14. Anthropic:The Institute(旗舰研究长文 · 网页)25

    Anthropic 发布 Claude 应用案例清单:覆盖编程、安全与数据分析

    Anthropic 整理了一份使用 Claude 构建产品的企业清单,涵盖编程工具、网络安全、商业智能与数据分析等类别。清单收录了 Cursor、Devin、Bolt.new、Databricks、Elastic 等产品,其中 Blitzy 用 Claude 关系映射整个代码库并调度数千个专用智能体,Ellipsis 已安装于超 67,000 个代码仓库、平均提升工程效率 20%。

  15. ARC Prize:官方博客57

    ARC Prize 成立非营利基金会,Greg Kamradt 出任主席并筹备 2025 年赛事

    ARC Prize 宣布转型为 501(c)(3) 非营利基金会,2024 年联合负责人 Greg Kamradt 出任主席并加入董事会。ARC-AGI-2 基准与论文将于 2025 年第一季度末发布并用于 2025 年赛事,ARC-AGI-3 已在开发中;2024 年赛事有超过 1400 支队伍提交 1.7 万份方案,基金会还计划与前沿实验室合作并在 1 月中旬启动募资。

  16. Anthropic:Research(发表成果 · 网页)78

    Anthropic 报告:Claude 自动化对齐研究可靠缓解十类对齐失败

    Anthropic 发布新报告,让 Claude 自主训练模型以改进 10 类对齐失败的基准表现,并开源自动化对齐研究框架。平均闭合 85% 的安全差距,在欺骗一项上比 28 名人类安全研究者的最佳方案高 20%;用 Claude Sonnet 5 训练早期 Opus 4.8 检查点,约 2,000 条训练样本的方案效率约为生产对齐流程的 15,000 倍。

    推荐理由:报告给出自动化对齐研究在十类对齐失败上的量化结果与开源工具,读者可据此评估该方向的实际可行性。

  17. Anthropic:Research(发表成果 · 网页)81

    Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明

    Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。

    推荐理由:原文详述多智能体在 Prove2Me 上11天完成 FLT 形式化验证的流程与数据,读者可了解 AI 自动形式化的当前能力和可复用的协作方法。

  18. Anthropic:The Institute(旗舰研究长文 · 网页)20

    Anthropic 公布 Claude Founder House 等活动日程与系列网络研讨会

    Anthropic 上线活动页面,汇总即将举办的活动、直播与往期会议录像,包括 10 月 14 日的 Claude Founder House Stockholm 和 10 月 6 日的 Claude Founder House San Francisco。页面还列出 Claude in Production、从手动编码到多智能体编排等网络研讨会系列,并提供开发者月度通讯订阅。

  19. ARC Prize:官方博客44

    ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准

    ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。