Anthropic 金融服务业:Claude 如何落地银行、保险与财富管理
Anthropic 公布 Claude 在金融服务业的落地情况,覆盖银行、保险、资产与财富管理及 fintech,合作方包括 BlackRock、Mercer Advisors、Schwab、FIS、Carlyle 等机构。
Anthropic 公布 Claude 在金融服务业的落地情况,覆盖银行、保险、资产与财富管理及 fintech,合作方包括 BlackRock、Mercer Advisors、Schwab、FIS、Carlyle 等机构。
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
非技术背景创始人 Yana Welinder 用 Codex 驱动自己不会操作的 CAD 软件,做出了一件此前无法制造的裙子。文章认为,Figma、Salesforce、CAD 各有自己的"语法",软件越强大所需专业知识越多,而 AI 让用户用英语表达意图、由智能体翻译成软件语言。专家不会消失,产品设计的重心转向为智能体构建安全操作系统的 harness 与文档。
Anthropic 推出面向企业的 Claude Enterprise,提供 SSO/SAML、SCIM、审计日志、合规 API 及 HIPAA-ready 等管理控制,数据默认不用于训练模型。企业可将 Claude 部署到 Chat、Claude Cowork、Claude Code 及自有产品中,官方称复杂代码迁移可减少 90% 耗时。
Tom Tunguz 引用 Stanford 与 Together AI 的研究,提出 intelligence-per-watt 将像当年的 performance-per-watt 一样推动 AI 从云端走向端侧。
推荐理由:原文引用研究数据解释 intelligence-per-watt 趋势如何推动 AI 向端侧迁移,并给出本地加路由方案相对全云的能效与成本收益。
Anthropic 发布 Claude Mythos Preview 和 Claude Mythos 5,称其在漏洞利用推理等网络安全能力上显著增强,Mythos Preview 是首个能稳定突破浏览器和操作系统沙箱保护的模型。
ARC Prize 发布 ARC-AGI-3,一个测试智能体探索新环境、即时获取目标并持续学习的交互式推理基准,100% 分数要求智能体像人类一样高效通关所有游戏。基准提供可回放的运行记录、开发者工具包和集成文档,通过测试规划长度、记忆压缩和信念更新来衡量 AI 与人类学习的差距。
推荐理由:官方说明了 ARC-AGI-3 的测量维度与设计原则,读者可以据此理解它如何衡量智能体随时间的技能获取能力。
Tomer Tunguz 撰文分析 AI 基础设施短缺正按牛鞭效应依次传导:2023 年初 H100 租金曾超 $9/小时,2023 年服务器出货量下滑 22%。
推荐理由:作者用多年价格和产能数据梳理 AI 硬件短缺的接力顺序,读者可以据此理解瓶颈传导的时滞机制。
Anthropic 展示用 Claude 打造客户支持智能体:依托内部知识跨系统与工具执行操作,支持智能对话路由、多语言多渠道个性化回复,以缩短解决时长并降低支持成本。
Tomer Tunguz 分析长会话智能体的问题:对话轮次堆积导致注意力退化,临时指令变成永久残留,长期读写权限还会被恶意邮件投毒劫持日程。他提出日常协调者只活 24 小时,任务委派给仅存活约 30 秒的单一用途子智能体,午夜由离线摘要器把持久偏好写入 preferences.md 后清空对话,并附上两个系统提示词示例。
ARC Prize 官方介绍 ARC-AGI-2 基准,旨在压力测试最先进的 AI 推理系统并提供 AGI 进展信号。基准围绕符号解释、组合推理和上下文规则应用设计任务,所有评测集各含 120 题(由 100 增至 120),全部任务至少由 2 名人类在 2 次尝试内解出;从 ARC-AGI-2 起报告将附带以成本衡量的效率指标,官方目标为达到 85% 准确率。
推荐理由:ARC Prize 官方介绍 ARC-AGI-2 的任务设计与校准方法,读者可了解新基准为何强调符号理解与效率度量。
Anthropic 推出面向零售、旅游、电信和娱乐行业的 Claude Commerce agents,提供可 fork 的开源蓝图仓库,包含两类智能体、四个垂直行业参考实现和一个 Claude Code 插件。
NVIDIA Q2 FY27 营收达 $96b,同比增长 106%,环比增长 18%,并给出 Q3 $108b ±2% 的指引。
推荐理由:作者基于财报数据指出超大规模客户占比下降与应收账款拉长,为读者提供了观察 NVIDIA 增长质量的关键视角。
ARC-AGI-1 是 François Chollet 于 2019 年提出的推理基准,包含 800 道网格类谜题任务,每题通常只给约三组输入输出示例,考察 AI 从极少信息中即时归纳规则的能力。
Anthropic 公布 Claude 在编程场景的能力数据:Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,为某 AI 平台客户带来 60 倍更快的代码审查反馈,为某企业软件客户将测试运行时间缩短 95%。
文章引用 Dylan Patel 等人的观点分析 AI 模型公司按兆瓦计的单位经济:基础算力成本约 $10-15M/MW,Anthropic 2026 年收入达 $50M/MW,实现首个盈利季度,收入 $10.9B、营业利润 $559M。
推荐理由:文章用每兆瓦收入和毛利数据拆解 AI 模型公司的单位经济,并解释推理利润如何反哺训练的工厂模式。
ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。
Claude Code 面向企业遗留代码库的现代化改造,结合 AI 代码生成与深度代码库理解,在保持业务逻辑完整的前提下支持可扩展迁移。它能生成依赖图、识别死代码、按复杂度与业务影响排定重构优先级,并自动为重构代码创建单元测试、补充回归测试。该工具可接入现有 CI/CD 流水线与版本控制系统,满足企业级安全与合规要求。
Tomer Tunguz 撰文指出前沿 AI 市场正分化为封闭阵营,实验室通过选择伙伴、限制访问来管控最强模型。
推荐理由:作者梳理了前沿模型从按 token 出售转向准入管控的多方实例,并给出开源与 Nvidia 反制力量的行业分析。
Anthropic 发布工程长文,介绍用 Claude 构建能规划、行动与协作的 AI 智能体,并称 Claude 在客户支持到编程等智能体场景中表现优于其他模型。
Tomer Tunguz 分析五年写作数据后认为,AI 自动化草稿并未减少人工编辑,而是提高了同等工作量的产出上限。行级句编辑中位数稳定在每篇约 136 处,而发布文章的质量下限上升最快,第 10 百分位评分从 2.59 升至 3.81,涨幅约为第 90 百分位的两倍。
Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。
推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。
作者估算未来五年美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设总投入约 5 万亿美元,其中约 4 万亿美元新债务相当于美国公司债市场扩容 34%,超过全球私募信贷市场规模,并等于美国市政债市场的 91%。
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。
Tomer Tunguz 提出 AI token 消耗分三波:聊天约每用户每天 1m tokens,单智能体约 100m-200m,meta-harness 并行调度多个智能体可达数十亿级。
推荐理由:作者用 OpenRouter 与 OpenAI 数据拆解 AI token 消耗的三波结构,读者可以据此理解算力需求为何不沿平滑曲线外推。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Tomer Tunguz 分析 OpenAI 公布的研究加速数据,认为 3 倍生产率本质是一名工程师监督三班机器运行而非更聪明。OpenAI 研究员 8 小时人班对应 3.14 个 agent 工作日,通常并行跑 4 个 agent;中位数推理开销从 3 月底每天 $14 涨到 8 月中超过 $600,90 分位研究员年化超 $2.5m。
Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。
推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。
Anthropic 公布 Claude 订阅方案:Free 档 $0,Pro 档年付 $17/月($200 一次性付清)、月付 $20,Max 档 $100/月起,可选 Pro 5 倍或 20 倍用量。
Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。
推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。
Anthropic 推出 Agent Skills,用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力。同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。
推荐理由:Anthropic 官方页面说明 Skills 的构建方式、跨平台复用和内置能力,读者可以据此判断是否将其纳入自己的工作流。
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
推荐理由:原文来自官方,给出了四大 Office 应用中的具体能力和可用性细节,读者可据此评估是否替换现有办公工作流。
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线 CoreWeave Cloud,并计划提供面向智能体的 NVIDIA Vera CPU,同时发布连接训练、评估与改进的 CoreWeave Forge。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。
推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。