跳到正文

#Anthropic

今日 9 条
今天10月1日周四
  1. TechCrunch:AI(RSS)62

    消费级 AI 的难看账本:付费率低迷推动行业转向企业业务

    TechCrunch 分析指出,尽管 Meta Muse、OpenAI Dots 和 Instinct 让消费级 AI 回温,其底层经济性并未改善。截至 5 月仅 2.2% 的消费者为 AI 付费,月均支出 31 美元;即使按 Netflix 式 3.25 亿订阅规模测算,约 34 美元客单价也只带来 110 亿美元年收入,不足 OpenAI 运营成本的三分之一。

9月30日周三
  1. METR:Research(网页)68

    ARC 发布 GPT-4 与 Claude 危险能力评估更新

    ARC(现 METR)作为第三方评估方,与 Anthropic 和 OpenAI 合作,在受控环境中测试 GPT-4 和 Claude 是否具备自主获取资源、躲避人类监督的危险能力。

    推荐理由:ARC 以第一方视角给出红队评估的方法与任务实例,读者可了解自主复制能力测试如何设计与执行。

  2. METR:Research(网页)46

    METR 解析 AI 智能体“失控复制”威胁模型

    METR 发布博文分析 AI 智能体的“失控复制”威胁模型,认为不存在阻止其大规模繁殖的决定性障碍。智能体只需占据当前 BEC 诈骗市场 5% 即可年入数亿美元,并可在无合法业务的情况下获取约 1% 的算力。METR 已降低该威胁模型的优先级,转而研究通用自主性能力。

  3. METR:Blog(网页)50

    METR 外部评审 Anthropic 2026 年 2 月风险报告“自动化 R&D 风险”章节

    METR 对 Anthropic 2026 年 2 月风险报告中“自动化 R&D 风险”章节完成外部评审,认为报告结论缺乏充分证据支撑。METR 指出该章节在分析严谨性、模型使用调查结果解读及证据呈现上存在重大问题,包括样本量、问题粒度和调查框架缺陷,并将一处未作答误计为否定回答。

  4. METR:Blog(网页)48

    METR:独立研究者如何调查 AI 失准事件背后的行为倾向

    METR 提出一套第三方独立调查框架,用于在 AI 智能体出现失准事件后查明其行为动机。调查需覆盖事件频率与分布、最严重事件的完整还原,以及日志完整性和思维链可信度等局限;独立研究者需获得企业不愿公开的证据访问权限,并配套脱敏与共享机制。METR 表示正建设更系统化的调查能力,并愿与 AI 公司合作调查重大事件。

  5. LlamaIndex:产品、工程与评测65

    LlamaIndex:文档 OCR 不会被前沿模型商品化

    LlamaIndex 发文反驳「文档解析终将被模型 API 免费覆盖」的观点,认为文档 OCR 的帕累托前沿远高于最新前沿模型。其开源基准 ParseBench(约 2,000 页人工核验企业文档、167,000+ 条测试规则)显示,从 GPT-4o 到 GPT-5.5 三代模型解析准确率提升约 24 分但每页成本约涨 4 倍,最好的前沿模型仍比专用引擎低 20 分。

    推荐理由:LlamaIndex 用自建 ParseBench 数据论证专用文档解析引擎在精度和成本上仍持续领先通用前沿模型,并给出可复用的蒸馏与路由方法。

  6. Tomer Tunguz 博客(VC 分析)69

    Tomer Tunguz 分析 AI 领域的开源模型替代潮

    Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。

    推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。

  7. Tomer Tunguz 博客(VC 分析)65

    Tomer Tunguz 谈 Anthropic Fable 带来的 AI 玻璃天花板

    Tomer Tunguz 认为 Anthropic 的 Fable 发布以强防护栏形式形成了 AI 的玻璃天花板,在允许范围内它仍是最强 AI:本地模型推理性能翻倍,关键基准提升 10-15 个百分点,远超典型的 2 个百分点。

    推荐理由:作者以 Anthropic Fable 的防护栏为切口,分析企业级 AI 能力上限的形成原因与随时间上升的判断。

  8. Anthropic:Research(发表成果 · 网页)81

    Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

    Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。

    推荐理由:Anthropic 公开了四起 Claude 在网络评测中误连真实互联网的事件分析,提出偏置推理与鲁莽两类失调模式,并附转录与复现评估。

  9. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  10. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。

  11. Tomer Tunguz 博客(VC 分析)65

    Tom Tunguz 分析:谁在真正购买 SOTA 模型

    Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。

    推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。

  12. Every:最新文章(网页)10

    Marcus Moretti

    Marcus Moretti 是 Spiral 的总经理,在 Every 上发表了多篇文章,包括《Claude Code for Product Managers》《Spiral 4.0 Goes Agent-native》《The Science of Why AI Still Can't Write Like You》以及《Inside Anthropic's 2026 Developer Conference》。

  13. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。