跳到正文

全部动态

今日 395 条
9月30日周三
  1. Eugene Yan:Writing68

    Eugene Yan 详解长上下文问答系统评测:指标、数据集与六个基准

    Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。

  2. Eugene Yan:Writing75

    Eugene Yan 详解如何与 AI 协作并让工作复利

    Eugene Yan 分享与 AI 高效协作的工作流与复利方法,提出五条原则:提供良好上下文、把品味编码为配置、让验证变得简单、委托更大任务、闭合反馈循环。具体做法包括用 INDEX.md 注解组织上下文、将 CLAUDE.md 当作入职文档、把每周任务沉淀为 skill 并通过会话记录迭代、用 hooks 和 evals 左移验证、用 tmux 并行 3-6 个会话并挖掘过往会话记录更新配置。

  3. Epoch AI:研究、数据与评测16

    Epoch AI 播客:AI 基准测试是否注定失败?

    Epoch AI 播客栏目上线多期讨论,其中一期主题为“Are AI benchmarks doomed?”,探讨 AI 基准测试的困境。其他话题涵盖 AI 数学能力可能长期呈锯齿状发展、欧盟与 AI 宏观经济学的复杂性、经济学对 AGI 的启示、AI 进展预测至 2040 年,以及 AGI 时间线是 3 年还是 30 年的分歧。

  4. Epoch AI:研究、数据与评测41

    Epoch AI 开放 AI 数据集:追踪 3600 多个机器学习模型与 AI 算力

    Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。

  5. Cursor Blog79

    Cursor 宣布被 SpaceX 正式收购

    Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。

    推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。

  6. Cursor Blog74

    Cursor 推出 Projects:用协调智能体承接大规模开发工作

    Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。

    推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。

  7. Cursor Blog61

    Cursor 推出软件开发 Bots:Rollouts 与 Security Reviewer

    Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。

    推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。

  8. Cursor Blog61

    Cursor 详解智能体 harness 效率优化,token 成本降低 7%

    Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。

    推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。

  9. Dario Amodei:Blog(网页)2

    Google Scholar 页面加载失败提示与登录验证界面

    Google Scholar 当前无法完成操作,页面提示“系统暂时无法执行此操作,请稍后重试”。界面同时要求用户完成人机验证以证明不是机器人,并提供登录入口以访问个人资料、我的图书馆、指标、快讯和设置等功能。

  10. Dario Amodei:Blog(网页)68

    Dario Amodei 撰文回应 DeepSeek 并为芯片出口管制辩护

    Anthropic CEO Dario Amodei 发文认为 DeepSeek 的发布不削弱美国对华芯片出口管制的理由,反而使其更重要。他提出缩放定律、移动曲线、转移范式三个动态,称 DeepSeek-V3 是沿预期成本下降曲线的合理结果而非独特突破,R1 则复现了 OpenAI o1 的思路。

    推荐理由:作者以成本曲线分析逐条回应 DeepSeek 低成本冲击的说法,读者可借此检验出口管制论点的实际依据。

  11. Dario Amodei:Blog(网页)67

    Dario Amodei 撰文呼吁加速 AI 可解释性研究

    Dario Amodei 发表长文《The Urgency of Interpretability》,主张可解释性研究与模型能力正在赛跑,必须在强大 AI 到来前理解模型内部机制。

    推荐理由:作者本人是可解释性研究的当事方,文中给出技术进展、2027目标和政策主张,读者可以据此了解这个方向的路线图。

  12. Dario Amodei:Blog(网页)75

    Dario Amodei 发布长文阐述 AI 指数级进展下的政策主张

    Anthropic CEO Dario Amodei 发表长文,认为 AI 规模化定律推进迅速而政策制定太慢,呼吁在监管与公共安全、宏观经济与税收、科学创新、国家权力与公民自由、地缘政治五个领域重构政策。

    推荐理由:Dario Amodei 以第一人称提出五领域 AI 政策主张并附 Anthropic 立法提案,读者可以据此了解行业头部公司对监管的立场。

  13. Dario Amodei:Blog(网页)71

    Dario Amodei 提出放缓前沿 AI 能力步伐的三步计划

    Anthropic 创始人 Dario Amodei 撰文呼吁在继续推进 AI 的同时放缓模型能力提升速度,给安全工作留出时间,并称 recursive self-improvement 自今夏起已在行业内加速、6–12 个月内类似 OAI-HF 的智能体群体可能造成更大规模破坏。

    推荐理由:作者以当事方身份提出分阶段放缓前沿模型能力的三步计划,并宣布 Anthropic 单方面承诺引入嵌入式第三方评估者。

  14. Dario Amodei:Blog(网页)68

    Dario Amodei 长文《Machines of Loving Grace》展望强大 AI 如何造福世界

    Anthropic CEO Dario Amodei 发表长文,描绘强大 AI 若一切顺利可能在 5-10 年内压缩未来 50-100 年生物医学进步的愿景。他定义强大 AI 为超过诺贝尔奖得主智力、可自主完成数天至数周任务的系统,并提出以智能的边际回报为核心的分析框架,聚焦生物学与健康、神经科学与心理健康、经济发展与减贫、和平与治理、工作与意义五大领域。

    推荐理由:Anthropic CEO 本人撰写的长文,系统给出强大 AI 在五个领域造福社会的具体预测与分析框架,观点源自第一手思考。

  15. Dario Amodei:Blog(网页)74

    Dario Amodei 发文《技术的青春期》:剖析强大 AI 的五类风险并给出应对路线

    Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。

    推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。

  16. Cognition 模型 / Devin 博客(网页)67

    Cognition 完成 2B+ 美元 E 轮融资,估值 480 亿美元

    Cognition 宣布完成逾 20 亿美元 E 轮融资,估值达 480 亿美元,由 Andreessen Horowitz 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等跟投。

    推荐理由:融资公告附上营收增长和 Devin 新功能细节,读者可以据此了解这家智能体公司的业务进展。

  17. Cognition 模型 / Devin 博客(网页)78

    Cognition 研究员用 Devin 构建 GPU 格子筛分解 RSA-260,成本较此前公开最优低约 10 倍

    Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。

    推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。

  18. Cognition 模型 / Devin 博客(网页)71

    Cognition 将 Fusion 双智能体 harness 引入 Devin Desktop 和 CLI

    Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。

    推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。