Eugene Yan 详解长上下文问答系统评测:指标、数据集与六个基准
Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。
Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。
Eugene Yan 用 RQ-VAE 把 Amazon Reviews 2023 游戏品类的 66k 商品编码为语义 ID,再微调 Qwen3-8B,构建一个无需检索、单一模型即可同时理解自然语言和商品 ID 的推荐混合模型。
Eugene Yan 撰文总结构建产品 evals 的三个步骤:标注小数据集、对齐 LLM 评估器、运行评估 harness。
Eugene Yan 发布 2025 年度回顾,完成 6 篇技术写作并上线 4 个原型应用,其中 AI Reading Club 已登陆 Kindle iOS app,LLM-RecSys 混合模型可依据自然语言与 item ID 直接推荐。
Eugene Yan 分享与 AI 高效协作的工作流与复利方法,提出五条原则:提供良好上下文、把品味编码为配置、让验证变得简单、委托更大任务、闭合反馈循环。具体做法包括用 INDEX.md 注解组织上下文、将 CLAUDE.md 当作入职文档、把每周任务沉淀为 skill 并通过会话记录迭代、用 hooks 和 evals 左移验证、用 tmux 并行 3-6 个会话并挖掘过往会话记录更新配置。
Eugene Yan 撰文解析如何评估模型发现与利用安全漏洞的能力,归纳出沙箱目标、难度输入、工具和评分器四个通用组件,并提出按攻击链分级的部分给分方式。
Epoch AI 估算华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国存储芯片,2028 年份额可能降至约 1%。OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。
Epoch AI 播客栏目上线多期讨论,其中一期主题为“Are AI benchmarks doomed?”,探讨 AI 基准测试的困境。其他话题涵盖 AI 数学能力可能长期呈锯齿状发展、欧盟与 AI 宏观经济学的复杂性、经济学对 AGI 的启示、AI 进展预测至 2040 年,以及 AGI 时间线是 3 年还是 30 年的分歧。
Epoch AI 的 Newsletter 栏目汇总了多期内容,包括 8 月 27 日对 AI 最重要数字的更新、8 月 14 日基准测试可帮助回答的 9 个大问题,以及 8 月 12 日以 Anthropic 为案例探讨融资是否会瓶颈 AI 算力。
Epoch AI 数据显示,OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,Math-ECI 达 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。
NVIDIA 为 ROS 2 Lyrical 贡献了 CUDA buffer backend,配合 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时以零拷贝方式交换 GPU 常驻数据,否则自动回退 CPU 路径。
Epoch AI 发布多项研究:GPT-6 Astra 以 ECI 166 分登顶能力指数,Math-ECI 170 创纪录,但 SWE-ECI 164 仍落后 Claude Fable 5.1 的 167。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
Epoch AI 的基准评测中心汇总其 Capabilities Index(ECI)、402 个模型的跟踪数据和 87 项基准。
NVIDIA 联合 SGLang 团队推出 SWE-Serve 基准,从 83 个已合并的 SGLang pull request 中构建 53 个可执行任务,用于评估智能体对推理服务软件仓库级改动的真实效果。
Epoch AI 更新其公开数据库,追踪 1950 年至今超 3600 个机器学习模型,并覆盖 AI 数据中心、AI 芯片销售、GPU 集群等数据。其 GPU 集群数据库收录超 500 个集群与超算,机器学习硬件数据涵盖超 170 款 AI 加速器。所有数据以 Creative Commons 署名许可免费使用与分发。
Epoch AI 的趋势报告显示,自 2010 年以来知名 AI 模型的训练算力每年增长 4.5 倍,算法效率则每年提升 3 倍,训练成本年增 3.5 倍、功耗每年翻倍。
Cursor 宣布 Firetiger 团队加入 Cursor。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,构建的智能体可在软件上线后监控发布、发现回归、调查事件并将发现反馈给编程智能体。
Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。
推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。
推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。
xAI 发布 Grok 4.7,定位为面向编码和知识工作的最强模型,价格和速度与 Grok 4.6 相同,输入每百万 token $2、输出 $6。
推荐理由:官方给出了 Grok 4.7 的基准成绩、价格和防护数据,读者可以据此与 Grok 4.6 等模型比较编码和安全表现。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Google Scholar 当前无法完成操作,页面提示“系统暂时无法执行此操作,请稍后重试”。界面同时要求用户完成人机验证以证明不是机器人,并提供登录入口以访问个人资料、我的图书馆、指标、快讯和设置等功能。
Anthropic CEO Dario Amodei 发文认为 DeepSeek 的发布不削弱美国对华芯片出口管制的理由,反而使其更重要。他提出缩放定律、移动曲线、转移范式三个动态,称 DeepSeek-V3 是沿预期成本下降曲线的合理结果而非独特突破,R1 则复现了 OpenAI o1 的思路。
推荐理由:作者以成本曲线分析逐条回应 DeepSeek 低成本冲击的说法,读者可借此检验出口管制论点的实际依据。
Dario Amodei 发表长文《The Urgency of Interpretability》,主张可解释性研究与模型能力正在赛跑,必须在强大 AI 到来前理解模型内部机制。
推荐理由:作者本人是可解释性研究的当事方,文中给出技术进展、2027目标和政策主张,读者可以据此了解这个方向的路线图。
Anthropic CEO Dario Amodei 发表长文,认为 AI 规模化定律推进迅速而政策制定太慢,呼吁在监管与公共安全、宏观经济与税收、科学创新、国家权力与公民自由、地缘政治五个领域重构政策。
推荐理由:Dario Amodei 以第一人称提出五领域 AI 政策主张并附 Anthropic 立法提案,读者可以据此了解行业头部公司对监管的立场。
Anthropic 创始人 Dario Amodei 撰文呼吁在继续推进 AI 的同时放缓模型能力提升速度,给安全工作留出时间,并称 recursive self-improvement 自今夏起已在行业内加速、6–12 个月内类似 OAI-HF 的智能体群体可能造成更大规模破坏。
推荐理由:作者以当事方身份提出分阶段放缓前沿模型能力的三步计划,并宣布 Anthropic 单方面承诺引入嵌入式第三方评估者。
Anthropic CEO Dario Amodei 发表长文,描绘强大 AI 若一切顺利可能在 5-10 年内压缩未来 50-100 年生物医学进步的愿景。他定义强大 AI 为超过诺贝尔奖得主智力、可自主完成数天至数周任务的系统,并提出以智能的边际回报为核心的分析框架,聚焦生物学与健康、神经科学与心理健康、经济发展与减贫、和平与治理、工作与意义五大领域。
推荐理由:Anthropic CEO 本人撰写的长文,系统给出强大 AI 在五个领域造福社会的具体预测与分析框架,观点源自第一手思考。
Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。
推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。
Cohere 推出 Embed 5 系列前沿嵌入模型,定位为当前最优的检索(state-of-the-art retrieval),已在 Pro 和 Fast 两个档位上线。该系列属于 Cohere 的语义表示模型产品线,官方称其为新一代前沿嵌入模型家族。
Cognition 宣布完成逾 20 亿美元 E 轮融资,估值达 480 亿美元,由 Andreessen Horowitz 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等跟投。
推荐理由:融资公告附上营收增长和 Devin 新功能细节,读者可以据此了解这家智能体公司的业务进展。
Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。
推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。
Cognition 发布 SWE-2,其最强编码模型在 FrontierCode 1.1 Main 得分 50.0%,与 Fable 5.1 差距不到 1 分且便宜 64%。
Cognition 宣布 Jonathan Kelley 及整个 Dioxus 团队加入,将继续支持 Dioxus、Blitz、Taffy 和 Subsecond 开源项目,并加大对 Dioxus-Native 和 Blitz 的投入。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Cognition 与 AWS 签署多年战略合作协议,帮助企业将 Devin 自主工程师部署到生产环境,并加速遗留工作负载迁移上 AWS。客户已可通过 AWS Marketplace 购买 Devin,并在 Devin 内直接使用 Agent Toolkit for AWS。
Cognition 宣布拓展拉丁美洲业务,首站设在圣保罗,此前已与 Itaú、Nubank、Santander 等区域大型机构合作使用 Devin。Itaú 超 75% 技术团队使用 Devin,完成 30 万+ 代码库文档化、.NET 迁移 Java 提速 6 倍、自动修复约 70% 安全漏洞,工程吞吐量提升 20-30%。