跳到正文

#评测/基准

今日 51 条
9月30日周三
  1. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  2. ARC Prize:官方博客73

    ARC Prize 发布交互式基准 ARC-AGI-3,ARC Prize 2026 设超 200 万美元奖金

    ARC Prize 发布 ARC-AGI-3,这是 ARC-AGI 系列首个全交互式基准,包含数百个人工设计的回合制环境和数千个游戏式关卡,无指令、无规则、无既定目标,要求智能体自行探索并跨关卡迁移所学。

    推荐理由:ARC-AGI-3 用无指令的交互环境测探索学习能力,人类 100% 对前沿 AI 0.51%,可据此思考指令跟随之外的智能差距。

  3. ARC Prize:官方博客23

    ARC Prize 官方资源合集:ARC-AGI 论文、视频与教程

    ARC Prize 官方博客汇总了面向 ARC-AGI 社区的论文、视频、工具、代码库与教程资源。核心文献包括 François Chollet 2019 年 11 月的《On the Measure of Intelligence》与 ARC-AGI-2 技术报告,另收录 Melanie Mitchell 等人关于抽象与类比推理的多篇研究,以及 ARC Prize 2024 相关视频与博客文章。

  4. ARC Prize:官方博客33

    ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能

    ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。

  5. Every:最新文章(网页)62

    如何为自己创建个人 AI 基准测试以选出适合工作的模型

    Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。

  6. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。

  7. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  8. Eugene Yan:Writing49

    为什么 LLM-as-Judge 救不了产品,修流程才行

    Eugene Yan 指出,指望再加一个工具、指标或 LLM-as-Judge 来解决产品问题,只会绕开核心难题、回避真正的工作。产品评估不是静态产物或速效药,而是把科学方法、评估驱动开发(EDD)和 AI 输出监控落到实处的实践:从观察数据、标注成败样本(理想为 50:50 的通过/失败分布)开始,再提出假设、设计实验、量化结果并迭代。

  9. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  10. arXiv:cs.AI(全量分类)36

    关系基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性

    研究揭示关系型上下文学习(ICL)中的支持集目标泄漏问题:当支持上下文包含目标衍生特征而查询端不可用时,评估结果会失真。作者构造 20 个目标衍生特征,在 13 个 RelBench 任务和 5 种关系 ICL 配置上测试,发现 0-hop 与 Full 泄漏造成最大偏差,且泄漏效应高度依赖任务与模型,甚至可逆转模型变体间的相对结论。

  11. arXiv:cs.AI(全量分类)39

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。

  12. arXiv:cs.CL(计算语言学,全量分类)35

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。

  13. arXiv:cs.CL(计算语言学,全量分类)42

    CruxBench:一个信息发现基准

    研究者提出 CruxBench,一个按信息价值(VOI)给 LLM 生成问题打分的基准,衡量模型提出的关键子问题能在多大程度上更新对目标预测问题的信念。该基准抗污染、开放式且基于真实世界信念变化,在 293 个预测问题上评测了 8 个模型,VOI 与独立能力指标相关性达 r=0.90,但前沿 LLM 仅略微超过随机时机基线。

  14. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。

  15. arXiv:cs.CL(计算语言学,全量分类)48

    BreakingWeb:通过受控环境干预构建高难度浏览器使用任务

    研究者提出 BreakingWeb 基准,通过受控环境干预将智能体已能完成的任务改造为高难度实例,包含 519 个干净/干预任务对,覆盖 7 个自托管网站和 29 类干预。干预使六款浏览器使用智能体的通过率平均下降 22.9%,并推翻近半数原本能干净解决的任务;人类首次尝试仅损失 10.0%。六款智能体 75% 的失败属于"信念失败",即在所需变更未发生时仍宣称成功。

  16. arXiv:cs.CL(计算语言学,全量分类)38

    车载对话助手多轮对话的自动化评估框架

    研究者提出一套面向车载对话助手(ICA)的自动化多轮对话测试框架,将系统视为黑盒,通过闭环仿真结合策略引导用户模拟器、对抗策略管理器和两层 LLM 评判器进行评估。在六种 LLM 后端和十二名人工标注者参与的工业级 ICA 测试中,自动评判与人类标注高度一致,策略引导相比无引导仿真每段对话多发现 2.96 倍独特故障类型,故障对话数量增加一倍以上。

  17. Berkeley RDI:Blog(AI 安全与评测)66

    Berkeley RDI 发布 Agents' Last Exam 基准,前沿智能体在最难任务上全部 0% 通过

    UC Berkeley RDI 发布 Agents' Last Exam(ALE)基准,用来自 55 个职业、1500 多个专家来源的真实任务评测前沿 Agent,任务源自人类专家完成过的真实项目,可客观验证、可复现。

    推荐理由:原文给出各前沿智能体在 1500 多个真实职业任务上的通过率、成本差异和最难题的失败细节,可用作衡量 Agent 真实工作能力的参照。