跳到正文

#评测/基准

今日 19 条
9月30日周三
  1. ARC Prize:官方博客44

    ARC Prize 推出 SnakeBench:50 个 LLM 贪吃蛇对战基准

    ARC Prize 发布实验性基准 SnakeBench,用 2.8K 场 LLM 贪吃蛇头对头对战测试模型在动态环境中的实时决策与长期策略。o3-mini 与 DeepSeek-R1 在排行榜领先,ELO 分别为 1825 和 1801,推理模型在对阵其他 LLM 时赢下 78% 的对局。代码与结果已开源,完整 50 个 LLM 排行榜见 SnakeBench.com。

  2. ARC Prize:官方博客69

    ARC Prize 实测 o3 与 o4-mini 在 ARC-AGI 上的表现

    ARC Prize Foundation 发布 o3 和 o4-mini 在 ARC-AGI 上的首次公开评测:o3-medium 在 ARC-AGI-1 Semi Private Eval 得 53%,o4-mini-medium 得 42%,两者在 ARC-AGI-2 上均低于 3%。

    推荐理由:ARC Prize 官方实测给出了 o3 与 o4-mini 在 ARC-AGI 两代基准上的准确率、成本和 high 推理不完整覆盖的数据细节。

  3. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  4. ARC Prize:官方博客38

    ARC Prize 基金会就美国 AI 行动计划发表声明

    ARC Prize 基金会称其 3 月向白宫 OSTP 提交的三项建议——建立独立 AI 评估组织生态、设立联邦 AI 基准测试中心、确保美国主导全球 AI 标准——全部被纳入白宫 AI 行动计划。OSTP 已责成 NIST、CAISI、DOE 和 NSF 牵头评估科学、建设测试平台并召集社区。该基金会同时发布首个"交互推理"评测 ARC-AGI-3,用于衡量模型在陌生环境中的技能获取效率。

  5. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  6. ARC Prize:官方博客73

    ARC Prize 发布交互式基准 ARC-AGI-3,ARC Prize 2026 设超 200 万美元奖金

    ARC Prize 发布 ARC-AGI-3,这是 ARC-AGI 系列首个全交互式基准,包含数百个人工设计的回合制环境和数千个游戏式关卡,无指令、无规则、无既定目标,要求智能体自行探索并跨关卡迁移所学。

    推荐理由:ARC-AGI-3 用无指令的交互环境测探索学习能力,人类 100% 对前沿 AI 0.51%,可据此思考指令跟随之外的智能差距。

  7. ARC Prize:官方博客23

    ARC Prize 官方资源合集:ARC-AGI 论文、视频与教程

    ARC Prize 官方博客汇总了面向 ARC-AGI 社区的论文、视频、工具、代码库与教程资源。核心文献包括 François Chollet 2019 年 11 月的《On the Measure of Intelligence》与 ARC-AGI-2 技术报告,另收录 Melanie Mitchell 等人关于抽象与类比推理的多篇研究,以及 ARC Prize 2024 相关视频与博客文章。

  8. ARC Prize:官方博客33

    ARC Prize 发布 ARC-AGI 系列:以核心知识先验衡量通用智能

    ARC Prize 发布 ARC-AGI 系列,延续 François Chollet 于 2019 年提出的 ARC-AGI 基准,用于衡量流体智能与技能获取效率。该基准仅使用核心知识先验,避免语言等文化知识带来的不公平优势,并遵循“对人类容易、对 AI 困难”的设计原则。ARC Prize 将 AGI 定义为学习效率可匹配人类的系统,并称 ARC-AGI 是唯一衡量通用智能进展的 AI 基准。

  9. Every:最新文章(网页)62

    如何为自己创建个人 AI 基准测试以选出适合工作的模型

    Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。

  10. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。

  11. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  12. Eugene Yan:Writing49

    为什么 LLM-as-Judge 救不了产品,修流程才行

    Eugene Yan 指出,指望再加一个工具、指标或 LLM-as-Judge 来解决产品问题,只会绕开核心难题、回避真正的工作。产品评估不是静态产物或速效药,而是把科学方法、评估驱动开发(EDD)和 AI 输出监控落到实处的实践:从观察数据、标注成败样本(理想为 50:50 的通过/失败分布)开始,再提出假设、设计实验、量化结果并迭代。

  13. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  14. arXiv:cs.AI(全量分类)36

    关系基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性

    研究揭示关系型上下文学习(ICL)中的支持集目标泄漏问题:当支持上下文包含目标衍生特征而查询端不可用时,评估结果会失真。作者构造 20 个目标衍生特征,在 13 个 RelBench 任务和 5 种关系 ICL 配置上测试,发现 0-hop 与 Full 泄漏造成最大偏差,且泄漏效应高度依赖任务与模型,甚至可逆转模型变体间的相对结论。

  15. arXiv:cs.AI(全量分类)39

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。

  16. arXiv:cs.CL(计算语言学,全量分类)35

    PADMÉ:面向 LM 智能体评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种面向智能体场景的元评估数据合成方法,将元评估重构为偏好判断问题,仅用小型语言模型、无需人工参与且计算开销低。其原型在四个智能体领域、三项评估标准上合成 1000 条样本,150 条子集的人工验证显示与人类判断的一致率从基线 73% 提升至 85%。该数据集对 25 个常见模型的元评估揭示了评估表现与打分粒度、宽松度及模型规模等因素的相关性。

  17. arXiv:cs.CL(计算语言学,全量分类)42

    CruxBench:一个信息发现基准

    研究者提出 CruxBench,一个按信息价值(VOI)给 LLM 生成问题打分的基准,衡量模型提出的关键子问题能在多大程度上更新对目标预测问题的信念。该基准抗污染、开放式且基于真实世界信念变化,在 293 个预测问题上评测了 8 个模型,VOI 与独立能力指标相关性达 r=0.90,但前沿 LLM 仅略微超过随机时机基线。

  18. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。