跳到正文

#评测/基准

今日 2 条
9月30日周三
  1. ARC Prize:官方博客49

    ARC Prize 2026 - ARC-AGI-2 竞赛排行榜公布

    ARC Prize 2026 - ARC-AGI-2 竞赛当前排行榜显示,Tufa Labs 以 83.06 分位居第一,rabbithole 以 79.72 分排名第二,nvbanana 以 75.42 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。

  2. ARC Prize:官方博客43

    ARC Prize 2026 - ARC-AGI-3 竞赛排行榜

    ARC Prize 2026 - ARC-AGI-3 竞赛当前排行榜显示,Tufa Labs 以 45.33 分位居第一,Yi-Chia Chen 以 40.80 分排名第二,Daniel Franzen 以 27.24 分位列第三。该排行榜基于约 50% 的测试数据计算,最终结果将依据另外 50% 的数据确定,排名可能发生变化。

  3. ARC Prize:官方博客15

    ARC Prize Foundation:为 AGI 打造人类校准基准

    ARC Prize Foundation 是一个致力于加速 AGI 发展的非营利组织,主张真正的 AGI 不能只靠扩大现有模型规模,而需要转向具备流体智能的系统。该组织通过创建和策划人类校准的基准来衡量人类与 AI 之间的能力差距,并推动研究者探索超越模式匹配与记忆的方法。其团队由 ARC-AGI 创造者 François Chollet 等人组成,并维护开源协作生态。

9月24日周四
9月23日周三
9月22日周二
9月19日周六
9月18日周五
  1. Karina56

    Epoch AI 推出 Benchmark Reviews 计划,对 AI 基准进行审计,首批覆盖 15 个基准,其中 4 个 Verified、9 个 Flawed、2 个信息不足。Karina Nguyen 转发并称赞这一举措能激励行业构建真正高质量的基准,并感谢其审计了 PostTrainBench、挖掘出旧的 SimpleQA。

    引用Epoch AI@EpochAIResearch

    Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.

9月17日周四
9月8日周二
9月4日周五
9月2日周三
  1. Hugging Face:Blog(RSS)49

    BenchMIRT:LLM 基准测试究竟在测什么?

    研究者提出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知各基准测什么的情况下自行恢复出安全与通用推理两个主导维度。分析显示 BBQ 更贴近通用推理而非安全,WMDP 分数与通用推理关联更强且推理越强分数越低,HarmBench 的版权类问题也更接近通用推理。

8月29日周六
8月21日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)33

    NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构

    NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。

  2. Together AI 研究与产品博客(RSS)69

    Together AI 实测 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。

    推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。

8月19日周三
8月17日周一
8月13日周四
  1. Microsoft Research 博客(RSS)37

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。

8月7日周五
7月28日周二
7月15日周三
  1. Hugging Face:Blog(RSS)60

    Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量

    Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。

    推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。

7月6日周一
7月1日周三
6月30日周二
  1. Hugging Face:Blog(RSS)48

    Hugging Face 模型页新增 Every Eval Ever 评测结果展示

    Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可跨平台发布并回溯至完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。贡献者可通过转换器将 EEE 记录提交至 Community Evals,经组织官方账号提交的结果会显示验证标记。

6月17日周三
  1. Together AI 研究与产品博客(RSS)53

    Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%

    Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。

6月16日周二
5月19日周二
5月14日周四
4月21日周二
4月1日周三
3月26日周四