跳到正文
热点事件持续更新

TasteVal基准评测AI实验研究品味

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Oliver Jaffe 和 Dane Sherburn 发布 TasteVal 基准,以算力效率衡量前沿模型的实验研究品味。该基准含 8 个开放式前沿 AI 研发任务,招募 24 名人类专家(每任务至少 2 人),取每任务最佳专家尝试作为专家基线,并评测 2023 至 2026 年间发布的 20 个模型。 据作者说明,模型执行直到 40 H100 小时或 120 小时挂钟预算耗尽;为保持基准不被污染,任务不予公开。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    TasteVal 基准:衡量 AI 系统相对人类专家的实验研究品味

    Oliver Jaffe 和 Dane Sherburn 发布 TasteVal 基准,以算力效率衡量前沿模型的实验研究品味,包含 8 个开放式前沿 AI 研发任务,招募 24 名人类专家并评测 2023 至 2026 年间发布的 20 个模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。