TasteVal基准评测AI实验研究品味
热点事件持续更新
TasteVal基准评测AI实验研究品味
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Oliver Jaffe 和 Dane Sherburn 发布 TasteVal 基准,以算力效率衡量前沿模型的实验研究品味。该基准含 8 个开放式前沿 AI 研发任务,招募 24 名人类专家(每任务至少 2 人),取每任务最佳专家尝试作为专家基线,并评测 2023 至 2026 年间发布的 20 个模型。 据作者说明,模型执行直到 40 H100 小时或 120 小时挂钟预算耗尽;为保持基准不被污染,任务不予公开。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
TasteVal 基准:衡量 AI 系统相对人类专家的实验研究品味报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.AITasteVal 基准:衡量 AI 系统相对人类专家的实验研究品味
Oliver Jaffe 和 Dane Sherburn 发布 TasteVal 基准,以算力效率衡量前沿模型的实验研究品味,包含 8 个开放式前沿 AI 研发任务,招募 24 名人类专家并评测 2023 至 2026 年间发布的 20 个模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。