跳到正文
热点事件持续更新

反基准测试者强调任务选择重要性

2 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026年9月29日,用户@completeskeptic发帖重申极度反对基准测试,并引用推文称不要再搞“Jevbench”、不要再要求公开基准测试,这些做法没抓住Jevons悖论的重点,且珍视的每个基准测试都极易被刷分;该推文称这是@CompleteSkeptic最惨痛的教训,即选对任务胜过一切。 10月5日,@completeskeptic再次发帖称,benchmaxxed模型与由真正在乎可靠性的人做出的模型之间存在关键差异,该差异按定义不会体现在基准测试上,并称对于字符串LLM人们多少已认识到这一点。

AI 根据报道生成 · 55 分钟前更新

事件进展

2 个进展

  1. 10月5日 07:03 · 1 篇报道
    基准刷分模型与可靠模型的本质差异
    @completeskeptic:基准刷分模型与可靠模型的本质差异
  2. 9月29日 07:57 · 1 篇报道
    反对公共基准测试,强调任务选择的重要性
    @completeskeptic:反基准测试者的Jevons悖论之辩

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. @completeskeptic
    基准刷分模型与可靠模型的本质差异

    benchmaxxed 模型和那些由真正在乎可靠性的人做出的模型之间,存在一个关键差异,而这个差异按定义就不会体现在基准测试上 (对于字符串 LLM,我们多少已经认识到这一点了……)

9月29日
  1. @completeskeptic
    反基准测试者的Jevons悖论之辩

    再强调一下,我极度反对基准测试(: 引用推文例外处理——引用推文核心要点:别再搞“Jevbench”了,别再要求公开基准测试,它们完全没抓住Jevons悖论的重点,而且你不敢相信,你珍视的每一个基准测试有多容易被刷分。这是@CompleteSkeptic最惨痛的教训:选对任务胜过一切。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。