反基准测试者强调任务选择重要性
热点事件持续更新
反基准测试者强调任务选择重要性
2 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年9月29日,用户@completeskeptic发帖重申极度反对基准测试,并引用推文称不要再搞“Jevbench”、不要再要求公开基准测试,这些做法没抓住Jevons悖论的重点,且珍视的每个基准测试都极易被刷分;该推文称这是@CompleteSkeptic最惨痛的教训,即选对任务胜过一切。 10月5日,@completeskeptic再次发帖称,benchmaxxed模型与由真正在乎可靠性的人做出的模型之间存在关键差异,该差异按定义不会体现在基准测试上,并称对于字符串LLM人们多少已认识到这一点。
AI 根据报道生成 · 55 分钟前更新
最新进展10月5日 07:03
基准刷分模型与可靠模型的本质差异事件进展
2 个进展
- 10月5日 07:03 · 1 篇报道基准刷分模型与可靠模型的本质差异@completeskeptic:基准刷分模型与可靠模型的本质差异
- 9月29日 07:57 · 1 篇报道反对公共基准测试,强调任务选择的重要性@completeskeptic:反基准测试者的Jevons悖论之辩
报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- @completeskeptic基准刷分模型与可靠模型的本质差异
benchmaxxed 模型和那些由真正在乎可靠性的人做出的模型之间,存在一个关键差异,而这个差异按定义就不会体现在基准测试上 (对于字符串 LLM,我们多少已经认识到这一点了……)
9月29日
- @completeskeptic反基准测试者的Jevons悖论之辩
再强调一下,我极度反对基准测试(: 引用推文例外处理——引用推文核心要点:别再搞“Jevbench”了,别再要求公开基准测试,它们完全没抓住Jevons悖论的重点,而且你不敢相信,你珍视的每一个基准测试有多容易被刷分。这是@CompleteSkeptic最惨痛的教训:选对任务胜过一切。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。