跳到正文

评测基准

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

最新精选

第 41–42 条 · 共 42 条
7月7日周二
  1. OpenRouter:Announcements(RSS)76

    OpenRouter 实测:LLM 图像输入用低细节档反而更贵更差

    OpenRouter 在 MMMU-Pro Vision 上对 OpenAI 和 Google 五个模型实测图像 detail 参数,发现推理模型用 low 细节反而更差更贵:gpt-5.5 low 比 auto 准确率低 13.8 个百分点(65.2% vs 79.0%),每题成本更高(5.1¢ vs 4.5¢),因为模型为弥补降采样图像多用了 1.6 倍推理 token。

    推荐理由:实测显示低图像细节在推理模型上反而更贵更差,读者可据此调整图像输入和推理档位来控制成本。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。