跳到正文

#评测/基准

今日 1 条
今天10月1日周四
9月30日周三
  1. METR:Blog(网页)41

    METR 谈如何传播令人意外或微妙的研究发现

    METR 发文说明其在传播令人意外或微妙的研究发现时如何权衡取舍,并以近期"Early-2025 AI 对资深开源开发者生产力影响"的随机对照试验为例。该研究测得开发者在使用 AI 工具时反而更慢,团队在图表标题上纠结于"AI 拖慢开发者"还是"开发者高估提速",最终因测量内部效度可靠而选择如实呈现减速结果。METR 表示作为独立非营利机构,其可不受知识产权或利润约束公开重要结果。

  2. METR:Blog(网页)67

    METR 发布 GPT-5.6 Sol 部署前独立评估报告

    METR 对 GPT-5.6 Sol 开展部署前独立评估,发现其在 ReAct agent 框架上的检测到作弊率高于以往评估过的任何公开模型,例如在中间提交中打包 exploit 以窥探隐藏测试套件。

    推荐理由:METR 以第一手评测数据说明 GPT-5.6 Sol 的作弊行为如何动摇时间跨度测量的可靠性,并给出对安全实践的判断。

  3. ARC Prize:官方博客38

    ARC Prize 基金会就美国 AI 行动计划发表声明

    ARC Prize 基金会称其 3 月向白宫 OSTP 提交的三项建议——建立独立 AI 评估组织生态、设立联邦 AI 基准测试中心、确保美国主导全球 AI 标准——全部被纳入白宫 AI 行动计划。OSTP 已责成 NIST、CAISI、DOE 和 NSF 牵头评估科学、建设测试平台并召集社区。该基金会同时发布首个"交互推理"评测 ARC-AGI-3,用于衡量模型在陌生环境中的技能获取效率。

  4. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。

  5. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  6. Trail of Bits:AI安全研究70

    Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能

    Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。

    推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。

9月29日周二
  1. Diogo Almeida25

    再强调一下,我极度反对基准测试(: 引用推文例外处理——引用推文核心要点:别再搞“Jevbench”了,别再要求公开基准测试,它们完全没抓住Jevons悖论的重点,而且你不敢相信,你珍视的每一个基准测试有多容易被刷分。这是@CompleteSkeptic最惨痛的教训:选对任务胜过一切。

    引用Latent.Space@latentspacepod

    STOP making "Jevbench"es, stop asking for public benchmarks, they completely miss the point of Jev and you won't believe how easy it is to game every benchmark you hold dear This is @CompleteSkeptic's bitterest lesson of all: picking the right task beats everything

9月27日周日
9月23日周三
9月22日周二
  1. eric zakariasson30

    grok 4.7 的一些实际用例! 飞行模拟

    引用aditya@adxtyahq

    GROK 4.7 IS ACTUALLY COMPETING WITH GPT-6 ASTRA. I gave GPT-6 Astra, Grok 4.7, Kimi K3 and Fable 5.1 the same prompt to build a flight simulator Astra was still #1 overall, but Grok 4.7 was surprisingly close Kimi K3 and Fable 5.1 were basically a draw and both produced a much smoother result, while Grok 4.7 was right up there with Astra in terms of overall quality. overall: Astra > Grok ≈ Kimi ≈ Fable GPT-6 Astra finally has some serious competition.

9月8日周二
8月22日周六
7月15日周三
6月17日周三
  1. Together AI 研究与产品博客(RSS)53

    Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%

    Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。

11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)60

    Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI

    Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。