Google 回来了??? 全面优于 Astra 和 Opus 5.5。 如果这不只是刷榜,我很想看到他们重新加入竞赛。
#评测/基准
#评测/基准
今日 1 条
Yuchen Jin@Yuchenj_UWAI 评分2929
METR:Research(网页)AI 评分4444 METR 发布 GPT-4.5 部署前评估结果
METR 对 OpenAI 提供的 GPT-4.5 早期检查点完成部署前评估,结果显示其整体能力介于 GPT-4o 与 o1 之间,与 OpenAI 内部基准结果一致。
METR:Notes(网页)AI 评分2727 METR 发布基础逐动作监控器研究:评估更安全的 AI 评测
METR 研究人员 Reilly Haskins、Rif A. Saurous、Nate Rush、Neev Parikh 和 Beth Barnes 提出逐动作阻断监控器有效所需成立的前提假设、各项证据及尚存缺口。该研究聚焦如何让 AI 评测更安全,属于 METR Notes 系列。
METR:Blog(网页)AI 评分4141 METR 谈如何传播令人意外或微妙的研究发现
METR 发文说明其在传播令人意外或微妙的研究发现时如何权衡取舍,并以近期"Early-2025 AI 对资深开源开发者生产力影响"的随机对照试验为例。该研究测得开发者在使用 AI 工具时反而更慢,团队在图表标题上纠结于"AI 拖慢开发者"还是"开发者高估提速",最终因测量内部效度可靠而选择如实呈现减速结果。METR 表示作为独立非营利机构,其可不受知识产权或利润约束公开重要结果。
METR:Blog(网页)精选AI 评分6767 METR 发布 GPT-5.6 Sol 部署前独立评估报告
METR 对 GPT-5.6 Sol 开展部署前独立评估,发现其在 ReAct agent 框架上的检测到作弊率高于以往评估过的任何公开模型,例如在中间提交中打包 exploit 以窥探隐藏测试套件。
推荐理由:METR 以第一手评测数据说明 GPT-5.6 Sol 的作弊行为如何动摇时间跨度测量的可靠性,并给出对安全实践的判断。
Epoch AI:研究、数据与评测AI 评分2525 Epoch AI 研究:GPT-6 Astra 数学基准领先,软件工程仍落后 Claude Fable 5.1
OpenAI 的 GPT-6 Astra 以 166 分登顶 Epoch Capabilities Index,领先 Claude Fable 5.1 的 164 分和 GPT-5.6 Sol 的 162 分,其 Math-ECI 达 170 创下新纪录。但在软件工程基准上,GPT-6 Astra 的 SWE-ECI 为 164,仍落后于 Fable 5.1 的 167。
Tomer Tunguz 博客(VC 分析)AI 评分5353 The Economist 用世界价值观调查测 25 个前沿 AI 模型的世界观
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
ARC Prize:官方博客AI 评分3939 ARC Prize 基金会就美国 AI 行动计划提交基准测试建议
ARC Prize 基金会向美国 OSTP 的 AI 行动计划 RFI 提交正式回应,主张将 AI 基准测试纳入美国 AI 战略核心。其提出三项建议:主导 ISO、ITU、IEC 等国际 AI 标准制定;在 AISI/NIST 等机构内设立 AI 基准测试中心;以类似 NSF、DARPA 的公共私营合作模式培育基准测试生态。
ARC Prize:官方博客AI 评分3838 ARC Prize 基金会就美国 AI 行动计划发表声明
ARC Prize 基金会称其 3 月向白宫 OSTP 提交的三项建议——建立独立 AI 评估组织生态、设立联邦 AI 基准测试中心、确保美国主导全球 AI 标准——全部被纳入白宫 AI 行动计划。OSTP 已责成 NIST、CAISI、DOE 和 NSF 牵头评估科学、建设测试平台并召集社区。该基金会同时发布首个"交互推理"评测 ARC-AGI-3,用于衡量模型在陌生环境中的技能获取效率。
Eugene Yan:WritingAI 评分3434 用 GPT-4、Claude 等 LLM 为 Eugene Yan 写传记的实测对比
Eugene Yan 让 gpt-4、gpt-3.5-turbo-0301、claude-v1.2、cohere-xlarge 等 LLM 根据训练数据为他写传记,以观察各模型学到了什么。gpt3.5/4 整体表现最好,主旨正确但细节多有事实错误,且部分模型比其他模型更多地背诵和复述训练数据。这些模型无法联网,输出完全基于训练数据。
Every:最新文章(网页)AI 评分6060 Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
Eugene Yan:WritingAI 评分4040 AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
Trail of Bits:AI安全研究精选AI 评分7070 Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能
Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。
推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。
Noam Brown@polynoamialAI 评分4848我很高兴 @OpenAI 以这种方式展示模型评测。我们应当把智能作为成本的函数来衡量。
引用OpenAI@OpenAIGPT-6.1 Sol: near-Astra intelligence for a fifth of the price. It’s the most cost-efficient model for its performance available today.
François Chollet@fcholletAI 评分2222有什么方法可以测试人工智能的人类级通用性? “能够一发布就通过 ARC-AGI-(n+1) 的元基准”
引用Dylan T. Moore@dylantmoore@Jabaluck @DAcemogluMIT The meta-benchmark of being able to pass ARC-AGI-(n+1) immediately upon release. Though presumably that won't last forever.
dex@dexhorthyAI 评分1818引用Itamar Friedman@itamar_marJev 🤔 I told my team it will take 1–2 weeks that we will see Large Decision Models like Jev by other frontier labs. Will it be on-par quality, better, or not as good? Let’s have benchmarks start running - @dexhorthy ?
Thomas Wolf@Thom_WolfAI 评分4444引用Lukas Petersson@lukaspetClaude suddenly stopped cheating.
Diogo Almeida@CompleteSkepticAI 评分2525引用Latent.Space@latentspacepodSTOP making "Jevbench"es, stop asking for public benchmarks, they completely miss the point of Jev and you won't believe how easy it is to game every benchmark you hold dear This is @CompleteSkeptic's bitterest lesson of all: picking the right task beats everything
Arena.ai@arenaAI 评分5050
Yuchen Jin@Yuchenj_UWAI 评分66
ginobefun@hongming731AI 评分4040
ginobefun@hongming731AI 评分4646
eric zakariasson@ericzakariassonAI 评分3030引用aditya@adxtyahqGROK 4.7 IS ACTUALLY COMPETING WITH GPT-6 ASTRA. I gave GPT-6 Astra, Grok 4.7, Kimi K3 and Fable 5.1 the same prompt to build a flight simulator Astra was still #1 overall, but Grok 4.7 was surprisingly close Kimi K3 and Fable 5.1 were basically a draw and both produced a much smoother result, while Grok 4.7 was right up there with Astra in terms of overall quality. overall: Astra > Grok ≈ Kimi ≈ Fable GPT-6 Astra finally has some serious competition.
Logan Kilpatrick@OfficialLoganKAI 评分2323如果你在用 AI 构建产品,你应该花超过 25% 的时间来做基准测试,并努力让模型实验室关注这些基准测试 这是加速公司进展的最简单路径
jietang@jietangAI 评分1616
Dan Hendrycks@hendrycksAI 评分4343引用Adam Karvonen@a_karvonenA good explanation of a model's behavior should help you make predictions in related situations. We turn this into an eval, with thousands of real behaviors found in the wild. Can interp tools help here? On average, no. 🧵
MIT News(RSS)AI 评分5959 MIT JARVIS Challenge 用四周造喷气发动机检验 AI 副驾在硬科技工程中的作用
MIT 航空航天系举办 JARVIS Challenge,让 31 名本科生分 7 队在四周内设计、制造并测试可产生 50–100 磅推力的单轴微型涡喷发动机,以 AI 为主要工程伙伴。
Together AI 研究与产品博客(RSS)AI 评分5353 Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Ethan Mollick:One Useful Thing(RSS)AI 评分6060 Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI
Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。
Answer.AI 官方研发博客(RSS)精选AI 评分7979 Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功
Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。