上海人工智能实验室发布 WildClawBench:面向生产环境 AI 智能体的真实场景基准
上海人工智能实验室 InternLM 项目推出 WildClawBench,一个面向生产环境(production harness)中 AI 智能体的 in-the-wild 基准测试。该基准聚焦智能体在真实部署环境下的表现评估,目前随 InternLM 项目开源发布。
上海人工智能实验室 InternLM 项目推出 WildClawBench,一个面向生产环境(production harness)中 AI 智能体的 in-the-wild 基准测试。该基准聚焦智能体在真实部署环境下的表现评估,目前随 InternLM 项目开源发布。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾
上海人工智能实验室 InternLM 推出 EMemBench,一个面向 VLM 智能体的情景记忆交互式基准,论文已被 EMNLP 2026 Findings 收录。该基准以交互方式评测智能体的情景记忆能力,官方仓库已同步开放。
OpenAI 发布 Evals 入门指南,介绍如何用平台 Datasets 功能创建数据集、编写提示词并生成输出来评估模型表现。Evals 平台正在弃用,现有内容在过渡期内仍可用,2026 年 10 月 31 日起对现有用户转为只读,11 月 30 日关停。
OpenAI 发布 Evals API 使用指南,介绍如何通过 API 以编程方式配置评估,用 data_source_config 定义测试数据 schema、用 testing_criteria 设置评分器,并以 IT 工单分类为例演示完整流程。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
小米 MiMo 推出 lmms-eval,一个面向大型多模态模型(LMM)的一键式评估模块,用于加速 LMM 开发。该工具以评估模块形式提供,具体支持的模型、基准与使用方式未在原文中说明。
Mistral 提出用 LLM as a Judge 结合 RAG Triad 框架评估 RAG 系统,从上下文相关性、有据性和答案相关性三个维度打分。其 API 新增的结构化输出功能可定义评分 schema,让评判 LLM 输出机器可读的分数,从而构建更可靠的自动化评估流程。
Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。