跳到正文
热点事件持续更新

腾讯混元联合复旦清华发布AI探索能力基准

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

腾讯混元联合复旦大学、清华大学发布 ExplorationBench,用于评测 AI 系统在可验证“外星世界”中的自主探索能力。基准包含 AlienCode(31 处隐藏规则变化、70 个任务)和 AlienLogic(24 条修改的推理规则、70 个定理)两个沙盒,答案由解释器或证明检查器判定,不使用 LLM 打分。 对 10 个前沿 AI 系统的测试显示:有反馈时最佳系统经四轮反馈从 15.7% 以下升至 89.0%,无反馈仅 0.5%–11.0%;重放系统自己最佳探针时,10 个系统中 9 个表现更差;规则全部正确陈述时任务解决率仅 73.4%。腾讯混元称,同一系统在同一预算下得分在 5.7% 到 79.0% 之间波动,两个世界之间的排名几乎不可迁移。 腾讯混元表示代码即将在 GitHub 开源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. 腾讯混元
    腾讯混元联合复旦、清华发布 ExplorationBench:在可验证外星世界中测量 AI 探索能力

    腾讯混元、复旦大学与清华大学研究人员发布 ExplorationBench,一个测量 AI 系统探索能力的基准,论文见 https://arxiv.org/abs/2609.30199。基准构建规则可执行、与已知知识冲突的可验证外星世界,含 AlienCode(31 处隐藏规则变化、70 任务)和 AlienLogic(24 条修改的推理规则、70 定理)两个沙盒,答案由解释器或证明检查器判定,不用 LLM judge。对 10 个前沿 AI 系统的测试发现:有反馈时最佳系统四轮后从 15.7% 以下升至 89.0%,无反馈仅 0.5–11.0%;重放系统自己最佳探针时 10 个系统中 9 个表现更差;规则全部正确陈述时任务解决率仅 73.4%;同一系统同一预算下得分在 5.7% 到 79.0% 之间波动,两个世界间排名几乎不可迁移。代码即将开源:https://github.com/Tencent-Hunyuan/ExplorationBench

9月30日
  1. 腾讯混元
    腾讯混元联合复旦清华发布 ExplorationBench

    腾讯混元联合复旦、清华推出 ExplorationBench,用可执行规则的 Alien Worlds 沙盒评测 AI 的自主探索能力,答案由解释器或证明检查器精确判定,不用 LLM 打分。测试 10 个前沿 AI 系统发现:AlienCode 无反馈时得分不超 15.7%,四轮反馈后最佳达 89.0%;同一系统同预算下得分在 5.7% 至 79.0% 间波动,两个沙盒的排名几乎不可迁移。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。