腾讯混元联合复旦清华发布AI探索能力基准
先了解这件事
腾讯混元联合复旦大学、清华大学发布 ExplorationBench,用于评测 AI 系统在可验证“外星世界”中的自主探索能力。基准包含 AlienCode(31 处隐藏规则变化、70 个任务)和 AlienLogic(24 条修改的推理规则、70 个定理)两个沙盒,答案由解释器或证明检查器判定,不使用 LLM 打分。 对 10 个前沿 AI 系统的测试显示:有反馈时最佳系统经四轮反馈从 15.7% 以下升至 89.0%,无反馈仅 0.5%–11.0%;重放系统自己最佳探针时,10 个系统中 9 个表现更差;规则全部正确陈述时任务解决率仅 73.4%。腾讯混元称,同一系统在同一预算下得分在 5.7% 到 79.0% 之间波动,两个世界之间的排名几乎不可迁移。 腾讯混元表示代码即将在 GitHub 开源。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- 腾讯混元腾讯混元联合复旦、清华发布 ExplorationBench:在可验证外星世界中测量 AI 探索能力
腾讯混元、复旦大学与清华大学研究人员发布 ExplorationBench,一个测量 AI 系统探索能力的基准,论文见 https://arxiv.org/abs/2609.30199。基准构建规则可执行、与已知知识冲突的可验证外星世界,含 AlienCode(31 处隐藏规则变化、70 任务)和 AlienLogic(24 条修改的推理规则、70 定理)两个沙盒,答案由解释器或证明检查器判定,不用 LLM judge。对 10 个前沿 AI 系统的测试发现:有反馈时最佳系统四轮后从 15.7% 以下升至 89.0%,无反馈仅 0.5–11.0%;重放系统自己最佳探针时 10 个系统中 9 个表现更差;规则全部正确陈述时任务解决率仅 73.4%;同一系统同一预算下得分在 5.7% 到 79.0% 之间波动,两个世界间排名几乎不可迁移。代码即将开源:https://github.com/Tencent-Hunyuan/ExplorationBench
- 腾讯混元腾讯混元联合复旦清华发布 ExplorationBench
腾讯混元联合复旦、清华推出 ExplorationBench,用可执行规则的 Alien Worlds 沙盒评测 AI 的自主探索能力,答案由解释器或证明检查器精确判定,不用 LLM 打分。测试 10 个前沿 AI 系统发现:AlienCode 无反馈时得分不超 15.7%,四轮反馈后最佳达 89.0%;同一系统同预算下得分在 5.7% 至 79.0% 间波动,两个沙盒的排名几乎不可迁移。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。