xAI 发布 Grok 3 Beta:推理增强,Chatbot Arena Elo 达 1402
Grok 3 Beta — The Age of Reasoning Agents We are thrilled to unveil an early preview of Grok 3, our most advanced model yet, blending superior reasoning with extensive pretraining knowledge. Feb 19, 2025
xAI 发布 Grok 3 早期预览版及 Grok 3 mini,称其在推理、数学、编码和世界知识任务上显著提升,Chatbot Arena Elo 达 1402。
官方公布了 Grok 3 的基准成绩、100 万 token 上下文窗口和 DeepSearch 智能体,读者可据此对比现有模型表现。
我们非常激动地推出 Grok 3 的早期预览版,这是我们迄今为止最先进的模型,将卓越的推理能力与广泛的预训练知识融为一体。
来自 xAI 的下一代智能
我们很高兴推出 Grok 3,这是我们迄今为止最先进的模型:将强大的推理能力与广泛的预训练知识融为一体。 Grok 3 在我们的 Colossus 超级集群上进行训练,计算量是之前最先进模型的 10 倍,在推理、数学、编程、世界知识和指令遵循任务方面展现出显著提升。 Grok 3 的推理能力通过大规模强化学习得到精炼,使其能够思考数秒到数分钟,纠正错误、探索替代方案并给出准确答案。Grok 3 在学术基准和真实用户偏好方面均具有领先表现,在 Chatbot Arena 中取得了 1402 的 Elo 分数。与此同时,我们还推出了 Grok 3 mini,它代表了高性价比推理的新前沿。这两个模型仍在训练中,并将根据你们的反馈快速演进。我们将在未来几天内向用户推出 Grok 3,以及其推理能力的早期预览版。
更深入地思考:测试时计算与推理
今天,我们宣布两个 beta 推理模型:Grok 3 (Think) 和 Grok 3 mini (Think)。它们使用前所未有规模的强化学习(RL)进行训练,以精炼其思维链过程,从而以数据高效的方式实现高级推理。通过 RL,Grok 3 (Think) 学会了改进其问题解决策略、通过回溯纠正错误、简化步骤,并利用其在预训练期间获得的知识。就像人类在解决复杂问题时所做的那样,Grok 3 (Think) 可以花费几秒到几分钟进行推理,常常会考虑多种方法、验证自己的解决方案,并评估如何精确满足问题的要求。
这两个模型仍在训练中,但它们已经在一系列基准测试中展现出卓越表现。我们在 2025 年美国数学邀请赛(AIME)上测试了这些模型,该考试于 2 月 12 日、也就是仅仅 7 天前发布。在我们最高水平的测试时计算(cons@64)下,Grok 3 (Think) 在该竞赛中达到了 93.3%。Grok 3 (Think) 在研究生水平专家推理(GPQA)上也达到了 84.6%,在用于代码生成和问题解决的 LiveCodeBench 上达到了 79.4%。此外,Grok 3 mini 在不需要那么多世界知识的 STEM 任务中,达到了高性价比推理的新前沿,在 AIME 2024 上达到 95.8%,在 LiveCodeBench 上达到 80.4%。
AIME’25
竞赛数学
AIME’24
竞赛数学
GPQA
研究生水平 Google-Proof Q&A(Diamond)
LCB
代码生成:2024/10/1 - 2025/2/1
MMMU
多模态理解
要使用 Grok 3 的推理能力,只需按下 Think 按钮。
Grok 3 (Think) 的思维完全开放,使用户不仅能够查看最终答案,还能检查模型本身的推理过程。
我们发现 Grok 3 (Think) 的表现能够泛化到多样的问题领域。以下是一些 Grok 3 推理示例。
研究样本
创建一个融合两款经典游戏的游戏。用 pygame 制作,并让它看起来漂亮。
以下是您查询的完整解决方案:一个名为“Break-Pong”的 Pygame 游戏,它结合了 Pong 和 Breakout 的元素。在这个游戏中,两名玩家控制屏幕两侧的球拍,击球以打破中央的砖墙。通过打破砖块和让球越过对手的球拍来得分。游戏包含流畅的动画、色彩丰富的图形和粒子效果,使其在视觉上更具吸引力。以下是实现:
代码实现
python
如何运行
- 确保您已安装 Python 和 Pygame(
pip install pygame)。 - 将代码复制到一个
.py文件中(例如break_pong.py)。 - 使用 Python 运行该文件(例如
python break_pong.py)。
游戏玩法说明
- Controls:
- 左侧球拍:
W(上),S(下) - 右侧球拍:
Up Arrow(上),Down Arrow(下)
- 左侧球拍:
- 目标:打破中央墙壁上的砖块,并通过让球越过对手的球拍来得分。首先获得 50 分者获胜。
特性
- Pong 元素:两个球拍来回弹球,当球越过对手的球拍时得分。
- Breakout 元素:一堵砖墙,球撞击时可以打破。
- Visual Appeal:
- 流畅的球拍和球运动。
- 色彩丰富的砖块(红色、绿色、蓝色)随机分配。
- 砖块破碎时的粒子效果,粒子逐渐淡出,呈现动态外观。
- 清晰的得分显示和游戏结束消息。
增强功能
为了使其更美观或更吸引人,可以考虑:
- 添加音效(例如,弹跳声、破碎声)。
- 实现从特殊砖块中释放的道具(例如,更大的球拍、更快的球)。
- 添加背景渐变或图案。
- 包括开始菜单和更平滑的过渡。
此实现提供了一个有趣、视觉上吸引人的 Pong 和 Breakout 混合体,满足了您的要求!享受玩“Break-Pong”吧!
大规模预训练
关闭推理功能后,Grok 3 能即时提供高质量响应。在非推理模型中,Grok 3 在多样化的学术基准测试中取得了最先进的结果,包括:研究生级别的科学知识(GPQA)、常识(MMLU-Pro)、数学竞赛问题(AIME)。Grok 3 在图像理解(MMMU)和视频理解(EgoSchema)任务中也表现出色。
| 基准测试 | Grok 3 Beta | Grok 3 mini Beta | Gemini 2.0 | DeepSeek-V3 | GPT 4o | Claude 3.5 Sonnet |
|---|---|---|---|---|---|---|
AIME’24 | 52.2% | 39.7% | — | 39.2% | 9.3% | 16.0% |
GPQA | 75.4% | 66.2% | 64.7% | 59.1% | 53.6% | 65.0% |
LCB | 57.0% | 41.5% | 36.0% | 33.1% | 32.3% | 40.2% |
MMLU-pro | 79.9% | 78.9% | 79.1% | 75.9% | 72.6% | 78.0% |
LOFT (128k) | 83.3% | 83.1% | 75.6% | — | 78.0% | 69.9% |
SimpleQA | 43.6% | 21.7% | 44.3% | 24.9% | 38.2% | 28.4% |
MMMU | 73.2% | 69.4% | 72.7% | — | 69.1% | 70.4% |
EgoSchema | 74.5% | 74.3% | 71.9% | — | 72.2% | — |
凭借 100 万 token 的上下文窗口——比我们之前的模型大 8 倍——Grok 3 可以处理大量文档并处理复杂提示,同时保持指令遵循的准确性。 在针对长上下文 RAG 用例的 LOFT (128k) 基准测试中,Grok 3 取得了最先进的准确率(在 12 个多样化任务中平均),展示了其强大的信息检索能力。
Grok 3 还展示了改进的事实准确性和增强的风格控制。在代号 chocolate 下,Grok 3 的早期版本登上了 LMArena Chatbot Arena 排行榜榜首,在所有类别中的 Elo 分数均优于所有竞争对手。随着我们继续扩展,我们正准备在我们的 200,000 GPU 集群上训练更大的模型。

Grok 代理:结合推理与工具使用
为了理解宇宙,我们必须让 Grok 与世界交互。配备代码解释器和互联网访问,Grok 3 模型学会查询缺失的上下文,动态调整其方法,并根据反馈改进其推理。
作为实现这一愿景的第一步,我们正在推出DeepSearch——我们的首个智能体。它是一款快如闪电的 AI 智能体,旨在对人类全部知识体系发挥作用。DeepSearch 的设计目标是综合关键信息、对相互冲突的事实与观点进行推理,并从复杂中提炼清晰。无论你需要获取最新实时新闻、寻求关于社交困扰的建议,还是进行深入的科学研究,DeepSearch 都将带你远远超越浏览器搜索。它最终总结追踪的结果是一份简洁而全面的报告,帮助你跟上这个永不停歇的世界。
DeepSearch 展示
Grok 3 API 即将推出
在未来几周内,我们将通过我们的 API 平台发布 Grok 3 和 Grok 3 mini,提供对标准模型和推理模型的访问。DeepSearch 也将通过我们的 API 向企业合作伙伴发布。
Grok 3 的下一步是什么?
Grok 3 的训练仍在进行中,并计划在未来几个月内频繁更新。我们很高兴在 Enterprise API 中推出新功能,包括工具使用、代码执行和高级代理能力。继上周发布 RMF(风险管理框架)之后,我们尤其希望加速训练期间在可扩展监督和对抗鲁棒性方面的进展。
Grok 3 现已向 𝕏 和 Grok.com 上的 𝕏 Premium 和 Premium+ 用户开放。
𝕏 Premium+ 用户还将立即获得 Think 和 DeepSearch 的访问权限。
此外,Grok 3 的能力正在向所有 Grok 用户推出,但有使用限制。
𝕏 Premium+ 用户将拥有更高的限制并可访问高级能力。
加入这段旅程
自 2023 年 11 月推出 Grok 1 以来,xAI 这支规模小、人才密集的团队推动了历史性进展,使我们处于 AI 创新的前沿。借助 Grok 3,我们正在利用扩展后的 Colossus 超级集群推进核心推理能力,未来还将有令人兴奋的发展。如果你热衷于为人类未来构建 AI,请通过 x.ai/careers 申请加入我们的团队。
来源:xAI:News(网页) · x.ai