xAI 发布 Grok-2 与 Grok-2 mini 测试版
Grok-2 Beta Release We announce our new Grok-2 and Grok-2 mini models. Aug 13, 2024
xAI 发布 Grok-2 和 Grok-2 mini 的早期预览版,称其在聊天、编码和推理上较 Grok-1.5 显著提升。早期版本以 "sus-column-r" 名义在 LMSYS 排行榜测试,Elo 总分超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。
官方公告同时给出 LMSYS 排名与 GPQA、MMLU 等基准对比数据,读者可据此评估 Grok-2 相对前沿模型的实际水平。
我们很高兴发布 Grok-2 的早期预览版,这是我们之前模型 Grok-1.5 的重大进步,具备聊天、编码和推理方面的前沿能力。同时,我们推出 Grok-2 mini,它是 Grok-2 的小巧但功能强大的兄弟版本。Grok-2 的早期版本已在 LMSYS 排行榜上以“sus-column-r”的名称进行了测试。在撰写本博文时,它的表现优于 Claude 3.5 Sonnet 和 GPT-4-Turbo。
Grok-2 和 Grok-2 mini 目前正在 𝕏 上进行测试,我们还将在本月晚些时候通过我们的企业 API 提供这两个模型。
Grok-2 语言模型和聊天能力
我们以“sus-column-r”的名称将 Grok-2 的早期版本引入 LMArena.ai Chatbot Arena,这是一个流行的竞争性语言模型基准测试。在 LMSYS 排行榜上,其整体 Elo 分数优于 Claude 和 GPT-4。
在内部,我们采用类似的流程来评估我们的模型。我们的人工智能导师会与我们的模型在各种任务上进行互动,这些任务反映了与 Grok 的真实世界交互。在每次互动中,人工智能导师会看到 Grok 生成的两个回复。他们根据我们指南中概述的具体标准选择更好的回复。我们专注于评估模型在两个关键领域的能力:遵循指令和提供准确、真实的信息。Grok-2 在检索内容推理和工具使用能力方面显示出显著改进,例如正确识别缺失信息、推理事件序列以及丢弃不相关的帖子。
基准测试
我们在一系列学术基准测试中评估了 Grok-2 模型,包括推理、阅读理解、数学、科学和编码。Grok-2 和 Grok-2 mini 都显示出比我们之前的 Grok-1.5 模型有显著改进。它们在研究生级科学知识(GPQA)、通用知识(MMLU、MMLU-Pro)和数学竞赛问题(MATH)等领域达到了与其他前沿模型竞争的性能水平。此外,Grok-2 在基于视觉的任务中表现出色,在视觉数学推理(MathVista)和基于文档的问答(DocVQA)中提供了最先进的性能。
| 基准测试 | Grok-1.5 | Grok-2 mini‡ | Grok-2‡ | GPT-4 Turbo* | Claude 3 Opus† | Gemini Pro 1.5 | Llama 3 405B | GPT-4o* | Claude 3.5 Sonnet† | |
|---|---|---|---|---|---|---|---|---|---|---|
| GPQA | 35.9% | 51.0% | 56.0% | 48.0% | 50.4% | 46.2% | 51.1% | 53.6% | 59.6% | |
| MMLU | 81.3% | 86.2% | 87.5% | 86.5% | 85.7% | 85.9% | 88.6% | 88.7% | 88.3% | |
| MMLU-Pro | 51.0% | 72.0% | 75.5% | 63.7% | 68.5% | 69.0% | 73.3% | 72.6% | 76.1% | |
| MATH§ | 50.6% | 73.0% | 76.1% | 72.6% | 60.1% | 67.7% | 73.8% | 76.6% | 71.1% | |
| HumanEval¶ | 74.1% | 85.7% | 88.4% | 87.1% | 84.9% | 71.9% | 89.0% | 90.2% | 92.0% | |
| MMMU | 53.6% | 63.2% | 66.1% | 63.1% | 59.4% | 62.2% | 64.5% | 69.1% | 68.3% | |
| MathVista | 52.8% | 68.1% | 69.0% | 58.1% | 50.5% | 63.9% | — | 63.8% | 67.7% | |
| DocVQA | 85.6% | 93.2% | 93.6% | 87.2% | 89.3% | 93.1% | 92.2% | 92.8% | 95.2% |
* GPT-4-Turbo 和 GPT-4o 分数来自 2024 年 5 月发布。
† Claude 3 Opus 和 Claude 3.5 Sonnet 分数来自 2024 年 6 月发布。
‡ Grok-2 的 MMLU、MMLU-Pro、MMMU 和 MathVista 使用 0-shot CoT 进行评估。
§ 对于 MATH,我们展示 maj@1 结果。
¶ 对于 HumanEval,我们报告 pass@1 基准分数。
在 𝕏 上体验具有实时信息的 Grok
在过去的几个月里,我们一直在不断改进 𝕏 平台上的 Grok。今天,我们推出 Grok 体验的下一个演进版本,具有重新设计的界面和新功能。

𝕏 Premium 和 Premium+ 用户将可以使用两款新模型:Grok-2 和 Grok-2 mini。Grok-2 是我们最先进的 AI 助手,在文本和视觉理解方面均具备高级能力,可整合来自 𝕏 平台的实时信息,并可通过 𝕏 应用中的 Grok 标签页访问。Grok-2 mini 是我们小巧但能力不俗的模型,在速度与回答质量之间取得平衡。与其前代相比,Grok-2 更直观、更易引导,并能灵活应对各种任务,无论你是寻求答案、协作写作,还是解决编码任务。我们正与 Black Forest Labs 合作,试验其 FLUX.1 模型,以扩展 Grok 在 𝕏 上的能力。如果你是 Premium 或 Premium+ 订阅用户,请务必更新到最新版本的 𝕏 应用,以便对 Grok-2 进行 beta 测试。
使用 Enterprise API 构建 Grok 应用
我们还将通过新的企业 API 平台于本月晚些时候向开发者发布 Grok-2 和 Grok-2 mini。我们即将推出的 API 构建于全新的定制技术栈之上,支持多区域推理部署,以便在全球范围内实现低延迟访问。我们提供增强的安全功能,例如强制多因素认证(如使用 Yubikey、Apple TouchID 或 TOTP)、丰富的流量统计以及高级计费分析(包括详细数据导出)。我们还提供管理 API,让你可以将团队、用户和计费管理集成到现有的内部工具和服务中。订阅我们的新闻通讯,以便在我们本月晚些时候发布时收到通知。
接下来是什么?
Grok-2 和 Grok-2 mini 正在 𝕏 上逐步推出。我们对它们在各种 AI 驱动功能中的应用感到非常兴奋,例如增强的搜索能力、对 𝕏 帖子获得更深入的洞察,以及改进的回复功能,所有这些均由 Grok 提供支持。很快,我们将发布多模态理解的预览版,作为 Grok 在 𝕏 和 API 上体验的核心部分。
自 2023 年 11 月宣布 Grok-1 以来,xAI 一直以非凡的速度前进,这得益于一支人才密度极高的小团队。我们推出了 Grok-2,使我们处于 AI 发展的前沿。我们的重点是利用新的计算集群推进核心推理能力。未来几个月,我们还有许多进展要分享。我们正在寻找人才加入我们这支小而专注的团队,致力于为人类未来打造最具影响力的创新。在此申请我们的职位。
来源:xAI:News(网页) · x.ai