跳到正文
原文
xAI:News(网页)·· 2 小时前精选AI 评分78

xAI 发布 Grok-2 与 Grok-2 mini 测试版

Grok-2 Beta Release We announce our new Grok-2 and Grok-2 mini models. Aug 13, 2024

AI 导读

xAI 发布 Grok-2 和 Grok-2 mini 的早期预览版,称其在聊天、编码和推理上较 Grok-1.5 显著提升。早期版本以 "sus-column-r" 名义在 LMSYS 排行榜测试,Elo 总分超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。

推荐理由

官方公告同时给出 LMSYS 排名与 GPQA、MMLU 等基准对比数据,读者可据此评估 Grok-2 相对前沿模型的实际水平。

正文 · AI 翻译

我们很高兴发布 Grok-2 的早期预览版,这是我们之前模型 Grok-1.5 的重大进步,具备聊天、编码和推理方面的前沿能力。同时,我们推出 Grok-2 mini,它是 Grok-2 的小巧但功能强大的兄弟版本。Grok-2 的早期版本已在 LMSYS 排行榜上以“sus-column-r”的名称进行了测试。在撰写本博文时,它的表现优于 Claude 3.5 Sonnet 和 GPT-4-Turbo。

Grok-2 和 Grok-2 mini 目前正在 𝕏 上进行测试,我们还将在本月晚些时候通过我们的企业 API 提供这两个模型。

Grok-2 语言模型和聊天能力

我们以“sus-column-r”的名称将 Grok-2 的早期版本引入 LMArena.ai Chatbot Arena,这是一个流行的竞争性语言模型基准测试。在 LMSYS 排行榜上,其整体 Elo 分数优于 Claude 和 GPT-4。

在内部,我们采用类似的流程来评估我们的模型。我们的人工智能导师会与我们的模型在各种任务上进行互动,这些任务反映了与 Grok 的真实世界交互。在每次互动中,人工智能导师会看到 Grok 生成的两个回复。他们根据我们指南中概述的具体标准选择更好的回复。我们专注于评估模型在两个关键领域的能力:遵循指令和提供准确、真实的信息。Grok-2 在检索内容推理和工具使用能力方面显示出显著改进,例如正确识别缺失信息、推理事件序列以及丢弃不相关的帖子。

基准测试

我们在一系列学术基准测试中评估了 Grok-2 模型,包括推理、阅读理解、数学、科学和编码。Grok-2 和 Grok-2 mini 都显示出比我们之前的 Grok-1.5 模型有显著改进。它们在研究生级科学知识(GPQA)、通用知识(MMLU、MMLU-Pro)和数学竞赛问题(MATH)等领域达到了与其他前沿模型竞争的性能水平。此外,Grok-2 在基于视觉的任务中表现出色,在视觉数学推理(MathVista)和基于文档的问答(DocVQA)中提供了最先进的性能。

基准测试Grok-1.5Grok-2 mini‡Grok-2‡GPT-4 Turbo*Claude 3 Opus†Gemini Pro 1.5Llama 3 405BGPT-4o*Claude 3.5 Sonnet†
GPQA35.9%51.0%56.0%48.0%50.4%46.2%51.1%53.6%59.6%
MMLU81.3%86.2%87.5%86.5%85.7%85.9%88.6%88.7%88.3%
MMLU-Pro51.0%72.0%75.5%63.7%68.5%69.0%73.3%72.6%76.1%
MATH§50.6%73.0%76.1%72.6%60.1%67.7%73.8%76.6%71.1%
HumanEval74.1%85.7%88.4%87.1%84.9%71.9%89.0%90.2%92.0%
MMMU53.6%63.2%66.1%63.1%59.4%62.2%64.5%69.1%68.3%
MathVista52.8%68.1%69.0%58.1%50.5%63.9%—63.8%67.7%
DocVQA85.6%93.2%93.6%87.2%89.3%93.1%92.2%92.8%95.2%

* GPT-4-Turbo 和 GPT-4o 分数来自 2024 年 5 月发布。

† Claude 3 Opus 和 Claude 3.5 Sonnet 分数来自 2024 年 6 月发布。

‡ Grok-2 的 MMLU、MMLU-Pro、MMMU 和 MathVista 使用 0-shot CoT 进行评估。

§ 对于 MATH,我们展示 maj@1 结果。

对于 HumanEval,我们报告 pass@1 基准分数。

在 𝕏 上体验具有实时信息的 Grok

在过去的几个月里,我们一直在不断改进 𝕏 平台上的 Grok。今天,我们推出 Grok 体验的下一个演进版本,具有重新设计的界面和新功能。

Black Forest Labs logo.

𝕏 Premium 和 Premium+ 用户将可以使用两款新模型:Grok-2 和 Grok-2 mini。Grok-2 是我们最先进的 AI 助手,在文本和视觉理解方面均具备高级能力,可整合来自 𝕏 平台的实时信息,并可通过 𝕏 应用中的 Grok 标签页访问。Grok-2 mini 是我们小巧但能力不俗的模型,在速度与回答质量之间取得平衡。与其前代相比,Grok-2 更直观、更易引导,并能灵活应对各种任务,无论你是寻求答案、协作写作,还是解决编码任务。我们正与 Black Forest Labs 合作,试验其 FLUX.1 模型,以扩展 Grok 在 𝕏 上的能力。如果你是 Premium 或 Premium+ 订阅用户,请务必更新到最新版本的 𝕏 应用,以便对 Grok-2 进行 beta 测试。

使用 Enterprise API 构建 Grok 应用

我们还将通过新的企业 API 平台于本月晚些时候向开发者发布 Grok-2 和 Grok-2 mini。我们即将推出的 API 构建于全新的定制技术栈之上,支持多区域推理部署,以便在全球范围内实现低延迟访问。我们提供增强的安全功能,例如强制多因素认证(如使用 Yubikey、Apple TouchID 或 TOTP)、丰富的流量统计以及高级计费分析(包括详细数据导出)。我们还提供管理 API,让你可以将团队、用户和计费管理集成到现有的内部工具和服务中。订阅我们的新闻通讯,以便在我们本月晚些时候发布时收到通知。

接下来是什么?

Grok-2 和 Grok-2 mini 正在 𝕏 上逐步推出。我们对它们在各种 AI 驱动功能中的应用感到非常兴奋,例如增强的搜索能力、对 𝕏 帖子获得更深入的洞察,以及改进的回复功能,所有这些均由 Grok 提供支持。很快,我们将发布多模态理解的预览版,作为 Grok 在 𝕏 和 API 上体验的核心部分。

自 2023 年 11 月宣布 Grok-1 以来,xAI 一直以非凡的速度前进,这得益于一支人才密度极高的小团队。我们推出了 Grok-2,使我们处于 AI 发展的前沿。我们的重点是利用新的计算集群推进核心推理能力。未来几个月,我们还有许多进展要分享。我们正在寻找人才加入我们这支小而专注的团队,致力于为人类未来打造最具影响力的创新。在此申请我们的职位。

来源:xAI:News(网页) · x.ai