跳到正文
原文
xAI:News(网页)·· 2 小时前精选AI 评分63

xAI 发布 Grok-1.5:推理能力提升,上下文长度达 128K tokens

Announcing Grok-1.5 Grok-1.5 comes with improved reasoning capabilities and a context length of 128,000 tokens. Available on 𝕏 soon. Mar 28, 2024

AI 导读

xAI 发布新模型 Grok-1.5,即将向 𝕏 平台上的早期测试者和现有 Grok 用户开放。模型在 MATH 基准得 50.6%、GSM8K 得 90%。

推荐理由

官方公布了 Grok-1.5 的数学、代码基准成绩和 128K 上下文检索表现,并说明其基于 JAX、Rust 和 Kubernetes 的训练基础设施。

正文 · AI 翻译

隆重推出 Grok-1.5,这是我们最新的模型,具备长上下文理解和高级推理能力。Grok-1.5 将在未来几天内向我们的早期测试者以及 𝕏 平台上现有的 Grok 用户开放。

两周前,我们发布了 Grok-1 的模型权重和网络架构,让大家得以一窥 xAI 截至去年 11 月所取得的进展。自那以后,我们在最新模型 Grok-1.5 中改进了推理和问题解决能力。

能力与推理

Grok-1.5 最显著的改进之一是在编码和数学相关任务上的表现。在我们的测试中,Grok-1.5 在 MATH 基准测试中取得了 50.6% 的分数,在 GSM8K 基准测试中取得了 90% 的分数,这两个数学基准测试涵盖了从小学到高中竞赛题的广泛范围。此外,它在 HumanEval 基准测试中得分 74.1%,该测试评估代码生成和问题解决能力。

基准测试Grok-1Grok-1.5Mistral LargeClaude 2Claude 3 SonnetGemini Pro 1.5GPT-4Claude 3 Opus
MMLU73%
5-shot
81.3%
5-shot
81.2%
5-shot
75%
5-shot
79%
5-shot
83.7%
5-shot
86.4%
5-shot
86.8
5-shot
MATH23.9%
4-shot
50.6%
4-shot
—
—
40.5%
4-shot
58.5%
4-shot
52.9%
4-shot
61%
4-shot
GSM8K62.9
8-shot
90%
8-shot
81%
5-shot
88%
0-shot CoT
92.3%
0-shot CoT
91.7%
11-shot
92%
5-shot
95%
0-shot CoT
HumanEval63.2%
0-shot
74.1%
0-shot
45.1%
0-shot
70%
0-shot
73%
0-shot
71.9%
0-shot
67%
0-shot
84.9%
0-shot

长上下文理解

Grok-1.5 的一项新功能是能够在上下文窗口中处理长达 128K token 的长上下文。这使得 Grok 的记忆容量提升至先前上下文长度的 16 倍,从而能够利用来自更长文档的信息。

The image shows a graph that visualizes the model's ability to recall information from its context window. The x-axis is the length of the context window and the y-axis is the relative position of the fact to retrieve from the window. We use colors to mark the recall rate. The entire graph is green, which means the recall-rate is 100% for every context window and every placement of the fact to retrieve.

此外,该模型能够处理更长、更复杂的提示,同时随着上下文窗口的扩展,仍保持其指令遵循能力。在 Needle In A Haystack(NIAH)评估中,Grok-1.5 对长度达 128K token 的上下文中嵌入文本展现了强大的检索能力,实现了完美的检索结果。

Grok-1.5 基础设施

在庞大 GPU 集群上运行的前沿大语言模型(LLM)研究需要稳健且灵活的基础设施。Grok-1.5 构建在基于 JAX、Rust 和 Kubernetes 的定制分布式训练框架之上。这一训练技术栈使我们的团队能够以最小的投入大规模地验证想法并训练新架构。在大型计算集群上训练 LLM 的一个主要挑战是最大化训练任务的可靠性和正常运行时间。我们的定制训练编排器确保自动检测有问题的节点并将其从训练任务中剔除。我们还优化了检查点、数据加载和训练任务重启,以在发生故障时最大限度地减少停机时间。如果你对我们的训练技术栈感兴趣,欢迎申请加入团队。

展望未来

Grok-1.5 很快将提供给早期测试者,我们期待收到您的反馈,以帮助我们改进 Grok。随着我们逐步向更广泛的受众推出 Grok-1.5,我们很高兴在未来几天内推出几项新功能。

请注意,GPT-4 的分数取自 2023 年 3 月发布的版本。对于 MATH 和 GSM8K,我们展示的是 maj@1 结果。对于 HumanEval,我们报告的是 pass@1 基准分数。

来源:xAI:News(网页) · x.ai