跳到正文
原文
xAI:News(网页)·· 2 小时前精选AI 评分81

xAI 发布 Grok 4 及 Grok 4 Heavy,原生工具使用与实时搜索上线

Grok 4 Grok 4 is the most intelligent model in the world. It includes native tool use and real-time search integration, and is available now to SuperGrok and Premium+ subscribers, as well as through the xAI API. We are also introducing a new SuperGrok Heavy tier with access to Grok 4 Heavy - the most powerful version of Grok 4. Jul 9, 2025

AI 导读

xAI 发布 Grok 4,称其为目前最智能的模型,支持原生工具使用和实时搜索,即日起向 SuperGrok 和 Premium+ 订阅用户开放,并可通过 xAI API 调用。

推荐理由

官方发布说明了强化学习训练规模、原生工具使用和各基准成绩,读者可以据此评估 Grok 4 在推理与智能体任务上的定位。

正文 · AI 翻译

扩展强化学习

借助 Grok 3,我们将下一词预测预训练扩展到了前所未有的水平,从而打造出一个拥有无与伦比世界知识和性能的模型。我们还推出了 Grok 3 Reasoning,它使用强化学习进行训练,能够更长时间地思考问题,并以更高的准确率解决它们。在开发 Grok 3 Reasoning 的过程中,我们注意到了一些扩展趋势,表明有可能大幅扩展我们的强化学习训练。

对于 Grok 4,我们利用 Colossus——我们的 20 万 GPU 集群——来运行强化学习训练,在预训练规模上精炼 Grok 的推理能力。这得益于整个技术栈的创新,包括新的基础设施和算法工作,将我们训练的计算效率提高了 6 倍,以及大规模的数据收集工作,我们将可验证训练数据从主要是数学和编程数据显著扩展到了更多领域。由此产生的训练运行在超过此前一个数量级以上的计算量下,性能依然平稳提升。

人类最后的考试

处于人类知识前沿的深度专家级基准测试

最先进水平

完整集(2025 年 4 月 3 日),配备 Python 和互联网工具

原生工具使用

Grok 4 通过强化学习训练来使用工具。这使 Grok 能够在通常对大型语言模型具有挑战性的情况下,借助代码解释器和网页浏览等工具来增强其思考。在搜索实时信息或回答困难的研究问题时,Grok 4 会选择自己的搜索查询,从整个网络寻找知识,并根据需要深入挖掘,以打造高质量的回应。

我们还训练 Grok 使用强大的工具,从 X 深处查找信息。Grok 可以使用高级关键词和语义搜索工具,甚至查看媒体,以提高其答案的质量。

我记得几天前有一篇很火的帖子,讲的是一个跟腿有关的疯狂字谜。你能帮我找到它吗?

思考了 1 分钟

调查谜题帖子

  • 该请求是要找 2025 年 7 月初一篇关于涉及腿的疯狂字谜的热门帖子。
  • 让我们试着搜索 2025 年 7 月 1 日至 7 月 9 日的相关 X 帖子。
  • 也许搜索“关于腿的病毒式字谜”能帮助找到最近的帖子。

正在搜索 关于腿的病毒式字谜

正在搜索 (word puzzle) legs min_faves:100 since:2025-07-01 until:2025-07-09 filter:has_engagement

  • 搜索结果中的帖子显示了一个关于以腿部位同音词结尾的单词的谜题,如 toe、calf、knee、shin。
  • 许多帖子提到“toe、calf、knee、shin”是 Connections 谜题 #756 中的紫色类别。

探索谜题细节

  • 2025 年 7 月 7 日至 8 日左右的帖子表明,这篇热门帖子是关于 NYT Connections 谜题中那个荒谬的类别。
  • 让我们搜索“NYT Connections puzzle #756 answers”。

正在搜索 NYT Connections puzzle #756 answers

  • 2025 年 7 月 6 日,谜题 #756 的紫色类别是以腿部位同音词结尾的单词。
  • “疯狂”之处在于这种牵强,比如在某些口音中“shun”听起来像“shin”。

正在搜索 connections (toe calf knee shin) since:2025-07-06 until:2025-07-09 min_faves:100

正在搜索 nyt connections crazy leg puzzle homophones

  • 一条获得 660 个赞的帖子提到“toe calf knee shin they're homophones”,这可能就是那条热门帖子。
  • 现在,让我们在 X 上搜索 2025 年 7 月 6 日至 9 日期间包含“homophones”和“parts of the leg”的帖子,要求至少 100 个收藏。

正在搜索 homophones "parts of the leg" since:2025-07-06 until:2025-07-09 min_faves:100

正在搜索 connections legs OR leg since:2025-07-06 until:2025-07-09 min_faves:500

正在分析搜索结果

  • 一次新的搜索发现了一条获得 5052 个赞的回复帖,引用了关于这个谜题荒谬性的梗图。
  • 另一次搜索发现了一条获得 89123 个赞的帖子,很可能就是那条爆款帖,引用了对这个谜题的抱怨。

根据你的描述,听起来你指的是 2025 年 7 月 7 日的一条爆款 X 帖子,抱怨《纽约时报》每日 Connections 单词谜题(第 756 期)中一个特别令人抓狂的分类。该谜题要求将 16 个单词分成四个主题类别,其中一个——紫色(最难)组——是“以腿部部位的谐音结尾”。这些单词是 crypto(听起来以“toe”结尾)、decaf(以“calf”结尾)、Disney(以“knee”结尾)和 Prussian(以“shin”结尾)。这种牵强的联系在网上引发了大量愤怒和梗图,因为它过于冷僻且依赖口音。

你可能想到的那条具体热门帖子展示了一张谜题网格的截图,配文是“This game is a psyop to give me schizophrenia.”。它由 @LinkofSunshine 发布,迅速走红,几天内就获得了超过 21,000 个赞以及数百条回复、引用和转发。回复中的许多人都表达了同样的沮丧,称这个与腿相关的类别“荒谬”或“不猜根本不可能”。

如果这不是你指的那条,请告诉我更多细节(比如用户名或确切措辞),我可以进一步挖掘!

Grok 4 Heavy

我们在并行测试时计算方面取得了进一步进展,这使 Grok 能够同时考虑多个假设。我们将这个模型称为 Grok 4 Heavy,它树立了性能和可靠性的新标准。Grok 4 Heavy 在大多数学术基准测试中都达到了饱和,并且是首个在 Humanity's Last Exam 上得分 50% 的模型,该基准“旨在成为同类中最后一个封闭式学术基准”。

Grok 4 Heavy

处理中

剩余约 10 分钟

Agent 1

剩余约 10 分钟

Agent 2

剩余约 10 分钟

Agent 3

剩余约 10 分钟

思考了 10 分钟

前沿智能

Grok 4 代表了前沿智能的一次飞跃,在 ARC-AGI V2 上为闭源模型树立了新的最先进水平,达到 15.9%(几乎是 Opus 约 8.6% 的两倍,比此前最高分高出 8 个百分点)。在智能体 Vending-Bench 上,它以 4694.15 美元净资产和 4569 件售出(5 次运行的平均值)占据主导地位,远远超过 Claude Opus 4(2077.41 美元,1412 件)、人类(844.05 美元,344 件)等。Grok 4 Heavy 以 61.9% 领先 USAMO'25,并且是首个在 Humanity's Last Exam(纯文本子集)上得分 50.7% 的模型,通过规模化强化学习和原生工具使用,展示了无与伦比的复杂推理能力。

GPQA

科学

LiveCodeBench(1 月 - 5 月)

竞技编程

USAMO 2025

奥林匹克数学证明

HMMT 2025

竞技数学

AIME’25

竞赛数学

ARC-AGI-2

抽象与推理

Grok 4 API

Grok 4 API 为开发者带来前沿水平的多模态理解能力、256,000 上下文窗口以及高级推理能力,以应对跨文本和视觉的复杂任务。它通过我们新推出的实时搜索 API,集成了跨 X、网络及各类新闻源的实时数据搜索,借助原生工具调用实现最新、准确的响应。凭借企业级安全与合规——包括 SOC 2 Type 2、GDPR 和 CCPA 认证——该 API 为敏感应用提供强有力的保护。Grok 4 即将登陆我们的超大规模云合作伙伴,让企业更轻松地大规模部署创新 AI 解决方案。

Grok 4 语音模式

在我们升级后的语音模式中与 Grok 交谈,该模式具备更强的真实感、响应性和智能。我们推出了一种宁静的全新语音,并重新设计了对话,使其更加自然。

现在,Grok 能看到你所看到的!对准你的摄像头,直接开口说话,Grok 便会获取实时洞察,分析你的场景,并在语音聊天体验中实时回应你。我们自豪地推出这一模型,它采用我们最先进的强化学习框架和语音压缩技术,由我们内部训练而成。

在语音聊天中启用视频,Grok 在与你交谈时会查看它所看到的内容。

下一步

xAI 将继续把强化学习扩展到前所未有的水平,在 Grok 4 的进展基础上推动人工智能的边界。我们计划将范围从受控领域中的可验证奖励扩展到应对复杂的现实世界问题,让模型能够在动态环境中学习和适应。多模态能力将持续改进,整合视觉、音频及更多模态,以实现更直观的交互。总体而言,我们的重点仍是让模型更智能、更快速、更高效,推动系统真正以深刻的方式理解并协助人类。

来源:xAI:News(网页) · x.ai