xAI 发布 Grok 4.1,全平台可用
Grok 4.1 Grok 4.1 is now available to all users on grok.com, 𝕏, and the iOS and Android apps. It is rolling out immediately in Auto mode and can be selected explicitly as “Grok 4.1” in the model picker. Nov 17, 2025
xAI 发布 Grok 4.1,现已面向所有用户在 grok.com、X 及 iOS 和 Android 应用开放,Auto 模式立即推送,也可在模型选择器中手动选择。
官方公告给出 LMArena、EQ-Bench3 等评测数据和盲测偏好比例,读者可据此比较 Grok 4.1 与前代及竞品的实际表现。
Grok 4.1 现已在 grok.com、𝕏 以及 iOS 和 Android 应用上向所有用户开放。它立即在 Auto 模式下推出,并可在模型选择器中明确选择为“Grok 4.1”。
我们很高兴推出 Grok 4.1,它为 Grok 的实际可用性带来了显著提升。我们的 4.1 模型在创意、情感和协作互动方面表现出色。它对细微意图更加敏锐,交谈更具吸引力,个性更加连贯,同时完全保留了前代模型锐利的智能和可靠性。为实现这一点,我们使用了驱动 Grok 4 的相同大规模强化学习基础设施,并将其应用于优化模型的风格、个性、有用性和对齐。为了优化这些不可验证的奖励信号,我们开发了新方法,使我们能够使用前沿智能体推理模型作为奖励模型,大规模自主评估和迭代响应。
静默推出,2025 年 11 月 1 日至 14 日
我们对初步 Grok 4.1 构建版本进行了逐步静默推出,使其覆盖 grok.com、X 和移动应用中越来越多的生产流量。在为期两周的静默推出期间,我们对实时流量进行了持续的盲测成对评估。
Grok 4.1
对比此前的 Grok
与流量中的此前生产模型相比,Grok 4.1 在 64.78% 的情况下更受偏好。
最先进的通用能力
Grok 4.1 在盲测人类偏好评估中树立了新标准。
在 LMArena 的 Text Arena 中,Grok 4.1 Thinking(代号:quasarflux)以 1483 Elo 位居总榜第 1——领先最高非 xAI 模型 31 分,优势明显。Grok 4.1 的非推理模式(代号:tensor)不使用思考 token,可立即响应,并以 1465 Elo 排名第 2。Grok 4.1 非思考模式在公开排行榜上超过了其他所有模型的完整推理配置。Grok 4.1 显著超越总排名第 33 的 Grok 4。
情商
为了衡量模型在个性和人际能力方面的进展,我们在 EQ-Bench3 上评估了 Grok 4.1。EQ-Bench 是一项由 LLM 评判的测试,评估主动情商能力、理解、洞察、共情和人际交往技能。测试集包含 45 个具有挑战性的角色扮演场景,其中大多数由横跨 3 轮的预写提示组成。该基准通过根据多项标准验证模型响应来评估模型表现。此外,该基准还进行成对比较,以报告排行榜中每个模型的归一化 Elo 计算值。
我们通过运行官方基准仓库报告评分标准和归一化 Elo 分数。分数使用默认采样参数、指定评判模型(Claude Sonnet 3.7),并按照基准要求不使用系统提示计算得出。
以下是 Grok 4.1 如何回应情感提示的示例:
创意写作
我们还衡量了 4.1 模型在 Creative Writing v3 基准上的表现。在该基准中,模型针对 32 个不同的写作提示生成响应,共进行 3 次迭代。与 EQ-Bench 类似,分数使用评分标准和模型对战归一化 Elo 计算。
方法论
对于 EQ-Bench3 和 Creative Writing v3,我们正在与作者合作,以获取排行榜上的数字。
以下是 Grok 4.1 如何回应创意写作提示的一些示例:
减少幻觉
配备搜索工具的快速(非推理)模型能提供快速答案,但由于推理深度受限和工具调用预算有限,它们可能容易出现事实性错误。
在 Grok 4.1 的后训练中,我们专注于减少信息寻求类提示中的事实性幻觉。随后我们观察到,在抽样的生产环境信息寻求提示中,幻觉率显著降低。
我们在来自生产流量的真实世界信息寻求查询的分层样本上评估幻觉率。我们还评估了 FActScore,这是一个由 500 个关于个人的传记问题组成的公开基准。
方法论
评估是通过使用网络搜索工具对非推理模型进行评估来完成的
幻觉率定义为模型响应中具有重大/轻微错误的原子声明百分比的宏平均
更多示例
我们在下面还包含了一些其他示例,展示 Grok 4.1 如何回应一系列提示。
你可以在此阅读 Grok 4.1 模型卡。
来源:xAI:News(网页) · x.ai