跳到正文

xAI / Grok

马斯克 xAI 与 Grok 系列的全部动态:模型迭代、算力扩张与 X 平台整合的持续追踪。

最新精选

第 21–38 条 · 共 38 条
9月30日周三
  1. xAI:News(网页)73

    xAI 发布 Grok Bot:可长期自主工作的云端 Agent 队

    xAI 发布 Grok Bot,一组可全天候工作的 AI 智能体,拥有自己的云端计算机,能登录用户已有工具和应用中端到端完成任务,仅在需要审批时回报。产品处于 beta 阶段,面向 SuperGrok 和 Cursor 多档订阅用户开放桌面与 iOS 端,使用量与现有 Grok 和 Cursor 套餐分开计算;企业用户可加入等待名单。

    推荐理由:xAI 官方发布,读者可以据此了解 Grok Bot 的运行方式、订阅范围和与现有 Agent 产品的差异。

  2. xAI:News(网页)70

    Grok Build 全量开放:网页与移动端所有套餐可用

    xAI 宣布 Grok Build 在网页、iOS 和 Android 上向所有套餐开放,用户在 Grok 对话中描述应用、游戏、网站或仪表盘即可生成可运行版本。

    推荐理由:原文列出了从 Early Beta 到全量开放的发布与分享、Remix、自定义域名等具体变化,读者可据此判断是否纳入自己的应用搭建流程。

  3. Cursor Blog69

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务

    Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。

    推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。

  4. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  5. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  6. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  7. Tomer Tunguz 博客(VC 分析)78

    SpaceXAI 首季资本开支 183.7 亿美元追平超大规模厂商,但资金结构迥异

    Tomer Tunguz 分析 SpaceXAI 首个公开财季资本开支达 $18.37b,其中 $15.83b 投向 AI 基础设施,超出 $13.2b 的市场预期,规模接近 Microsoft 总开支的四成。

    推荐理由:原文用经营现金流对资本开支的覆盖率拆解各家AI基建投入的资金来源差异,提供了一个可比的分析框架。

  8. xAI:News(网页)63

    xAI 发布 Team Bots:可与团队共同工作的 Grok Bots 开启公测

    xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。

    推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。

  9. Cursor Blog79

    Cursor 宣布被 SpaceX 正式收购

    Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。

    推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。

8月14日周五
  1. Michael Truell79

    Cursor CEO Michael Truell 宣布收购已正式交割,Cursor 正式加入 SpaceX。其引用的 @cursor_ai 公告称团队将加入 SpaceXAI,帮助改进 Grok Build、Grok Bot、Grok API 和 Cursor 等产品。

    引用Cursor@cursor_ai

    Cursor is now part of @SpaceX. Today, we have officially closed our acquisition. We will join the @SpaceXAI team to help make Grok the world's most useful AI and improve Grok Build, Grok Bot, Grok API, Cursor, and more. SpaceX has built some of the most inspiring and impressive technology in the world, and we’re grateful for the opportunity to become part of such a special company. Onwards.

    推荐理由:Cursor CEO 亲自宣布收购交割完成,是当事人的一手信息,可用作该交易状态的直接依据。

8月12日周三
  1. Michael Truell61

    Grok 4.6 发布,官方称具备前沿智能,同价位下较 Grok 4.5 显著提升。作者补充称 4.6 在困难任务和知识工作上明显更强,结合了 Opus 级智能与打磨度,同时保持低成本和高速度,Grok 正逐步成为更能干的数字同事。

    引用SpaceXAI@SpaceXAI

    Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.

    推荐理由:转发并补充了 Grok 4.6 在难度任务和知识工作上更强、兼顾低成本低速度的定位,可作了解该版本能力方向的参考。

5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。