跳到正文

#xAI

今日 0 条
9月30日周三
  1. xAI:News(网页)73

    xAI 发布 Grok Bot:可长期自主工作的云端 Agent 队

    xAI 发布 Grok Bot,一组可全天候工作的 AI 智能体,拥有自己的云端计算机,能登录用户已有工具和应用中端到端完成任务,仅在需要审批时回报。产品处于 beta 阶段,面向 SuperGrok 和 Cursor 多档订阅用户开放桌面与 iOS 端,使用量与现有 Grok 和 Cursor 套餐分开计算;企业用户可加入等待名单。

    推荐理由:xAI 官方发布,读者可以据此了解 Grok Bot 的运行方式、订阅范围和与现有 Agent 产品的差异。

  2. xAI:News(网页)54

    Grok 4.6 上线 GitHub Copilot

    xAI 宣布最新编程模型 Grok 4.6 在 GitHub Copilot 上线,覆盖云 agent、Copilot CLI 和 VS Code IDE,用户在模型选择器中选 "Grok 4.6" 即可使用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI 控制台使用,价格为每百万输入 token $2、每百万输出 token $6。

  3. xAI:News(网页)70

    Grok Build 全量开放:网页与移动端所有套餐可用

    xAI 宣布 Grok Build 在网页、iOS 和 Android 上向所有套餐开放,用户在 Grok 对话中描述应用、游戏、网站或仪表盘即可生成可运行版本。

    推荐理由:原文列出了从 Early Beta 到全量开放的发布与分享、Remix、自定义域名等具体变化,读者可据此判断是否纳入自己的应用搭建流程。

  4. xAI:News(网页)44

    Grok 4.6 上线 Amazon Bedrock

    xAI 的旗舰模型 Grok 4.6 现已在 Amazon Bedrock 正式可用,面向长时间运行的智能体及交互与视觉任务,支持 500k 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。定价为输入 $2 / 百万 tokens、缓存输入 $0.50 / 百万 tokens、输出 $6 / 百万 tokens,已在支持的 AWS 区域向所有开发者开放。

  5. xAI:News(网页)43

    Grok 4.6 上线 Gemini Enterprise Agent Platform

    xAI 的旗舰模型 Grok 4.6 现已在 Gemini Enterprise Agent Platform 的 Model Garden 中开放给开发者使用。该模型面向长时间运行的智能体及交互与视觉任务,提供 500k 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。定价为输入 $2、缓存输入 $0.50、输出 $6 每 100 万 tokens。

  6. xAI:News(网页)43

    Grok 4.6 上线 Microsoft Foundry

    xAI 的旗舰模型 Grok 4.6 现已在 Microsoft Foundry 上线,支持 500k 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,面向长时间运行的智能体及交互与视觉任务。Foundry 提供与其他前沿模型的对比评估、工作负载测试、托管端点部署及企业级安全与治理控制,可用于构建编程智能体、工程 Copilot、研究助手和企业自动化。

  7. xAI:News(网页)44

    Grok Bot 与 X 深度集成,可搜索帖子、读取时间线

    Grok Bot 现已与 X 实现更紧密的集成,用户连接 X 账号后即可让 Bot 搜索帖子、读取时间线、查看提及或汇总 X 上的动态。付费 Grok Bot 用户可获得免费的 X API 额度,没有开发者账号的用户会被自动创建。这是该集成的首个版本,同时提供 X 插件用于搜索帖子、读取时间线、获取趋势和管理书签。

  8. Cursor Blog69

    Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务

    Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。

    推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。

  9. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  10. Tomer Tunguz 博客(VC 分析)60

    Tomasz Tunguz:AI 模型的用户留存介于社交网络与手游之间

    Tomasz Tunguz 提出 AI 如同一个漏水筛子,前沿模型平均保持领先约 41 天,用户留存率在个位数高位到约 40% 之间,介于社交网络(约 80%)与手游(百分之几)之间。同等智能水平的价格每年约下降 10 倍,如 Grok 4.5 以每任务 $0.31 达到 Intelligence Index 54 分,买家每 41 天获得更多议价筹码,创业公司可随每月赢家切换模型。

    推荐理由:作者用用户留存曲线和智能单价数据,把 AI 模型的用户流失放到软件、社交网络与手游之间定位。

  11. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  12. Tomer Tunguz 博客(VC 分析)78

    SpaceXAI 首季资本开支 183.7 亿美元追平超大规模厂商,但资金结构迥异

    Tomer Tunguz 分析 SpaceXAI 首个公开财季资本开支达 $18.37b,其中 $15.83b 投向 AI 基础设施,超出 $13.2b 的市场预期,规模接近 Microsoft 总开支的四成。

    推荐理由:原文用经营现金流对资本开支的覆盖率拆解各家AI基建投入的资金来源差异,提供了一个可比的分析框架。

  13. xAI:News(网页)56

    xAI 推出面向企业的 Grok Bot,企业客户两周内免费使用

    xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。

  14. xAI:News(网页)57

    Grok Build 推出记忆功能

    xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。

  15. xAI:News(网页)63

    xAI 发布 Team Bots:可与团队共同工作的 Grok Bots 开启公测

    xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。

    推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。

  16. Cursor Blog79

    Cursor 宣布被 SpaceX 正式收购

    Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。

    推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。

  17. Gary Marcus:The Road to AI We Can Trust(RSS)59

    Gary Marcus 批评白宫“超级智能”协议缺乏实质约束

    Gary Marcus 评析特朗普政府发布的白宫“超级智能”协议,称其承诺的四层控制与审计本质上是“不受监管、不给公众发声”的自我监管。他质疑协议中“独立”审计人的含义,并指出两周前业界谈论的 AI 放缓(Pacing)议题未体现在协议中,称 Dario、Sam 和 Elon 都退缩了。

9月29日周二
  1. AWS Machine Learning Blog62

    xAI Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。

9月18日周五
8月19日周三
5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

3月19日周四