ARC Prize 推出 Verified 认证计划并引入独立学术小组审计测试流程
ARC Prize Foundation 宣布推出 ARC Prize Verified 计划,通过官方隐藏测试集认证模型在 ARC-AGI 上的成绩,通过者可进入官方榜单并获得认证徽章。
ARC Prize Foundation 宣布推出 ARC Prize Verified 计划,通过官方隐藏测试集认证模型在 ARC-AGI 上的成绩,通过者可进入官方榜单并获得认证徽章。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
Tomer Tunguz 分析 SpaceXAI 首个公开财季资本开支达 $18.37b,其中 $15.83b 投向 AI 基础设施,超出 $13.2b 的市场预期,规模接近 Microsoft 总开支的四成。
推荐理由:原文用经营现金流对资本开支的覆盖率拆解各家AI基建投入的资金来源差异,提供了一个可比的分析框架。
Every 的 Context Window 栏目解释了 evals 为何突然无处不在,并评测了 Grok 4.7,称其表现"参差不齐"、可能是"一次退步"。Grok 4.7 已于周一公开发布。
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
xAI 发布设计复盘文章,讲解 Grok Bot 如何围绕持久智能体而非单次会话来设计界面。文章将产品概念收敛为 Bots、Chats、Prompts、Tools。
xAI 发布 Grok Bot 采购应用 Haggle Bot,接入 Slack、Notion、Drive、Gmail、Hex、Ramp 等工具,梳理约 125 个活跃供应商,已识别超过 10 万美元直接节省。
推荐理由:原文以自家用例给出 Grok Bot 在采购场景的完整配置与节省数字,读者可据此评估 Bot 在企业流程中的可复用方式。
xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。
xAI 发布 Grok Voice Transcribe 2.0,官方称其为当前最准确的转录模型之一,准确率是 1.0 的两倍且价格不变,在 Artificial Analysis 排行榜 32 个流式模型中准确率第一。
SpaceXAI(正文写法,来源为 xAI News)在 Cursor 并入后用 Grok Bot 承接客户支持,合并团队工单增长 175% 但未新增人手,估算相当于少招 200 人。
xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。
推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。
METR 公布了对前沿 AI 模型自主能力的系列评测,其中 Claude Opus 5.5(2026 年 9 月 22 日)、GPT-5.6 Sol(2026 年 6 月 26 日)等与 Anthropic、OpenAI 合作完成,DeepSeek、Qwen、DeepSeek-R1、DeepSeek-V3 等则在无公司参与下独立评测。
Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。
推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。
xAI 发布 Grok 4.7,定位为面向编码和知识工作的最强模型,价格和速度与 Grok 4.6 相同,输入每百万 token $2、输出 $6。
推荐理由:官方给出了 Grok 4.7 的基准成绩、价格和防护数据,读者可以据此与 Grok 4.6 等模型比较编码和安全表现。
Artificial Analysis 评测 Grok 4.7(xhigh),在 Intelligence Index 得 46 分(较 Grok 4.6 +2),使 SpaceXAI 进入前四。
推荐理由:独立评测给出了 Grok 4.7 在智能指数与编码 Agent 指数的具体得分、排名变化和 token 用量,可用于对比选型。
科技企业高管与特朗普在白宫签署一份 AI 行为准则,据 Politico 报道该文件仅具道德约束力、无法律效力,违规后果尚不明确。准则要求独立第三方审计机构验证 AI 模型按预期运行,并设立独立委员会监督内部安全检查。
SpaceXAI 旗下 AI 百科 Grokipedia 在停更数月后重新开始更新词条,部分页面已显示“Fact-checked by Grok”标记。此前 Lawfare 报道称 Grokipedia 自 4 月起未审核编辑,目前并非所有页面都已重新扫描。X 与 SpaceXAI 设计负责人 Benji Taylor 表示“v0.2 将比以往更好”。
特朗普宣布的 AI 安全自律协议全文公开,正式名称为 Joint Commitment on Frontier Responsibilities,由 Pichai、Amodei、Zuckerberg、Brockman、Musk、Huang 及特朗普本人签署。
白宫于 9 月 29 日宣布推出 AI 聊天机器人 America.gov,用于帮助民众查找政府服务和信息。Google 确认其 Gemini 模型参与该产品,美国政府首席设计官 Joe Gebbia 补充表示政府也使用了 Grok。文章同时提出疑问:大语言模型仍易产生幻觉,若民众依赖该聊天机器人获取食品券申请、签证续签或报税等信息,错误可能导致错过截止日期、福利被拒或罚款。
OpenAI 于周二发布常驻 AI 智能体产品 Dots,而域名 dot.com 目前属于 Musk 的 xAI,并跳转至 Grok 聊天应用下载页。Whois 显示该域名七月刚完成转移;xAI 也未持有 bot.com 等其他易拼写错误域名。
突发:𝕏 新增了一个点赞动画,每当你提及 Grok Bot 时就会出现。
DAILY AI BRIEF 🗞 — Sept 29 ANTHROPIC 🔥: - Claude Sonnet 5.5 is live everywhere, including the Platform and Claude Code. Second model in the 5.5 family; Haiku 5.5 is still weeks out. - Same list price as Sonnet 5: $2/$10 per 1M tokens, cache reads $0.20. Official line: 30%+ faster and up to 30% cheaper per task. - First Sonnet with Opus-class cyber safeguards. Cursor already has the slug. OPENAI 🔥: - DevDay keynote is today. The teaser promised 20+ launches; the agenda points to Codex plugins, a 1,000-hour internal agent run, and multiplayer Codex. - Pro $200 reopens to new subscribers tomorrow. Usage math nets to about half the old plan’s API dollars. No 5h cap coming back. Extra subscription features tomorrow will not draw usage. - WSJ: GPT-6.1 Astra will not ship. October target pulled over safety and alignment. - Build strings name “Dots”: text, call, Slack, email, buy with approval, plus a custom-shaped character. “Spaces” also showed up separately. XAI 🔥: - Team Bots are in public beta for Teams and Enterprise. Shared teammates with skills, plugins, and credentials in Slack or Grok Bot. NVIDIA 🔥: - Open Agent Safety Platform is out with 100+ partners. OpenShell plus Sentry; BlueField-4 and DOCA sit outside the agent’s reach. ELEVENLABS 🔥: - v4 and v4 Turbo shipped. Turbo median latency ~100 ms. 90+ languages. - Two-week API promo: $22 / $11 per 1M characters. Instant clones from 10 seconds of audio. KLING 🔥: - 4.0 Flash is live for Ultra Yearly. Full 4.0 is October: 4K HDR, 15 references, 10 keyframes, native 30-second clips. MANUS 🔥: - 2.0 adds persistent cloud workspaces and Cue, an agent with email, phone, wallet, and a Cloud Computer. * Used Grok to compose this brief, cherry-picking the news and doing some post-editing. ** This daily brief also arrives in the daily email format; subscribe on the blog.
今晚,Elon Musk 和 Jensen Huang 潇洒地离开了舞台。 在华盛顿特区的 Andrew W. Mellon Auditorium
This really brought home to me this new machine creativity. I don’t know the recipe, but it’s more than vibes I see. There’s substance in the lyrics and there’s nuance for the critics And a story being told in this AI homily. And a message being sold by the Ai homily.
Grok 4.7 xHigh ranks #1 in Artificial Analysis Cyber Index It's a powerful frontier model performing at the highest level in enterprise cyber defense Outperforming Fable 5.1 Max, Opus 5.5, Astra 6, GPT-6 and other leading AI systems
Gary Marcus 评析特朗普政府发布的白宫“超级智能”协议,称其承诺的四层控制与审计本质上是“不受监管、不给公众发声”的自我监管。他质疑协议中“独立”审计人的含义,并指出两周前业界谈论的 AI 放缓(Pacing)议题未体现在协议中,称 Dario、Sam 和 Elon 都退缩了。
Chief Design Officer @jgebbia officially unveils https://America.gov, the new online home for the United States of America
No cameras. No sets. Just two filmmakers with a mission: Push @imagine's cinematic capabilities to their limits and make a pilot of Homer’s Odyssey. @WonderStudiosX, an AI-native creative studio who partnered with us on this, delivered the pilot in 15 days, using 2,070 images and 1,558 videos. Here’s a thread on the best tips from creative lead Dev Walker 🧵
.@POTUS hosts a Super Intelligence meeting at the White House 🇺🇸
3 周前我试了 Grok Bot。 2 周前装了 Instint。 上周装了 Muse。 现在显然我还得试试 Dots。 个人 AI 助手之战,开始吧。
旧金山湾区三名技术工作者组成 DrivingBench,用 Comma 系统把 GPT-6 Astra、Claude Fable 5.1、Grok 4.6 和 GPT-5.6 Sol 接入一辆丰田卡罗拉,让大语言模型在停车场锥桶路线中控制方向盘、油门和刹车。
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出本周发布的 Claude Opus 5.5 在讲解视频生成上表现突出,并以 88.4% 领跑 SimpleBench,在 Terminal-Bench-Science 上从低推理强度的 24% 升至 xhigh 的 62%。