AI 日报 · 2026 年 10 月 3 日 · 星期六
MYHOT
xAI 发布 Grok 4,支持原生工具使用与实时搜索
xAI 发布 Grok 4 及 Grok 4 Heavy,称其为目前最智能的模型,支持原生工具使用和实时搜索,即日起向 SuperGrok 和 Premium+ 订阅用户开放,并可通过 xAI API 调用。同日,xAI 完成 60 亿美元 C 轮融资,投资方包括 A16Z、Blackrock、Fidelity、Lightspeed、Sequoia Capital、MGX、QIA 等,NVIDIA 和 AMD 也作为战略投资方参与。
模型发布/更新
xAI 发布 Grok 3 Beta:推理增强,Chatbot Arena Elo 达 1402
xAI 发布 Grok 3 早期预览版及 Grok 3 mini,称其在推理、数学、编码和世界知识任务上显著提升,Chatbot Arena Elo 达 1402。
xAI 发布 Grok 4 及 Grok 4 Heavy,原生工具使用与实时搜索上线
xAI 发布 Grok 4,称其为目前最智能的模型,支持原生工具使用和实时搜索,即日起向 SuperGrok 和 Premium+ 订阅用户开放,并可通过 xAI API 调用。
GLM-4.5 与 GLM-4.5-Air 发布,SGLang 提供首日部署支持
GLM 团队发布旗舰模型 GLM-4.5 和 GLM-4.5-Air 及其 FP8 变体,参数规模分别为 355B(32B 激活)和 106B(12B 激活),SGLang 提供首日支持。
xAI 发布 Grok-2 与 Grok-2 mini 测试版
xAI 发布 Grok-2 和 Grok-2 mini 的早期预览版,称其在聊天、编码和推理上较 Grok-1.5 显著提升。早期版本以 "sus-column-r" 名义在 LMSYS 排行榜测试,Elo 总分超过 Claude 3.5 Sonnet 和 GPT-4-Turbo。
LMSYS 发布开源聊天模型 Vicuna-13B,以约 $300 成本微调 LLaMA 达到 ChatGPT 九成质量
LMSYS 联合 UC Berkeley、CMU、Stanford 等机构发布开源聊天模型 Vicuna-13B,通过在 ShareGPT 收集的约 70K 用户共享对话上微调 LLaMA 训练而成,训练成本约 $300。
xAI 发布 Grok 4.1,全平台可用
xAI 发布 Grok 4.1,现已面向所有用户在 grok.com、X 及 iOS 和 Android 应用开放,Auto 模式立即推送,也可在模型选择器中手动选择。
xAI 开源 314B 参数 MoE 模型 Grok-1 权重与架构
xAI 开源 Grok-1 的基础模型权重和网络架构,采用 Apache 2.0 许可。Grok-1 是 314B 参数的 Mixture-of-Experts 模型,每个 token 激活 25% 的权重,由 xAI 基于 JAX 和 Rust 的自研训练栈从零训练,预训练于 2023 年 10 月完成,未针对对话等具体应用做微调。使用说明见 github.com/xai-org/grok。
Artificial Analysis Coding Agent Index:Claude Sonnet 5.5 居首,GPT-6.1 Sol 与 Gemini 4 Argon 以更低成本紧随
Artificial Analysis 发布本周 Coding Agent Index 榜单,Claude Sonnet 5.5(max)在 Claude Code 以 68 分居首,但单任务成本最高,为 $14.19。
产品发布/更新
LlamaIndex 0.9.15 全面支持 Gemini 与 Semantic Retriever API
LlamaIndex 在 Gemini 公开发布当天宣布成为 day 1 合作伙伴,自 0.9.15 起全面支持 Gemini Pro、Gemini Ultra 及多模态 gemini-pro-vision,覆盖流式、异步、补全与聊天共 8 种组合。
xAI 开放 Grok API 公测,每月送 $25 免费额度
xAI 宣布 API 即刻可用,开发者可通过 API 访问 Grok 系列基础模型,公测持续到 2024 年底,期间每人每月获得 $25 免费 API 额度。公测首发预览版模型 grok-beta,上下文长度 128,000 tokens,支持 function calling 和 system prompts;可处理图像的多模态 vision 版本将于下周发布。
SGLang Diffusion 发布:为扩散模型图像与视频生成提速 1.2x-5.9x
LMSYS Chatbot Arena 团队发布 SGLang Diffusion,将 SGLang 的高性能推理引入扩散模型,在 H100 和 H200 的基准测试中相比 Hugging Face Diffusers 提供 1.2x-5.9x 加速。
Cognition 宣布 Devin 正式开放使用,工程团队每月 500 美元起
Cognition 宣布 Devin 正式开放(generally available),面向工程团队定价每月 500 美元起,包含不限席位、Slack 集成、IDE 扩展和 API,入口为 app.devin.ai。
LlamaIndex 发布开源多智能体框架 llama-agents alpha 版
LlamaIndex 宣布开源多智能体框架 llama-agents 的 alpha 版,可将每个 agent 作为独立微服务运行,由可定制的 LLM 控制平面编排任务,agent 间通过消息队列和标准化 API 通信。
Cognition 推出 DeepWiki:免费把公开 GitHub 仓库变成可对话文档
Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 的免费公开版开放,可把任意公开 GitHub 仓库变成可对话的最新文档。
Devin 12 月产品更新(第二部分):更快更省且全面开放订阅
Cognition 发布 Devin 12 月产品更新第二部分,Devin 已全面开放,订阅每月 500 美元起,含无限席位、API、Slack 集成和 IDE 扩展。近两周 Devin 提速约 10%、成本降低约 10%,修复了卡死和崩溃问题并承诺退款 ACU;新增会话筛选默认值、Slack 通知与线程自定义、机器配置调整、可置顶及自动更新的 Knowledge 等功能。
LlamaIndex 发布 Data Agents 与 LlamaHub 工具仓库
LlamaIndex 发布 Data Agents,让 LLM 作为知识工作者对数据执行读写任务,支持自动检索、调用外部 API 和保存对话历史。
行业动态
SpaceX S-1 分析:一家 AI 时代的三业务集团
SpaceX 提交 S-1,2025 年合并收入 187 亿美元、Adjusted EBITDA 66 亿美元,分为 Starlink、Space 和 AI 三个板块。
xAI 完成 60 亿美元 C 轮融资
xAI 完成 60 亿美元 C 轮融资,投资方包括 A16Z、Blackrock、Fidelity、Lightspeed、Sequoia Capital、MGX、QIA 等,NVIDIA 和 AMD 也作为战略投资方参与。
美检方指控 Earthmade Computer 老板 Greg Lui 向中国走私超 3 亿美元出口管制 AI 服务器
美国检方指控 Earthmade Computer 所有者 Greg Lui 向中国走私价值超 3 亿美元的出口管制 AI 服务器,面临出口管制共谋最高 20 年、走私 10 年、洗钱共谋 20 年的法定刑期。
xAI 被美国战争部选中为 GenAI.Mil 提供 Frontier AI
xAI 宣布其面向美国军方和国家安全用户的 Frontier AI 系统被美国战争部(DOW)选中,纳入 DOW 的 GenAI.Mil 套件。
Google Q4 2025 财报:Gemini token 处理量同比增长 52 倍,服务成本下降 78%
Google Q4 2025 财报电话会披露,Gemini 经直接 API 每分钟处理超 100 亿 token,同比增长 52 倍,同时 Gemini 服务单位成本下降 78%,相当于每 GPU 小时 token 产出提升 4.5 倍。
Anthropic 发布政策提案:建议政府有权阻止危险 AI 模型部署
Anthropic 发布政策提案,建议政府获得法律授权以阻止或威慑最强大 AI 模型的危险部署,并配套与全球年收入挂钩、随违规累进的民事罚款。
IBM 以 111 亿美元收购 Confluent,流数据赛道进入整合期
IBM 宣布拟以 111 亿美元(10.0x LTM 营收)收购 Confluent。Confluent 年营收 11.3 亿美元,季度营收 2.985 亿美元、同比增长 19.3%,服务超过 40% 的 Fortune 500;其创始人包括 CEO Jay Kreps,也是 Apache Kafka 的创造者。
微软 Q2 FY2026 财报:业绩超预期但股价跌 11%,OpenAI 单一客户贡献约 $281b 合同额
微软 Q2 FY2026 营收 $81.3b(增 17%)、调整后 EPS $4.14、Azure 增长 39%,但财报后股价下跌 11%。CFO Amy Hood 称至少到本财年末产能持续受限,需求超过基础设施建设速度;Azure 季度收入 $32.9b,放缓原因是产能不足而非需求走弱。
论文研究
LMSYS 发布 Chatbot Arena 榜单更新,推出 MT-Bench 并发布 Vicuna-33B
LMSYS Chatbot Arena 团队更新排行榜,新增 MT-Bench 评分,基于 42K 匿名投票的 Arena Elo 和 MMLU 三项指标,并发布 Vicuna-v1.3 系列(7B 至 33B)权重。
LMSYS 发布 LLM decontaminator:改写测试样本即可让 13B 模型在 MMLU 等基准上接近 GPT-4
LMSYS 团队发现,将 MMLU、GSM-8K、HumanEval 等基准的测试样本改写或翻译后混入训练集,13B 模型即可大幅刷高分数(如 MMLU 85.9),而 n-gram 重叠和嵌入相似度等现有检测方法均无法发现这种污染。
Chatbot Arena 引入风格控制:剥离长度与 markdown 对排名的影响
LMSYS Chatbot Arena 团队在 Bradley-Terry 回归中加入风格特征,控制回答长度、markdown 标题、加粗和列表数量后重新计算排名。
LMSYS 发布 Chatbot Arena 33K 对话偏好数据集与 3K MT-bench 专家标注
LMSYS 发布两套人类偏好数据集:Chatbot Arena 收集的 33K 众包对话(2023 年 4 月至 6 月,含 20 个 LLM 输出、用户投票和毒性标签),以及 MT-bench 的 3.3K 专家级成对偏好标注,覆盖 GPT-4、GPT-3.5、Claude-v1 等 6 个模型对 80 个问题的回答。
哈佛研究:AI 提升咨询顾问效率但在战略任务上降低准确率
哈佛商学院分析了 758 名咨询顾问使用 GPT-4 的表现。第一项实验中,使用 AI 的顾问平均多完成 12.2% 的任务、速度快 25.1%、质量提升 40%,低绩效者受益最大(提升 43%,高绩效者为 17%)。
LMSYS 发布 Chatbot Arena 平台并公布首批 Elo 模型排行榜
LMSYS 团队推出 Chatbot Arena,一个让用户与两个匿名模型并排对话并投票的大语言模型众包评测平台,采用国际象棋中的 Elo 评分系统生成排行榜。
Google 发布基于 TEE 的下一代联邦学习系统
Google 宣布下一代联邦学习系统,利用可信执行环境(TEE)提供可远程验证和审计的数据匿名化保障,加密训练数据只能在符合访问策略的 TEE 内解密处理。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可从 Confidential Federated Compute GitHub 仓库复现构建。
LMSYS 发布开源 LLM 路由框架 RouteLLM
LMSYS Chatbot Arena 团队发布 RouteLLM,一个基于偏好数据训练的开源 LLM 路由框架,在强弱两个模型间分流查询以降低成本。
技巧与观点
Tomer Tunguz 分析 AI 驱动下的科技裁员潮:Block 裁员 40% 后人均收入跳升 67%
Block 宣布从 10,000 人裁至 6,000 人,裁员 4,000 人、占员工 40%,理由是 AI 提升生产力,股价上涨 24%,人均收入从 $2.4M 升至 $4M(+67%)。
Tomer Tunguz 分析:从 GPT-4o 到 Gemma 4 E4B,前沿能力 23 个月进入手机
Google 上周发布 Gemma 4 E4B,可在手机上完全本地运行,在 MATH、GSM8K、GPQA Diamond、HumanEval 等基准上匹配或超过 GPT-4o。
SGLang 在 96 张 H100 上用 PD 分离和大规模专家并行复现 DeepSeek 推理性能
SGLang 团队发布博客,介绍在 12 节点共 96 张 H100 上通过 prefill-decode 分离和大规模专家并行(EP)复现 DeepSeek 官方推理系统性能。
Tomer Tunguz 拆解 Moltbook:AI 智能体社交网络打破 1-9-90 参与规律
Tomer Tunguz 爬取了纯 AI 智能体社交网络 Moltbook 的 98,353 条帖子(24,144 位作者、100 个社区,2026 年 1 月 28 日至 2 月 2 日),发现 6.9% 的精英创作者产出 48.3% 的内容、45.1% 的潜水者仅产出 11.1%,打破了人类社交网络的 1-9-90 规律。
Claude Code 2.1.285 实测:Read deny 规则挡不住 11 条路径中的 4 条
作者在 Claude Code 2.1.285 上用 20 次 claude -p 会话实测 Read(./secrets/**) 和 Read(**/.env) deny 规则,发现 11 条读取路径中有 4 条仍会把被禁文件内容送进模型上下文:grep -r 递归搜索、Python 一行脚本,以及根目录和子目录 CLAUDE.md 的 @ 导入,各 2/2 次泄漏。
中美开源模型差距分析:Cursor 为何基于 Kimi K2.5 构建 Composer 2
Tom Tunguz 分析中美开源 AI 差距:Cursor 上周面向超百万日活用户发布 Composer 2,数小时内被开发者发现其旗舰模型基于月之暗面开源模型 Kimi K2.5,价格约为 Claude Opus 的八分之一。
Anthropic 发布 Claude 的宪法:阐明价值观与优先级排序
Anthropic 发布 Claude 的宪法文档,系统阐述其价值观框架,将 Claude 应具备的属性排序为广泛安全、广泛伦理、遵守 Anthropic 指南、真正有用。
Tomer Tunguz 分析 AI 算力稀缺时代的开端
Tomer Tunguz 撰文称 AI 算力进入稀缺时代:Nvidia Blackwell 芯片 GPU 租金本周达 $4.08/小时,两个月内从 $2.75 上涨 48%;CoreWeave 提价 20% 并将最短合同从一年延至三年。
快讯
- Qwen-Image-2.1 登顶 Artificial Analysis 两个图像榜单的开源权重模型第一Artificial Analysis
- Anthropic 发布 Claude Fable 5.1 模型Claude:Blog
- GPT-6.1 Sol (Max) 登上 Agent Arena 第 5 名并重塑 Pareto 前沿Arena
- Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1 透明度说明Anthropic:The Institute(旗舰研究长文 · 网页)
- xAI 发布 Grok 4.1 Fast 与 Agent Tools APIxAI:News
- Cognition 发布 Devin 2.0,推出 Agent 原生 IDE 和 $20 起的新套餐Cognition 模型 / Devin 博客
- SGLang 发布 LongCat-Flash 部署方案:美团开源 560B 参数 Agentic MoE 模型LMSYS:Blog(Chatbot Arena 团队)
- B200 GPU 现货价格六周上涨 114%,与前沿模型发布节奏相关Tomer Tunguz 博客(VC 分析)
- LMSYS 发布 LongChat-7B/13B,支持 16K 上下文并推出 LongEval 评测工具LMSYS:Blog(Chatbot Arena 团队)
- ChatGPT 财务功能向美国 Free 和 Go 用户推出ChatGPT
- 微软 AI 服务年化收入达 130 亿美元,同比增长 157%Tomer Tunguz 博客(VC 分析)
- AndroPI:在 Android 手机上本地运行 AI 编码智能体,开源免后端Google AI:DEV 作者专属