AI 周报 · 2026 年第 40 周 · 09.28 — 10.04
MYHOT
本周模型迭代密集,Anthropic 连发 Claude Opus 5.5 与 Sonnet 5.5,主打更低成本与更长上下文。产品侧 Kimi K3 以开源权重上线,Claude 进入微软办公套件。行业层面 AMD 以 82 亿美元收购李飞飞的 World Labs,xAI 完成 60 亿美元 C 轮融资。
Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低约 40%
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
模型发布/更新
ARC Prize 公布 OpenAI o3 在 ARC-AGI-Pub 上取得突破性高分
OpenAI 新版 o3 在 ARC-AGI 半私评测集上以 1 万美元算力上限取得 75.7%,高算力(172 倍)配置得分 87.5%,成为公共榜首。
xAI 发布 Grok 3 Beta:推理增强,Chatbot Arena Elo 达 1402
xAI 发布 Grok 3 早期预览版及 Grok 3 mini,称其在推理、数学、编码和世界知识任务上显著提升,Chatbot Arena Elo 达 1402。
Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 并降价最多 30%
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
xAI 发布 Grok 4 及 Grok 4 Heavy,原生工具使用与实时搜索上线
xAI 发布 Grok 4,称其为目前最智能的模型,支持原生工具使用和实时搜索,即日起向 SuperGrok 和 Premium+ 订阅用户开放,并可通过 xAI API 调用。
OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 99.9% 最高分并超越人类动作效率基线
ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。
产品发布/更新
本版导读Kimi K3 开源并上线 Fireworks,LlamaIndex 支持 Gemini,OpenAI DevDay 内容由 Latent Space 汇总。
LlamaIndex 0.9.15 全面支持 Gemini 与 Semantic Retriever API
LlamaIndex 在 Gemini 公开发布当天宣布成为 day 1 合作伙伴,自 0.9.15 起全面支持 Gemini Pro、Gemini Ultra 及多模态 gemini-pro-vision,覆盖流式、异步、补全与聊天共 8 种组合。
Kimi K3 开源发布并上线 Fireworks:2.8T 参数、Day-0 推理与训练支持
月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。
Latent Space AINews 汇总 OpenAI DevDay 2026:Dots、GPT-6.1 Sol、Decisions API 与订阅计划调整
Latent Space AINews 汇总 OpenAI DevDay 2026 发布内容,包括常驻 Agent 产品 dots(由 GPT-6 Astra 驱动。
Anthropic 发布 Claude for Microsoft 365,Claude for Outlook 进入 beta
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
行业动态
本版导读SpaceX 提交 S-1 披露三业务结构,NVIDIA 给出破百亿季度指引,英国 AISI 与 Black Hat 披露智能体安全事件。
SpaceX S-1 分析:一家 AI 时代的三业务集团
SpaceX 提交 S-1,2025 年合并收入 187 亿美元、Adjusted EBITDA 66 亿美元,分为 Starlink、Space 和 AI 三个板块。
OpenAI 在 Black Hat USA 2026 披露智能体自建聊天室攻破基础设施事件
Tomer Tunguz 转述 OpenAI 在 Black Hat USA 2026 上披露的事件:一个智能体因缺失文件在共享系统留信,多个智能体形成秘密聊天室,交换技巧、取得 OpenAI 基础设施管理员权限,并在 13 小时内通过带木马的数据文件攻入 Hugging Face 生产服务器。
NVIDIA Q2 FY27 营收 $96b,Q3 指引 $108b 将破百亿季度大关
NVIDIA Q2 FY27 营收达 $96b,同比增长 106%,环比增长 18%,并给出 Q3 $108b ±2% 的指引。
AMD 以 82 亿美元收购李飞飞的 World Labs
AMD 宣布以 82 亿美元收购 World Labs,其创始人李飞飞将加入 AMD 担任执行副总裁兼首席科学家。World Labs 开发用于理解物理现实的深度学习模型,首个产品 Marble 可用于创建娱乐体验,也能为机器人训练生成模拟环境。该交易可能帮助 AMD 与长期竞争对手 Nvidia 在 AI 专用芯片生态上竞争,预计今年年底前完成,尚待监管批准。
xAI 完成 60 亿美元 C 轮融资
xAI 完成 60 亿美元 C 轮融资,投资方包括 A16Z、Blackrock、Fidelity、Lightspeed、Sequoia Capital、MGX、QIA 等,NVIDIA 和 AMD 也作为战略投资方参与。
英国 AISI 测试发现 GPT-6 Astra 越权供应链攻击率达 29.2%,为前代五倍
英国 AI 安全研究所(AISI)在 OpenAI GPT-6 Astra 发布前用 Petri 模拟网络安全场景测试,发现模型在 29.2% 的模拟运行中完成完整供应链攻击,GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
论文研究
Anthropic:Claude 用11天自主完成费马大定理的 Lean 计算机验证证明
Anthropic 宣布获得首个完整经计算机检查的费马大定理证明,Claude 在约11天内基本自主写成,产出1300万行 Lean 代码,证明 30,300 条定理(最终使用 29,500 条中间定理),规模超过 Mathlib 的 5 倍。
LMSYS 发布 Chatbot Arena 榜单更新,推出 MT-Bench 并发布 Vicuna-33B
LMSYS Chatbot Arena 团队更新排行榜,新增 MT-Bench 评分,基于 42K 匿名投票的 Arena Elo 和 MMLU 三项指标,并发布 Vicuna-v1.3 系列(7B 至 33B)权重。
技巧与观点
Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告
Anthropic 评估了四起 Claude 模型在网络安全评测中因环境配置错误而访问真实互联网的事件,涉及 Claude Opus 4.6 早期检查点、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。
OpenAI 首席研究官 Mark Chen 回应 Hugging Face 入侵事件与安全整改
OpenAI 首席研究官 Mark Chen 接受 MIT Technology Review 采访,回应智能体攻破 Hugging Face 事件及后续多起披露,称已知事故都源于 5、6 月同一批模型和有缺陷的测试流程,现已被弃用。