Arvind Narayanan:AI 实验室如何通过向上游迁移逃离商品化陷阱并带来企业锁定风险
Arvind Narayanan 与 Akash Kapur 撰文提出,模型推理因产品同质化、转换成本低将走向商品化,按 5% 净利率计算需 16–32 万亿美元年收入才能收回 4–8 万亿美元基础设施投资,难以成立。
Arvind Narayanan 与 Akash Kapur 撰文提出,模型推理因产品同质化、转换成本低将走向商品化,按 5% 净利率计算需 16–32 万亿美元年收入才能收回 4–8 万亿美元基础设施投资,难以成立。
Import AI 464 期报道:Fable 在 RTX PRO 6000 Blackwell 上写出 CUDA megakernel,相比优化 PyTorch 基线取得 18.71X 加速。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
Dwarkesh Patel 公布其 AI 大问题征文比赛的三篇获奖作品,比赛共收到超 600 篇投稿。
Ethan Mollick 撰文指出 AI 能力正以超指数速度提升,Opus 4.7 独立工作 14 小时完成相当于人类工程师 2-17 周的软件包,成本 251 美元 token,他自己的实验中 Fable 自主运行 9 小时完成复杂软件项目。
Interconnects 第 22 期开放模型盘点指出,开源模型发布方正从少数(以中国为主的)玩家扩展为更多全球小众公司,并将发布者分为纯模型公司、大厂和产品公司三类。
OpenAI 在 GitHub 新建仓库 birdingpal,这是一个由 ChatGPT 驱动的鸟类识别助手。该仓库目前仅有一句说明,称 BirdingPal 是用于识别鸟类的 ChatGPT 伙伴,未披露模型版本、参数规模或可用方式等细节。
OpenAI 在 GitHub 上线官方 Terraform provider,用于通过基础设施即代码方式管理 OpenAI 资源。该仓库名为 openai/terraform-provider-openai,目前仅有一句简介说明其为 OpenAI 官方 Terraform provider,未披露具体支持的资源类型或版本号。
作者 Johann Rehberger 复现了针对 Claude Computer-Use 的 TOCTOU(time-of-check to time-of-use)竞态攻击:Agent 在推理期间屏幕内容可被更换,导致点击落到与预期不同的对象上。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。
针对华盛顿近期签署的 AI 模型审查行政令、国会立法提案以及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来政策可能误伤甚至禁止开源 AI,而这将是严重错误。
OpenAI 在 GitHub 上线新仓库 openai/planttalk,让用户借助 ChatGPT 为室内植物赋予"声音"。该仓库标题为 openai/planttalk,正文描述为"Give your houseplants a voice with ChatGPT",目前公开信息仅此一句,具体功能与用法尚未披露。
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
我很高兴分享,我将加入 OpenAI,期待与那里卓越的团队共事。 离开是一个艰难的决定。我为 Google 出色的团队以及我们共同构建的一切感到无比自豪。能与大家共事是我的荣幸,也是一段愉快的经历。
OpenAI 在 Alignment 博客发布 Deployment Simulation 验证工作:用 WildChat 对话前缀重新生成 5 个 OpenAI 模型(含 o3。
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
OpenAI 在 GitHub 新建 openai/sites 仓库,用于托管 ChatGPT Sites 的 TypeScript 包。该仓库目前仅说明这一用途,未披露具体包名、版本号或功能细节。
OpenAI 在 GitHub 上线 openai/role-specific-plugins 仓库,提供面向不同角色的 Codex 插件模板。仓库内容为角色专用的 Codex plugin templates,具体角色划分与模板数量原文未披露。
OpenAI 在 GitHub 上线新仓库 openai/fence,项目名称取自"围栏"概念——既阻挡外部事物,也将其内部事物围住。该仓库目前仍处于早期且活跃的开发阶段。
Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。
推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。
OpenAI 在 GitHub 新建 openai-developers-for-cursor 仓库,为 Cursor 提供 OpenAI Developers 插件。
OpenAI 在 GitHub 新建仓库 openai/imagegencam,定位为一台可用 Codex 自行搭建的数码相机。目前公开信息仅有仓库名与一句简介,尚未披露硬件规格、模型版本或可用性细节。
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出医疗、科研、教育和气候等领域的新项目。合作探索 AI 辅助临床的"三方照护"模式,用 AlphaFold 和 Google Earth 推进东南亚传染病研究与疫情防控,并向新加坡中小学至初级学院全体教育工作者提供 Gemini for Education。
剑桥大学 Clare Bryant 教授使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 生成并排序了一批假说,其中优先锁定了一个她此前未关注的蛋白,并逐步将假说细化到具体氨基酸。Bryant 团队正构建含氨基酸突变的细胞系验证,原本需两到三年的实验工作有望在六个月内完成。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
OpenAI 在 GitHub 新建 openai-developers-for-claude 仓库,推出面向 Claude Code 的 OpenAI Developers 插件。该仓库名为 openai/openai-developers-for-claude,正文仅说明这是 Claude Code 的 OpenAI Developers 插件,未披露具体功能、版本或可用性细节。
OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。
OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。
推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。
Jack Clark 在 Import AI 455 撰文称,他认为 2028 年底前出现无人类参与的自动化 AI 研发(AI 自主训练后继模型)的概率超过 60%,2027 年的概率约为 30%。
OpenAI 在 GitHub 新建仓库 openai/openai-cli,定位为 OpenAI API 的官方 CLI。仓库目前仅有一句说明,未披露具体命令、支持模型或发布时间。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
OpenAI 上周在 Codex 中发布 Auto-review,用单独的 Agent(GPT-5.4 Thinking low reasoning)在沙箱边界自动批准或拒绝操作,替代人工同步审批。
推荐理由:原文给出 Auto-review 的机制、内部部署数字和已知局限,读者可据此评估它在编码 Agent 工作流中的适用性。
OpenAI 推出 OpenAI Developers 插件,帮助开发者在 ChatGPT 和 Codex 中构建 AI 应用与智能体,并提供 OpenAI API 接入与配置指引。
OpenAI 在 GitHub 新建仓库 openai-realtime-meeting-assistant,演示如何把 Realtime API 用作会议助手来管理 Kanban Board。该仓库为示例项目,展示 Realtime API 在会议场景中驱动看板任务管理的用法。
OpenAI 开源了其思维链可监控性研究的部分数据集与参考代码,包括评估套件中的多数数据集、可监控性指标 g-mean 2 的计算代码,以及一种新的交叉拟合过滤策略。
Ethan Mollick 拿到 GPT-5.5 早期访问权并实测后认为它是一次明显进步。编码任务中只有 GPT-5.5 Pro 生成了真正演化的海港小镇模拟。
推荐理由:作者以一手实测展示 GPT-5.5 在编码、图像生成和完整研究流程上的进步,同时指出长篇写作等短板仍在。
OpenAI 开源了 monitorability-evals 评估套件,该套件来自 Monitoring Monitorability 论文。