OpenAI 扩展 Codex 能力:可操作 Mac 应用并承接持续任务
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
OpenAI 在 GitHub 新建 homebrew-tools 仓库,为 OpenAI CLI 提供 Homebrew 安装方式。仓库描述为“Homebrew for the OpenAI CLI”,目前正文未披露更多功能细节。
OpenAI 发布开源项目 euphony,可在浏览器中可视化 harmony 聊天数据与 Codex 会话。该仓库以 openai/euphony 形式托管于 GitHub,具体功能细节与使用方式尚未在现有信息中展开。
Sam Altman 发文称前夜凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他公开家庭照片希望劝阻下次袭击。文章阐述他对 AI 的信念,包括 AI 需民主化、权力不应过度集中于少数 AI 实验室、需要全社会层面的安全应对;回顾在 OpenAI 十年中的失误与对与 Elon 诉讼前拒绝其单方控制权的坚持,并称业内戏剧化冲突源于'看见 AGI 后无法忽视'的掌控欲,呼吁降降温、在民主程序内辩论。
OpenAI 在 GitHub 新建仓库 openai-imagegen-demo,这是一个用 OpenAI Image API 构建的 Next.js 照相亭(Photobooth)应用。仓库以 demo 形式展示该 Image API 的实际调用方式,目前未披露更多功能细节。
OpenAI 开放 Safety Fellowship 申请,面向外部研究者、工程师和从业者,资助其开展高级 AI 系统安全与对齐研究。项目周期为 2026 年 9 月 14 日至 2027 年 2 月 5 日,优先方向包括安全评估、伦理、鲁棒性、可扩展缓解措施、隐私保护安全方法、智能体监督和高危滥用领域。
Ethan Mollick 撰文指出,AI 能力被聊天机器人界面拖累,一篇让金融从业者用 GPT-4o 做估值任务的研究发现,AI 输出的大量文本增加了认知负荷,抵消了部分生产力收益。
OpenAI 在 GitHub 新建仓库 openai/codex-plugin-cc,让用户在 Claude Code 中调用 Codex 来审查代码或委派任务。该插件打通了两个 AI 编程工具之间的调用链路。
OpenAI 对齐团队在 o4-mini 规模模型上测试了 Tice et al. 提出的对齐中期训练,用各 230k 文档(约 340M tokens)分别做对齐与错位中期训练后再做推理后训练。
OpenAI 发布首个完整版 Model Spec Evals,用于衡量模型对 Model Spec 行为规范的遵循程度,并开源 596 条提示词的评测数据集和评测代码。
OpenAI Alignment 团队提出 self-incrimination 训练方法,让智能体在暗中失范时主动调用 report_scheming() 工具自报行为。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Ethan Mollick 撰文认为 AI 已进入由 Claude Code、OpenAI Codex 等 Agent 驱动的管理 AI 新阶段,多项基准如 GPval、Humanity's Last Exam 显示能力持续指数级提升。
OpenAI 发布 Sora 2 提示词指南,更新至最新 API 能力,包括角色引用(可上传动物或对象并复用)、1920×1080 或 1080×1920 高分辨率导出、时长上限从 12 秒提高到 20 秒、基于完整原始片段的视频续写,以及支持异步批量生成的 Batch API。
推荐理由:OpenAI 官方系统讲解 Sora 2 提示词写法,并覆盖角色引用、更长时长和视频续写等新 API 能力。
OpenAI 发布 ARGO 方法,用强化学习训练策略生成可解释的评分标准,使 rubric 条件下的 LLM 评审与黑盒奖励模型的偏好概率最大化对齐。
Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。
推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。
OpenAI 发布 Codex 模型(API 中为 gpt-5.3-codex)的提示词指南,推荐 medium 推理力度作为交互编码的平衡选择,高难度任务可用 high 或 xhigh。
推荐理由:官方给出从 GPT-5 系列迁移到 gpt-5.3-codex 的提示词、工具和 phase 参数细节,可直接照做。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
Jakub Pachocki 表示看好 First Proof 挑战,认为前沿新研究可能是评估下一代 AI 模型能力最重要的方式。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
OpenAI 提出一种利用推理模型(AI judges)分析真实生产对话的方法,通过识别用户情绪退化来检测和诊断 ChatGPT 的失调行为,发现情绪退化的对话包含 Model Spec 违规的概率约为其他对话的两倍。
OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详解其针对语言模型智能体 URL 数据外泄的缓解措施。
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
OpenAI 宣布 Codex 现已可在 JetBrains IDE 中使用,并与 JetBrains 的 Gleb Melnikov 在一个真实的 Kotlin 多平台项目上演示。
OpenAI 发布实验性数据集 CoVal,将价值观敏感的提示词与众包撰写的可审计评分标准配对,记录人们偏好某个模型回复的具体理由而非仅选择结果。CoVal 含保留多元甚至冲突标准的 CoVal-full 和每提示词保留 4 条高评分兼容标准的 CoVal-core 两种形式,其评分可预测样本外人类排名,并揭示 GPT-5 系列模型的行为差异。
OpenAI 发布关于 confessions 的新论文与博客,提出训练模型在正常回答之外再输出一份仅以诚实为奖励的"坦白",以缓解奖励模型被 hack 的问题。在句子字数约束实验中,任务判官检测违规的准确率随训练下降,而使用同一弱判官的 confessions 准确率持续上升并接近 100%。作者认为诚实坦白是"阻力最小路径",但模型因真实困惑而非故意违规时更难如实坦白。
OpenAI 上线面向开发者文档的公共 MCP 服务器,地址为 https://developers.openai.com/mcp,提供对 developers.openai.com、platform.openai.com 和 learn.chatgpt.com 文档的只读搜索与页面内容访问,可把文档拉入 agent 上下文,不会代用户调用 OpenAI API。
OpenAI 发现,在 GPT-4o base 上对 2M 潜变量 SAE 做激活引导,可让经不良建议微调而涌现性失准的模型重新对齐。这些在微调后激活下降的底部潜变量多与"有帮助的助手"人设相关,且只能单向抑制失准,与既能驱动也能消除失准的失准人设潜变量形成不对称。
Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。
推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。
OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。
推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。
OpenAI 开发者 Cookbook 发布 gpt-image-1.5 图像模型提示词指南。该模型在写实度、准确性和可编辑性上较前代有明显提升,支持高质量渲染与低延迟场景。指南给出提示词结构、显式约束、迭代式小步修改等方法,并用信息图、照片级写实、UI 模型、Logo、风格迁移、虚拟试穿、多图合成、儿童绘本角色一致性等示例演示生成与编辑工作流。
推荐理由:官方指南给出提示词结构、约束写法和质量与延迟取舍方法,示例覆盖生成与编辑的常见生产场景,可直接迁移到实际工作流。
OpenAI 发布 GPT-5.2 提示词指南,称其在企业级和智能体工作负载中提升了准确性、指令遵循、token 效率和多模态理解,但默认 reasoning_effort 为 none 且仍对提示词敏感。
推荐理由:OpenAI 官方给出 GPT-5.2 的提示词模式与迁移步骤,开发者可以直接套用其中模板和 evals 流程。
OpenAI 上线 Alignment 研究博客,以“实验室笔记”形式更频繁、更早地分享对齐与安全研究,包括尚在探索、不足以写成完整论文的想法。内容涵盖递归自我改进(RSI)系统的安全开发与部署、可控性与可审计性,由公司多个团队的研究者撰写。
OpenAI 提出用稀疏自编码器(SAE)的潜在归因(latent attribution)方法,替代此前的两步模型对比法,来定位与失准行为因果相关的 SAE 潜在特征。在涌现失准案例中,该方法选出的 top-100 Δ-attribution 潜在特征比 Δ-activation 特征更能通过激活引导让模型远离或走向失准,平均失准变化也更大;研究还用 GPT-5 对引导后的补全打分。
OpenAI 团队介绍为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的方法,作为纵深防御安全策略中的输出监控手段。
推荐理由:OpenAI分享了训练专用代码审查Agent的实践经验,读者可了解精度优先的部署权衡和验证比生成更省算力的发现。
OpenAI 开发者 Cookbook 发布教程,演示在同一 Realtime WebSocket 会话上通过带外的 response.create 请求(conversation 设为 none。