OpenAI 发布 GPT-6 系列模型实用指南
A model guide for the GPT-6 family
OpenAI 发布 GPT-6 系列实用指南,讲解如何按任务选择模型、推理档位和速度模式。指南覆盖 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna 的分工。
OpenAI 官方给出 GPT-6 各型号的选型、缓存成本和长任务管理方法,读者可按工作负载直接对照调整。
GPT‑6 系列模型指南
在管理时间和成本的同时,从 GPT‑6 模型获得最佳效果的实用技巧
分享
GPT‑6 是我们迄今最先进的模型套件,为你提供适用于不同类型工作的多种模型选择。
无论你是将想法转化为可运行的原型、构建和测试某项功能,还是跨代码仓库、数据库和外部 API 编排多步骤工作流,本指南都会说明如何选择 GPT‑6 模型、给出有效指令、管理长时间运行的工作,并为生产环境做好准备。

TL;DR
在生产环境中高效运行。使用缓存(在新窗口中打开)和压缩(在新窗口中打开)来管理上下文和成本。衡量任务成功率和延迟,并规划监控和数据控制。
让模型匹配你的工作负载。通过选择适合任务的模型、推理投入(在新窗口中打开)和速度,在能力、成本和延迟之间取得平衡。
调整你的提示词和技能。让提示词、技能和仓库指令在以下方面保持一致:模型应交付什么、它可以独立完成什么,以及什么算作完成。
让长时间运行的工作保持正轨。使用引导(在新窗口中打开)、异步工具(在新窗口中打开)和委派(在新窗口中打开)来处理更新和独立工作。为模型何时应请求输入设定清晰边界。
1. 在生产环境中高效运行
为生产环境准备工作流
在部署之前,有几项检查和最佳实践需要落实到位。
注意效率。删减任务不需要的上下文(在新窗口中打开),同时保留它确实需要的证据。如果你的应用支持,将独立任务一起运行(在新窗口中打开),这样一个缓慢步骤就不会拖住无关工作。
通过提示词缓存(在新窗口中打开)为重复性工作复用共享上下文。根据模型不同,缓存输入 token 的成本比未缓存输入 token 低最多 95%(在新窗口中打开)。将稳定指令和参考资料放在变化的任务细节之前,并保持工具定义一致。缓存仪表盘(在新窗口中打开)和诊断指南(在新窗口中打开)可帮助你查看这种复用在哪里失效。在估算完整工作流的成本时,将缓存写入和任何长上下文费率计入其中。
对于较长的对话,压缩(在新窗口中打开)可在保留继续所需状态的同时减小上下文大小。
决定你将如何监控行为(在新窗口中打开),并查看适用于你的应用的数据控制(在新窗口中打开)。
部署前测试:运行代表性任务,并衡量任务成功率、延迟和每个成功任务的成本。查看我们的API 部署清单(在新窗口中打开)。
让模型匹配工作负载
把模型选择和推理水平视为智能与价格之间的权衡。
模型:
GPT‑6 Astra(在新窗口中打开)用于需要最大智能的最难推理工作。
GPT‑6.1 Sol(在新窗口中打开)用于复杂编码、研究和计算机使用。
GPT‑6 Luna(opens in a new window) 适用于大规模聚焦任务,以及目标明确的日常重复性工作,例如提取发票字段、对请求进行分类或生成结构化摘要。
在评估最适合该任务的模型时,请比较各模型的定价(opens in a new window)。
推理级别: 在 API 中,选择模型在该任务上投入的精力。
低:常规任务,例如提取事实或进行小幅编辑。
中:需要判断力的工作,例如规划功能或比较选项。
高:困难的调试、更深入的分析或仔细的审查。
极高 / 最高:当“高”级别不够时,在支持的情况下进行测试,并且只有在改进足以证明额外时间和成本合理时才保留。
在 API 中,你可以在对话中途更改推理投入(opens in a new window),而不会破坏缓存。
在 Codex 中,先使用该模型的默认推理级别,然后对较简单的任务降低级别,或对更深入的分析提高级别。
速度:
在 API 中,当响应时间很重要时(例如在聊天应用或编码工具中),请使用快速模式(opens in a new window)。与标准处理相比,它以更高的每 token 成本提供更快、更一致的响应时间。
在 Codex 和 API 中,当更快的响应值得付出额外费用时(例如快速编码迭代),请使用超快模式(opens in a new window)。它会独立于推理投入加速 token 生成。适用于 GPT‑6 Astra(opens in a new window)。

2. 调整你的提示词和技能
给模型一个明确的任务
_“模型在理解细微差别和歧义方面已经进步了很多,因此过去有帮助的过度具体的指导现在反而可能妨碍结果。”_(opens in a new window)
—Eric Provencher,OpenAI 开发者体验
从明确的任务开始:你想要的结果、面向谁、相关背景和约束条件,以及什么算作完成。然后回顾以下四个方面,这些内容总结自_重新思考 GPT‑6 Astra 的技能和提示词_(opens in a new window),以深入了解如何更新你的指令:
创建更好的技能: 保持描述简短,并明确说明每个技能应在何时运行,仅在需要时加载支持性细节,并用适合你团队所用模型的指导取代僵化的固定流程。
更新你的 AGENTS.md: 说明特定文档和测试在何时相关,并明确授权安全的常规工作流,例如使用一次性数据运行本地测试且不访问生产环境。
设定决策边界: 说明哪些操作可以独立进行,哪些需要批准,用清晰的边界取代一刀切的“始终询问”规则。
对坚持性做出明确规定: 定义“完成”包括什么——实现更改、运行它、检查结果并修复失败——并指出任何需要你审查的决策。
如需更多指导,请参阅推理最佳实践(opens in a new window)。
定义你需要的输出
无论你是在 Codex 中工作还是使用 API 构建,都要明确模型可以做出哪些决策、何时应请求输入,以及什么样的响应才算有用。
给模型足够的指示,让工作持续推进,同时不必对重要决策进行猜测。告诉它哪些选择可以自行决定,以及何时需要征求你的意见(在新窗口中打开),例如,它可以自行决定如何组织摘要,但在更改项目范围之前应先与你确认。描述什么样的回复才算有用(在新窗口中打开),例如使用通俗语言、适合你受众的技术细节,以及一份简短的交接说明,涵盖改动了什么、检查了什么,以及还有哪些需要关注。
3. 优化长时间运行的任务
让复杂工作持续推进
借助 GPT‑6 系列模型,你现在可以承担跨越数小时甚至数天的任务。使用以下功能,更好地管理长时间运行任务中的智能体。
API
在 API 中,使用引导、异步工具和并行工作来让长时间运行的任务持续推进。
在运行过程中更新指令:回合中引导(在新窗口中打开)让你可以在模型工作时通过 Responses WebSocket API(在新窗口中打开)发送更正。更新会排队;它们不会取消正在运行的工具,也不会撤销已完成的动作。
在工具运行时继续工作:异步工具调用(在新窗口中打开)让模型在你的应用运行较慢的任务(例如测试)时继续独立工作。你的应用在结果就绪时返回结果。在开始依赖该结果的工作之前,先等待该结果。
委派独立的子任务:GPT‑6.1 Sol 支持Responses API 中的多智能体工作流(在新窗口中打开)。它可以将独立工作分配给子智能体(例如调查代码库的不同部分),并将它们的发现整合为最终回复。多智能体目前处于测试阶段。
Codex
长时间运行的任务可能会暴露出你在初始提示中未必预料到的决策。使用澄清和引导来让工作保持正轨。
在工作推进过程中回答问题:借助 GPT‑6 Astra,Codex 可以在工作时请求澄清(在新窗口中打开)。解决影响下一步的问题,并说明在你做决定期间哪些独立工作可以继续。如果你将离开,告诉 Codex 哪些任务可以继续,以及它应在何时暂停以等待你的回答。
当需求变化时重新引导工作:用新信息引导当前任务(在新窗口中打开),说明应更改什么、应保持不变什么。这有助于避免在不再满足你需求的方法上花费更多时间。

利用计算机使用来完成更多工作
计算机使用(在新窗口中打开)让 GPT‑6 Astra、GPT‑6.1 Sol 和 GPT‑6 Luna 直接与网站和桌面应用交互,甚至是那些没有 API 的应用。例如,你可以让模型调查一个 bug、修复代码,并在浏览器中打开你的产品以检查修复是否有效。
为每个步骤选择最简单可靠的方式:
当 API 或已连接的工具可以直接完成工作时,就使用它。
当模型需要为你读取屏幕、点击按钮或填写表单时,使用计算机使用。
如果你要将计算机使用构建到自己的应用中,给模型一个可以运行代码来控制浏览器或桌面的工具。Playwright 适用于浏览器(在新窗口中打开);PyAutoGUI 适用于桌面应用。

从测试到生产:团队如何基于 GPT‑6 Astra 进行构建
第 1 张,共 4 张
**Harvey:更多上下文,更有用的草稿。**Harvey 结合法院信息、判例法、律所文件和律师的个人偏好来定制其草稿。“我们可以为模型提供更多上下文,并产出越来越好、结构越来越清晰的输出,”联合创始人 Gabe Pereyra 说。
**Cognition:工程师可以审查的测试结果。**Cognition 在 Devin 中使用 GPT‑6 Astra 来测试软件并返回证据。在一个 iPhone 游戏示例中,Devin 生成了一段模拟器录像和一份报告,将通过的检查与未测试的区域分开,使剩余工作更易于看清。
**Hex:从业务问题到交互式仪表板。**Hex 使用 GPT‑6 Astra 将关于销售渠道表现的问题转化为书面发现和交互式仪表板,包括地理细分。它还要求模型检查数字是否合理,以及分析是否回答了业务问题。
**Invideo:对最终剪辑拥有更多控制权。**Invideo 使用 GPT‑6 Astra 来规划时间线剪辑并创建可供剪辑师细调的自定义效果。该公司报告称,在调色和校正任务上的成功率大约提高了两倍。几位剪辑师还在一天内创建了约 50 个效果。
作者
OpenAI
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com