跳到正文
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 3 小时前精选AI 评分64

OpenAI 发布 GPT-6 系列模型实用指南

A model guide for the GPT-6 family

AI 导读

OpenAI 发布 GPT-6 系列实用指南,讲解如何按任务选择模型、推理档位和速度模式。指南覆盖 GPT-6 Astra、GPT-6.1 Sol 和 GPT-6 Luna 的分工。

推荐理由

OpenAI 官方给出 GPT-6 各型号的选型、缓存成本和长任务管理方法,读者可按工作负载直接对照调整。

正文 · AI 翻译

GPT‑6 系列模型指南

在管理时间和成本的同时,从 GPT‑6 模型获得最佳效果的实用技巧

分享

GPT‑6 是我们迄今最先进的模型套件,为你提供适用于不同类型工作的多种模型选择。

无论你是将想法转化为可运行的原型、构建和测试某项功能,还是跨代码仓库、数据库和外部 API 编排多步骤工作流,本指南都会说明如何选择 GPT‑6 模型、给出有效指令、管理长时间运行的工作,并为生产环境做好准备。

Image 1: Three model cards: GPT-6 Astra, our most intelligent model for the best results, $10 input, $50 output, and $1 cached input; GPT-6.1 Sol, near-Astra intelligence for a fifth of the price, $2 input, $10 output, and $0.10 cached input; GPT-6 Luna, fast and efficient everyday work at scale, $0.10 input, $0.50 output, and $0.01 cached input.

TL;DR

1. 在生产环境中高效运行

为生产环境准备工作流

在部署之前,有几项检查和最佳实践需要落实到位。

让模型匹配工作负载

把模型选择和推理水平视为智能与价格之间的权衡。

在评估最适合该任务的模型时,请比较各模型的定价⁠(opens in a new window)。

  • 推理级别: 在 API 中,选择模型在该任务上投入的精力。

    • 低:常规任务,例如提取事实或进行小幅编辑。

    • 中:需要判断力的工作,例如规划功能或比较选项。

    • 高:困难的调试、更深入的分析或仔细的审查。

    • 极高 / 最高:当“高”级别不够时,在支持的情况下进行测试,并且只有在改进足以证明额外时间和成本合理时才保留。

在 API 中,你可以在对话中途更改推理投入⁠(opens in a new window),而不会破坏缓存。

在 Codex 中,先使用该模型的默认推理级别,然后对较简单的任务降低级别,或对更深入的分析提高级别。

Image 2: Paul Solt describes building apps and fixing iPad compatibility with Ultrafast and live steering.

2. 调整你的提示词和技能

给模型一个明确的任务

_“模型在理解细微差别和歧义方面已经进步了很多,因此过去有帮助的过度具体的指导现在反而可能妨碍结果。”_⁠(opens in a new window)

—Eric Provencher,OpenAI 开发者体验

从明确的任务开始:你想要的结果、面向谁、相关背景和约束条件,以及什么算作完成。然后回顾以下四个方面,这些内容总结自_重新思考 GPT‑6 Astra 的技能和提示词_⁠(opens in a new window),以深入了解如何更新你的指令:

  • 创建更好的技能: 保持描述简短,并明确说明每个技能应在何时运行,仅在需要时加载支持性细节,并用适合你团队所用模型的指导取代僵化的固定流程。

  • 更新你的 AGENTS.md: 说明特定文档和测试在何时相关,并明确授权安全的常规工作流,例如使用一次性数据运行本地测试且不访问生产环境。

  • 设定决策边界: 说明哪些操作可以独立进行,哪些需要批准,用清晰的边界取代一刀切的“始终询问”规则。

  • 对坚持性做出明确规定: 定义“完成”包括什么——实现更改、运行它、检查结果并修复失败——并指出任何需要你审查的决策。

如需更多指导,请参阅推理最佳实践⁠(opens in a new window)。

定义你需要的输出

无论你是在 Codex 中工作还是使用 API 构建,都要明确模型可以做出哪些决策、何时应请求输入,以及什么样的响应才算有用。

给模型足够的指示,让工作持续推进,同时不必对重要决策进行猜测。告诉它哪些选择可以自行决定,以及何时需要征求你的意见⁠(在新窗口中打开),例如,它可以自行决定如何组织摘要,但在更改项目范围之前应先与你确认。描述什么样的回复才算有用⁠(在新窗口中打开),例如使用通俗语言、适合你受众的技术细节,以及一份简短的交接说明,涵盖改动了什么、检查了什么,以及还有哪些需要关注。

3. 优化长时间运行的任务

让复杂工作持续推进

借助 GPT‑6 系列模型,你现在可以承担跨越数小时甚至数天的任务。使用以下功能,更好地管理长时间运行任务中的智能体。

API

在 API 中,使用引导、异步工具和并行工作来让长时间运行的任务持续推进。

Codex

长时间运行的任务可能会暴露出你在初始提示中未必预料到的决策。使用澄清和引导来让工作保持正轨。

Image 3: Peter Steinberger describes using Astra for a long-running refactor to asynchronous workers.

利用计算机使用来完成更多工作

计算机使用⁠(在新窗口中打开)让 GPT‑6 Astra、GPT‑6.1 Sol 和 GPT‑6 Luna 直接与网站和桌面应用交互,甚至是那些没有 API 的应用。例如,你可以让模型调查一个 bug、修复代码,并在浏览器中打开你的产品以检查修复是否有效。

为每个步骤选择最简单可靠的方式:

  • 当 API 或已连接的工具可以直接完成工作时,就使用它。

  • 当模型需要为你读取屏幕、点击按钮或填写表单时,使用计算机使用。

如果你要将计算机使用构建到自己的应用中,给模型一个可以运行代码来控制浏览器或桌面的工具。Playwright 适用于浏览器⁠(在新窗口中打开);PyAutoGUI 适用于桌面应用。

Image 4: Higgsfield AI demonstrates GPT-6.1 Sol multitasking and computer use in ChatGPT.

从测试到生产:团队如何基于 GPT‑6 Astra 进行构建

第 1 张,共 4 张

**Harvey:更多上下文,更有用的草稿。**⁠Harvey 结合法院信息、判例法、律所文件和律师的个人偏好来定制其草稿。“我们可以为模型提供更多上下文,并产出越来越好、结构越来越清晰的输出,”联合创始人 Gabe Pereyra 说。

**Cognition:工程师可以审查的测试结果。**⁠Cognition 在 Devin 中使用 GPT‑6 Astra 来测试软件并返回证据。在一个 iPhone 游戏示例中,Devin 生成了一段模拟器录像和一份报告,将通过的检查与未测试的区域分开,使剩余工作更易于看清。

**Hex:从业务问题到交互式仪表板。**⁠Hex 使用 GPT‑6 Astra 将关于销售渠道表现的问题转化为书面发现和交互式仪表板,包括地理细分。它还要求模型检查数字是否合理,以及分析是否回答了业务问题。

**Invideo:对最终剪辑拥有更多控制权。**⁠Invideo 使用 GPT‑6 Astra 来规划时间线剪辑并创建可供剪辑师细调的自定义效果。该公司报告称,在调色和校正任务上的成功率大约提高了两倍。几位剪辑师还在一天内创建了约 50 个效果。

作者

OpenAI

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com