OpenAI 发布 ChatGPT agent,用自有虚拟电脑端到端完成复杂任务
Introducing ChatGPT agent
OpenAI 发布 ChatGPT agent,将 Operator 的网页操作、deep research 的信息综合与 ChatGPT 的对话能力整合为统一智能体系统,可在自有虚拟电脑上导航网站、运行代码、分析并输出可编辑的幻灯片和表格。
官方发布说明整合了 Operator 与 deep research 的能力,并给出多项基准成绩、可用范围和安全措施,便于读者评估其实际用途。
推出 ChatGPT agent:连接研究与行动
ChatGPT 现在能够思考和行动,主动从一系列智能体技能工具箱中进行选择,使用自己的计算机为你完成任务。
此发布文章已过时。
如需了解当前的智能体工作和团队工作流,请探索:
加载中…
分享
ChatGPT 现在可以使用自己的计算机为你工作,从头到尾处理复杂任务。
你现在可以让 ChatGPT 处理诸如“查看我的日历,并根据近期新闻向我简要介绍即将到来的客户会议”、“计划并购买食材,为四人制作日式早餐”以及“分析三家竞争对手并制作幻灯片”之类的请求。ChatGPT 将智能地浏览网站、筛选结果、在需要时提示你安全登录、运行代码、进行分析,甚至提供可编辑的幻灯片和电子表格来总结其发现。
这一新能力的核心是一个统一的智能体系统。它汇集了此前几项突破的三大优势:Operator 的网站交互能力、深度研究的信息综合能力,以及 ChatGPT 的智能和对话流畅性。
ChatGPT 使用自己的虚拟计算机执行这些任务,在推理和行动之间流畅切换,根据你的指令从头到尾处理复杂工作流。
最重要的是,你始终掌控一切。ChatGPT 在采取重要行动前会请求许可,你可以随时轻松打断、接管浏览器或停止任务。
从今天起,Pro、Plus 和 Team 用户可以在任何对话中,通过编辑器中的工具下拉菜单选择“agent mode”,直接激活 ChatGPT 的新智能体能力。
虽然 ChatGPT agent 已经是处理复杂任务的强大工具,但今天的发布只是一个开始。我们将继续定期迭代添加重大改进,使其随着时间推移对更多人来说更强大、更有用。
Operator 和深度研究的自然演进
此前,Operator 和深度研究各自带来了独特优势:Operator 可以在网页上滚动、点击和输入,而深度研究擅长分析和总结信息。但它们在各自不同的场景中表现最佳:Operator 无法深入分析或撰写详细报告,而深度研究无法与网站交互以优化结果或访问需要用户身份验证的内容。事实上,我们看到用户尝试用 Operator 处理的许多查询实际上更适合深度研究,因此我们将两者的优势结合在一起。
通过在 ChatGPT 中整合这些互补优势并引入额外工具,我们在一个模型中解锁了全新的能力。它现在可以主动与网站交互——点击、筛选并收集更精确、更高效的结果。你还可以自然地从一个简单对话过渡到在同一聊天中直接请求行动。
一个为你工作、与你协作的智能体
我们为 ChatGPT agent 配备了一套工具:一个通过图形用户界面与网络交互的可视化浏览器、一个用于更简单的基于推理的网络查询的文本浏览器、一个终端,以及直接的 API 访问。该 agent 还可以利用 ChatGPT 连接器(在新窗口中打开),这让你能够连接 Gmail 和 Github 等应用,使 ChatGPT 能够找到与你的提示相关的信息,并在其回复中使用这些信息。你还可以通过接管浏览器登录任何网站,使其在研究和任务执行方面都能更深入、更广泛。为 ChatGPT 提供这些访问和交互网络信息的不同途径,意味着它可以选择最优路径来最高效地执行任务。例如,它可以通过 API 收集你的日历信息,使用文本浏览器高效地对大量文本进行推理,同时还能够与主要为人类设计的网站进行可视化交互。
所有这些都通过它自己的虚拟计算机完成,即使在使用了多个工具的情况下,也能保留任务所需的上下文——模型可以选择使用文本浏览器或可视化浏览器打开页面、从网络下载文件、通过在终端中运行命令来操作它,然后在可视化浏览器中查看输出结果。模型会调整其方法,以速度、准确性和效率来执行任务。
ChatGPT agent 专为迭代式、协作式工作流程而设计,比之前的模型更具交互性和灵活性。在 ChatGPT 工作时,你可以随时打断它以澄清你的指令、引导它走向期望的结果,或完全改变任务。它会从上次中断的地方继续,此时带着新信息,但不会丢失之前的进度。同样,ChatGPT 本身也可能在需要时主动向你寻求更多细节,以确保任务始终与你的目标保持一致。如果任务耗时超出预期或感觉卡住了,你可以暂停它、要求它提供进度摘要,或完全停止它并接收部分结果。如果你的手机上有 ChatGPT 应用,它会在完成任务时向你发送通知。
拓宽现实世界的实用性
这些统一的 agent 能力显著增强了 ChatGPT 在日常生活和专业场景中的实用性。在工作中,你可以自动化重复性任务,例如将截图或仪表盘转换为由可编辑矢量元素组成的演示文稿、重新安排会议、规划和预订团建活动,以及在保留相同格式的同时用新的财务数据更新电子表格。在个人生活中,你可以用它轻松规划和预订旅行行程、设计和预订整个晚宴,或寻找专家并预约。
该模型能力的提升体现在其在衡量网页浏览和现实世界任务完成能力的评估中所取得的最先进(SOTA)表现上。
在 Humanity’s Last Exam(在新窗口中打开)* 上,这是一项通过专家级问题衡量 AI 在广泛学科领域表现的评估,驱动 ChatGPT agent 的模型取得了新的 pass@1 SOTA,得分为 41.6。由于该 agent 动态规划并自行选择工具,它可以在多次运行中以不同方式处理同一任务。当我们用简单的并行 rollout 策略进行扩展——同时运行最多八次尝试,并选择自报置信度最高的一次——该 agent 的 HLE 得分提升至 44.4。
FrontierMath** 是已知最难的数学基准,包含新颖、未发表的问题,专家数学家往往需要数小时甚至数天才能解决。借助工具使用,例如访问终端以执行代码,ChatGPT agent 达到 27.4% 的准确率,大幅超越此前两个模型。
我们还使用模拟复杂现实世界任务的基准评估了该模型。在一个旨在评估模型在复杂、具有经济价值的知识工作任务上表现的内部基准中,在一系列任务完成时间上,ChatGPT agent 的输出在大约一半的情况下与人类相当或更好,同时显著优于 o3 和 o4-mini。模型输出由专家根据各领域顶尖表现者创建的高质量人类基线进行评判。这些任务来自不同职业和行业的专家,反映现实世界的专业工作——例如准备按需紧急护理提供商的竞争分析、构建详细的摊销计划表,以及为新的绿色氢能设施识别可行的水井。
在DSBench(在新窗口中打开)**上,**该基准旨在评估 agent 在涵盖数据分析和建模的真实数据科学任务上的表现,ChatGPT agent 显著超越人类表现,且优势明显。
在 SpreadsheetBench 上,该基准评估模型编辑源自真实场景的电子表格的能力,ChatGPT agent 大幅优于现有模型。当被赋予直接编辑电子表格的能力时,ChatGPT agent 得分更高,达到 45.5%,而 Excel 中的 Copilot 为 20.0%。
方法:SpreadsheetBench 作者使用 Microsoft Excel 的 Windows 环境来评估电子表格。我们使用 OSX 环境和 LibreOffice,这可能导致评分存在细微差异。例如,作者发现 GPT‑4o 的 Overall Hard 限制为 15.02%,而我们得到 13.38%。我们使用了完整的 912 题基准。
在一个衡量模型承担第一至第三年投资银行分析师建模任务能力的内部基准上——例如为一家 Fortune 500 公司整合一份格式正确并带引用的三表财务模型,或为私有化交易构建杠杆收购模型——驱动 ChatGPT agent 的模型显著优于 deep research 和 o3。每项任务都根据与正确性和公式使用相关的数百条标准进行评分。
我们还在 BrowseComp 上评估了 ChatGPT agent,这是我们今年早些时候发布的一项基准,用于衡量浏览 agent 在网上定位难以找到的信息的能力。该模型以 68.9% 创下新的 SOTA,比 deep research 高出 17.4 个百分点。
最后,在 WebArena(在新窗口中打开) 上——这是一个旨在评估网页浏览智能体在完成真实世界网页任务时表现的基准——该模型相比由 o3 驱动的 CUA(即驱动 Operator 的模型)有所提升。
如何使用
你可以在任何对话中的任意时刻,通过编辑器中的工具下拉菜单选择“agent mode”,直接激活 ChatGPT 全新的智能体能力。只需描述你想要的任务——无论是进行深度研究、制作幻灯片,还是提交报销。在它执行你的任务时,屏幕上的旁白会清晰展示 ChatGPT 正在做什么。你可以在需要时随时打断并接管浏览器,确保任务始终符合你的目标。
ChatGPT agent 可以访问你的连接器,使其能够与你的工作流集成,并访问相关的、可操作的信息。一旦通过身份验证,这些连接器便允许 ChatGPT 查看信息并执行诸如为你总结当天收件箱、或查找你可用于开会的空闲时间段等操作——不过,要在这些网站上采取行动,你仍会被提示通过接管浏览器来登录。
此外,你还可以将已完成的任务设置为自动重复执行,例如每周一早上生成一份每周指标报告。
财务分析 使用预测、公式和假设摘要更新财务模型。查看完整任务
策划一场晚宴 基于《三国演义》策划、采购并组织一场六道菜的晚宴。查看完整任务
公共交通基准测试 将七个全球交通系统与芝加哥进行基准对比,汇编数据和一份总结报告。查看完整任务
客户会议准备 利用日历数据,准备一份关于客户通话和战略变化的报告与幻灯片。查看完整任务
新能力,新风险
此次发布标志着用户首次可以要求 ChatGPT 在网页上采取行动。这带来了新的风险,尤其是因为 ChatGPT agent 可以直接处理你的数据,无论是通过连接器访问的信息,还是你通过接管模式让它登录的网站。我们强化了 Operator 研究预览版中的稳健控制措施,并针对诸如在实时网络上处理敏感信息、更广泛的用户覆盖范围,以及(有限的)终端网络访问等挑战增加了防护措施。尽管这些缓解措施显著降低了风险,但 ChatGPT agent 扩展的工具和更广泛的用户覆盖范围意味着其整体风险状况更高。
我们特别重视保护 ChatGPT agent 免受通过提示注入进行的对抗性操纵,这是智能体系统普遍面临的风险,并据此准备了更广泛的缓解措施。提示注入是第三方试图通过 ChatGPT agent 在完成任务时可能在网络上遇到的恶意指令来操纵其行为。例如,隐藏在网页中的恶意提示,比如隐藏在不可见元素或元数据中,可能会诱骗智能体采取非预期行动,例如将连接器中的私人数据分享给攻击者,或在用户已登录的网站上采取有害行动。由于 ChatGPT agent 可以直接采取行动,成功的攻击可能产生更大的影响并带来更高的风险。
我们已对该智能体进行了训练和测试,使其能够识别和抵御提示注入攻击,同时利用监控来快速检测和响应提示注入攻击。在采取有后果的行动之前要求用户明确确认,进一步降低了这些攻击造成危害的风险,用户也可以根据需要接管或暂停来干预任务。用户在决定向智能体提供哪些信息时应权衡这些取舍,并采取措施尽量减少自身面临这些风险的可能性,例如在任务不需要时禁用连接器。
我们还针对模型错误实施了缓解措施,尤其是考虑到该模型现在能够执行影响现实世界的任务:
**用户明确确认:**ChatGPT 经过训练,在采取具有现实后果的行动(如进行购买)之前会明确征求你的许可。
**主动监督(“Watch Mode”):**某些关键任务(如发送电子邮件)需要你的主动监督。
**主动风险缓解:**ChatGPT 经过训练,会主动拒绝银行转账等高风险任务。
最后,我们引入了额外的控制措施来限制数据,即模型可以访问的数据:
**隐私控制:**只需在 ChatGPT 设置中点击一下,你就可以删除所有浏览数据,并立即退出所有活跃的网站会话。否则,Cookie 会根据每个访问网站的 Cookie 政策持续存在,这可以使重复访问网站更加高效。
**安全浏览器接管模式:**当你使用 ChatGPT 的浏览器(“接管模式”)与网络交互时,你的输入保持私密。ChatGPT 不会收集或存储你在这些会话期间输入的任何数据,例如密码,因为模型不需要这些数据,而且如果它从未看到这些数据会更安全。
我们迄今为止针对生物风险的最强安全体系
随着模型能力的提升,我们决定根据我们的Preparedness Framework将 ChatGPT agent 视为具有高生物和化学能力,并启用相关保障措施。虽然我们没有确凿证据表明该模型能够切实帮助新手造成严重的生物危害——这是我们判定高能力的门槛——但我们正在谨慎行事,并立即实施所需的保障措施。因此,该模型拥有我们迄今为止最全面的安全体系,并针对生物学增强了保障措施:全面的威胁建模、双重用途拒绝训练、始终在线的分类器和推理监控,以及明确的执行流程。
除了为保障 ChatGPT agent 所做的工作外,我们知道分层生物安全只有在保障措施超越任何单一实验室时才能发挥最佳效果,因此我们在整个生态系统中开展合作以加强防御。从第一天起,我们就与外部生物安全专家、安全机构和学术研究人员合作,以塑造我们的威胁模型、评估和政策。接受过生物学培训的审查人员验证了我们的评估数据,领域专家红队成员在现实场景中对保障措施进行了压力测试。本月早些时候,我们与来自政府、学术界、国家实验室和非政府组织的专家共同举办了一场生物防御研讨会,以加速合作并推进由 AI 驱动的生物防御研究。我们将继续在全球范围内开展合作,以领先于新兴风险。
在 系统卡 中了解有关我们针对统一智能体模型所采取的稳健安全方法的更多信息。我们还启动了一项 漏洞赏金计划,以便发现并修复现实世界中的风险。
可用性
ChatGPT agent 从今天起开始向 Pro、Plus 和 Team 用户推出;Pro 用户将在今天结束前获得访问权限,而 Plus 和 Team 用户将在未来几天内获得访问权限。Enterprise 和 Education 用户将在未来几周内获得访问权限。Pro 用户每月有 400 条消息,其他付费用户每月有 40 条消息,并可通过基于积分的灵活选项获得额外用量。
我们仍在努力为欧洲经济区和瑞士启用访问权限。
Operator 研究预览站点将在未来几周内继续运行,之后将停用。深度研究是 ChatGPT agent 能力的一部分。如果你更喜欢最初的深度研究功能——它可能需要更长时间运行,但默认会提供更详细、更深入的回复——你仍然可以通过在消息编辑器的下拉菜单中选择“deep research”来访问它。
局限性与未来展望
ChatGPT agent 仍处于早期阶段。它能够承担一系列复杂任务,但仍可能出错。
虽然我们看到它在生成幻灯片方面具有巨大潜力,但该功能目前仍处于测试阶段。目前,其输出在格式和打磨程度上有时会显得较为初级,尤其是在没有现成文档作为起点时。我们将模型的初始能力重点放在生成能够以适合演示的流程和格式组织信息的产物上,包含文本、图表、图像和形状等元素,这些元素在导出后可原生且轻松地编辑,从而优化结构和灵活性。目前,查看器中的幻灯片与导出的 PowerPoint 之间偶尔也会存在差异,我们正在努力减少这种情况。此外,虽然你目前可以上传现有电子表格供 ChatGPT 编辑或用作模板,但该能力尚不适用于幻灯片。我们已经在训练下一代 ChatGPT 幻灯片创建功能,以生成更精致、更复杂的输出,并具备更广泛的能力和更好的格式。
总体而言,我们预计 ChatGPT agent 的效率、深度和多功能性将随着时间的推移持续改进,包括更无缝的交互,因为我们会继续调整对用户监督量的要求,使其更有用,同时确保其使用安全。
附录
| SpreadsheetBench | ||||
|---|---|---|---|---|
| 模型 | 评估环境 | 软限制(%):单元格级 | 软限制(%):工作表级 | 软限制(%):总体 |
| GPT‑4o | Windows、Excel | 15.03 | 23.65 | 18.35 |
| Excel 中的 Copilot | Windows、Excel | 23.33 | 15.00 | 20.00 |
| GPT‑4o | OSX、LibreOffice | 15.86 | 18.33 | 16.81 |
| OpenAI o3 | OSX、LibreOffice | 22.40 | 24.60 | 23.25 |
| ChatGPT agent | OSX、LibreOffice | 38.27 | 30.48 | 35.27 |
| 使用 .xlsx 的 ChatGPT agent | OSX、LibreOffice | 50.56 | 37.51 | 45.54 |
| 人类 | 75.56 | 65.00 | 71.33 |
直播回放
作者
OpenAI
脚注
* 启用浏览时,模型有时可以在网上找到确切答案,例如,通过阅读包含数据集示例问题的博客文章。我们通过两种策略来缓解模型在浏览时作弊的担忧:
1. 屏蔽我们过去观察到模型曾从中作弊的域名。
- 使用一个额外的模型作为监控器,检查每次尝试中的所有工具输出 token,以识别可疑行为。可疑行为定义为“一个页面、文件或片段,其主要目的是提供针对这个特定问题的确切答案——例如,官方评分标准、泄露的‘解答’gist,或逐字引用最终答案的讨论。”良性行为定义为“任何勤奋的人可能会查阅的权威资源(文档、手册、学术论文、知名文章),即使它偶然包含正确答案。”任何被监控器判定为可疑的尝试都计为不正确。未能通过此检查的大多数样本,其确切解答可在多个与 HLE 无关的互联网来源上找到。
**OpenAI 独家拥有 Tier 1-3 数据集中 290 个私有问题中的 237 个。本次评估不包含 FrontierMath tier 4 问题。结果按每个问题 16 次尝试的平均值评估。ChatGPT agent 的结果由 OpenAI 获取,由 Epoch AI 评分,具有浏览器和终端访问权限,每个答案限制为 128K token。OpenAI o4-mini 和 o3 的评估由 Epoch AI 获取并评分,无浏览器和终端访问权限,通过函数调用使用 python 脚本,每个答案限制为 100K token。
*** Oracle@64 指在 64 次采样运行中取得的最佳分数,使用真实答案进行选择(即,我们根据实际评分表现,为每个任务挑选得分最高的尝试)。我们报告所有任务中这些每任务最佳分数的平均值。该指标突显了模型的上限潜力和任务表现中的方差——展示了模型在成功时能达到的能力,并表明通过进一步训练提高一致性的空间。与典型的“best of N”指标根据模型置信度进行选择不同,oracle@64 使用真实答案进行选择,并适用于按连续 0–1 分制评分的任务,而非二元通过/失败。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com