OpenAI Agents SDK 快速入门指南
OpenAI 发布 Agents SDK 快速入门,通过 pip install openai-agents 安装,用 Agent 定义名称与 instructions,再由 Runner.run 执行并返回 RunResult。
OpenAI 发布 Agents SDK 快速入门,通过 pip install openai-agents 安装,用 Agent 定义名称与 instructions,再由 Runner.run 执行并返回 RunResult。
OpenAI 发布实时翻译指南,介绍用 gpt-realtime-translate 模型将源音频流式输入专用翻译端点 /v1/realtime/translations,在说话者讲话的同时获得翻译音频和字幕增量,适用于同声传译、多语言通话、直播和会议等场景。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 发布构建智能体指南,对比 Agents API、Agents SDK 与 Responses API 三种运行时的选型。Agents API 由 OpenAI 托管 Codex harness,支持自动上下文压缩、多智能体编排、程序化工具调用和 MCP 服务器;Agents SDK 在应用内运行,由 runner 处理智能体循环与 handoff。
OpenAI Developers 发布视频演示如何使用 4o 模型创建图像,内容围绕图像生成功能展开。
OpenAI 发布内置工具指南,说明在 Responses API、Agents API 和 Agents SDK 中如何配置 web search、function calling。
OpenAI 发布面向 JavaScript/TypeScript 的开源 Agents SDK,用于构建多智能体工作流,支持 OpenAI API 及其他提供商。
OpenAI Codex 编程入门介绍,概述了使用 OpenAI Codex 进行编程的相关内容。
OpenAI 在 DevDay 上展示了实时功能与演示,涵盖语音、流式传输和低延迟。内容聚焦开发者可用的实时能力,具体模型版本与参数未在原文中披露。
OpenAI DevDay 举办蒸馏(distillation)专题活动,讨论高效蒸馏模型的策略。内容聚焦蒸馏方法本身,未披露具体模型、参数规模或基准数据。
OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。
OpenAI DevDay 设立结构化输出(structured outputs)专场,讲解 JSON 与 schema 相关技术。内容围绕结构化输出的实现方式展开,属于 DevDay 的技术分享环节。
OpenAI 发布 Computer Use 官方指南,说明模型可通过浏览器和桌面界面填写表单、测试用户流程或完成应用内任务。
OpenAI Agents SDK(Python)是一个轻量级多智能体工作流框架,支持 OpenAI Responses 和 Chat Completions API 以及 100+ 其他 LLM。
OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。
推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。
Sam Altman 发文称技术起飞已经开始,人类接近构建数字超级智能,且过程比想象中平缓。他判断 2025 年出现能完成真实认知工作的 Agent,2026 年可能产生能发现新洞见的系统,2027 年可能出现能在现实世界执行任务的机器人;科学家用 AI 后生产力提升两到三倍,ChatGPT 平均每次查询耗电约 0.34 瓦时、用水约 0.000085 加仑。
安全研究者 Johann Rehberger 实测 ChatGPT o3 的新 chat history 记忆功能,发现它并非全文检索过往对话,而是在系统提示中维护 Assistant Response Preferences。
Sayash Kapoor 撰文主张 AGI 不是里程碑,公司的 AGI 宣告对企业、开发者、政策制定者和安全都没有可操作意义。文章以 o3 为例指出即使系统满足某些 AGI 定义,其经济影响仍需数十年扩散才能实现,并建议区分能力与权力、政策应聚焦促进安全扩散而非追逐 AGI。
Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。
安全研究者 Johann Rehberger 实测演示 ChatGPT Operator 可被网页中的提示词注入劫持,将 news.ycombinator.com、booking.com 等已登录站点上的私密邮箱、地址和电话输入第三方数据泄露页面。
Sam Altman 提出关于 AI 经济学的三点观察:AI 模型智能约等于训练与运行资源投入的对数,可预测的 scaling laws 在多个数量级上成立;使用特定智能水平的成本约每 12 个月下降 10 倍,GPT-4 到 GPT-4o 的每 token 价格下降约 150 倍;线性增长的智能带来的社会经济价值呈超指数级。
Johann Rehberger 发布研究证明可通过 prompt injection 劫持 ChatGPT 实例并将其接入命令控制(C2)系统,实现长期远程控制,类似一种新型僵尸网络。
Sam Altman 在 ChatGPT 两周年之际发文回顾 OpenAI 近九年历程:ChatGPT 于 2022 年 11 月 30 日发布,用户已从约 1 亿周活增长到超过 3 亿。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic、Google Gemini 下一代模型遇阻后业内关于模型 scaling 已死的叙事转向,认为现在断言模型 scaling 终结为时尚早,且业内高管的预测受商业利益影响,不应盲从。
Sam Altman 发文点评 OpenAI 当日发布的 GPT-4o,强调两点:一是把世界最强模型免费开放给 ChatGPT 用户,无广告,未来靠其他付费项目支撑,希望让数十亿人用上优秀 AI 服务;二是新语音(和视频)模式是他用过最好的计算机界面,达到接近人类水平的响应时间和表达力,感觉像电影里的 AI。他提到未来将加入可选的个性化、访问用户信息和代为执行操作等能力。
推荐理由:作者作为当事方说明 GPT-4o 免费开放的初衷和新语音模式的使用感受,读者可了解 OpenAI 对这两点的官方表态。
Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。
这篇教程用 TensorFlow 和 OpenAI Gym 动手实现深度强化学习模型,完整代码见 lilian/deep-reinforcement-learning-gym。
Sam Altman 在其博文中提出,人类与机器的融合已经开始数年,且将是一个渐进过程而非单一时刻。他认为手机、社交媒体和搜索引擎背后的算法已在塑造人类行为,而超级智能 AI、基因增强和脑机接口终将实现。他主张融合是最好结果,人类应认真对待全球协调,并称自己曾难以抵抗算法的注意力劫持。