跳到正文

#OpenAI

今日 63 条
11月19日周三
11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)60

    Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI

    Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。

11月4日周二
  1. OpenAI Developers(RSS)63

    OpenAI 演示如何用 Codex 自动审查 GitHub 拉取请求与 Codex CLI 代码

    OpenAI 的 Maja Trębacz 和 Romain Huet 演示如何设置 Codex 自动审查 GitHub 上的新拉取请求以及在 Codex CLI 中进行代码审查,并讨论了训练模型生成高质量代码审查的研究方法。视频还涵盖 Codex 代码审查与静态分析的区别、用 AGENTS.md 自定义审查,入口为 chatgpt.com/codex/code-review。

10月27日周一
10月22日周三
  1. OpenAI Developers(RSS)67

    OpenAI 演示在代码编辑器中使用 Codex

    OpenAI 展示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的工作流,内容涉及 codex 与 IDE 扩展。

    推荐理由:官方演示了 Codex 与主流代码编辑器的搭配方式,可帮助开发者了解如何把工作流收进编辑器内完成。

10月20日周一
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 发布当前 AI 使用指南:如何选模型、触发 Deep Research 与避坑

    Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。

    推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。

10月15日周三
10月6日周一
10月4日周六
  1. Sam Altman:Blog(RSS)57

    Sam Altman:Sora 即将加强版权方角色控制并尝试视频生成变现

    Sam Altman 宣布 Sora 即将推出两项更新:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户生成量超出预期,将尝试对视频生成收费,并与希望角色被生成的版权方分享部分收入。具体模式仍在试错,目标是先在 Sora 迭代,再在 OpenAI 各产品中统一应用。

10月1日周三
  1. Sam Altman:Blog(RSS)85

    Sam Altman 宣布推出 Sora 2 模型及同名视频社交 App

    OpenAI 推出名为 Sora 的 App,由新模型 Sora 2 和视频创作分享产品组成,称其为创意的 ChatGPT 时刻。亮点包括 cameo 功能,可把自己和朋友放进视频并保持角色一致性;同时上线防深度伪造、有害内容防护和用户情绪健康定期检查等措施,并承诺优化长期用户满意度、允许用户控制信息流、优先创作和帮助用户实现长期目标。

    推荐理由:原文给出 Sora 2 与社交 App 的核心功能、cast 佩戴与防止滥用等措施,以及产品原则,可帮助读者了解其定位与设计取舍。

9月30日周二
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 谈 AI 智能体做真实工作:从复现论文到 17 份 PowerPoint

    Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。

    推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。

9月29日周一
9月23日周二
  1. Sam Altman:Blog(RSS)36

    Sam Altman 提出"丰裕智能"愿景:每周造出 1GW AI 基础设施

    Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。

9月12日周五
9月9日周二
8月29日周五
8月25日周一
  1. Johann Rehberger / Embrace The Red(RSS)54

    ChatGPT Deep Research 连接器如何导致数据跨工具泄露

    作者实测发现 ChatGPT Deep Research 的各连接器处于同一信任边界,智能体可把一个数据源的信息用于查询另一工具,攻击者可借间接提示词注入迫使 Linear 工单中的凭据等敏感数据发送到自定义 MCP 服务器。研究约在两个月前进行,核心结论仍适用;作者建议谨慎选择同时启用的工具,避免将敏感源与低完整性源连入同一研究过程,并可通过活动窗格查看智能体调用了哪些工具、发送了什么数据。

8月14日周四
  1. OpenAI Developers(RSS)48

    OpenAI API 速率限制指南:RPM、TPM 与用量层级详解

    OpenAI 发布 API 速率限制指南,说明速率限制按组织级和项目级而非用户级设定,并随所用模型不同而变化。限制指标包括 RPM、RPD、TPM、TPD、IPM 及部分流式音频模型的每分钟音频分钟数,任一指标先触顶即受限。付费用量层级分为 Build、Launch、Grow,随累计充值额自动升级,层级越高速率限制越高。

8月13日周三
8月9日周六
8月3日周日
8月2日周六
8月1日周五
7月22日周二
  1. OpenAI Developers(RSS)56

    OpenAI 发布 Flex processing 测试版:以更低价格换取更慢响应

    OpenAI 推出 Flex processing(beta),以更慢的响应速度和偶发的资源不可用换取更低成本,适合模型评估、数据增强和异步等非生产任务。token 按 Batch API 费率计价,叠加 prompt caching 折扣,通过在 API 请求中设置 service_tier 为 flex 使用;资源不足时返回 429 且不计费,官方建议用指数退避重试或改回标准处理。

  2. OpenAI Developers(RSS)39

    OpenAI Batch API 使用指南:异步请求成本降低 50%

    OpenAI 发布 Batch API 使用指南,该接口以异步方式批量发送请求,成本比同步 API 低 50%,并提供更高的速率限制,每批任务在 24 小时内完成。Batch API 支持 /v1/responses、/v1/chat/completions、/v1/embeddings 等 7 个端点,输入文件为 .jsonl 格式,单个文件上限 200 MB,每个文件只能包含单一模型的请求。

7月21日周一
  1. OpenAI Developers(RSS)66

    OpenAI 发布 gpt-live-transcribe 实时语音转写指南

    OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。

    推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。