跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 341–346 条 · 共 346 条
7月20日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)75

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,且实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。

    推荐理由:原文说明 PPO 性能可比肩或超过 SOTA 方法且更易实现调参,读者可据此了解它为何成为 OpenAI 默认强化学习算法。

6月13日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 与 DeepMind 合作研究从人类偏好中学习

    OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。

12月5日周一
6月21日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 参与 Google Brain 主导的论文《Concrete Problems in AI Safety》

    OpenAI 与 Berkeley、Stanford 研究者共同署名 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了让现代机器学习系统按预期运行的多项研究问题。

    推荐理由:OpenAI 联合 Berkeley、Stanford 研究者参与 Google Brain 主导的论文,读者可从中了解 AI 安全的具体研究问题方向。

4月27日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)74

    OpenAI Gym 公开测试版发布

    OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含一套持续扩充的环境(从模拟机器人到 Atari 游戏),并提供一个用于比较和复现结果的网站。

    推荐理由:OpenAI 官方发布强化学习算法开发与比较工具包的公开测试版,读者可据此了解其环境套件与结果复现机制。

12月11日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)84

    OpenAI 宣布成立:非营利 AI 研究公司

    OpenAI 宣布成立,是一家非营利人工智能研究公司。其目标是让数字智能以最有可能造福全人类的方式发展,不受产生财务回报的需求约束,从而更专注于对人类的正面影响。

    推荐理由:OpenAI 官方首次说明自身定位,非营利与不受财务回报约束的目标是理解其后续路线的背景。