跳到正文

OpenAI / ChatGPT

OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。

最新精选

第 261–274 条 · 共 274 条
7月9日周一
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 发布可逆生成模型 Glow

    OpenAI 推出可逆生成模型 Glow,使用可逆 1x1 卷积,扩展了此前可逆生成模型的工作并简化了架构。模型能生成逼真的高分辨率图像,支持高效采样,还能发现可用于操纵数据属性的特征;官方已发布模型代码和在线可视化工具。

    推荐理由:OpenAI 官方介绍 Glow 的架构改进与图像生成能力,并开放代码和在线可视化工具,读者可直接上手探索。

6月11日周一
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 发布基于无监督预训练的语言理解系统并取得多项 SOTA

    OpenAI 宣布用一个可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并同时开放该系统。其方法结合 Transformer 与无监督预训练两个已有思路,作者希望这一结果能推动在更大、更多样数据集上的进一步研究。

    推荐理由:OpenAI 官方说明其可扩展、任务无关的语言系统取得多项 SOTA,并点出 Transformer 加无监督预训练这一组合思路。

5月25日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 发布完整版 Gym Retro 强化学习游戏平台

    OpenAI 发布完整版 Gym Retro,一个用于游戏强化学习研究的平台。公开游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏扩展到超过 1,000 款,覆盖多种底层模拟器,并同时发布了用于向平台添加新游戏的工具。

    推荐理由:原文给出游戏数量从约百款扩到超千款的具体变化,并附添加新游戏的工具,便于研究者评估平台适用性。

5月16日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)71

    OpenAI 分析:2012 年以来最大 AI 训练算力每 3.4 个月翻倍

    OpenAI 发布分析指出,自 2012 年以来最大 AI 训练运行所用算力呈指数增长,翻倍周期为 3.4 个月,远快于摩尔定律的 2 年翻倍周期。该指标自 2012 年以来增长超过 300,000 倍,而 2 年翻倍周期只会带来 7 倍增长。OpenAI 认为算力提升是 AI 进展的关键组成部分,若趋势持续,值得为远超当今能力的系统做好准备。

    推荐理由:OpenAI 用自家分析给出训练算力 3.4 个月翻倍的量化趋势,可与摩尔定律对比,帮助读者理解算力在 AI 进展中的作用。

5月3日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)60

    OpenAI 提出通过辩论实现 AI 安全的方法

    OpenAI 提出一项 AI 安全技术:训练智能体就某一话题互相辩论,由人类判断谁获胜,以此辅助监督模型行为。

    推荐理由:OpenAI 提出用智能体互相辩论、由人类裁判胜负来训练 AI 的安全方法,为对齐研究提供了一条可参考的思路。

2月20日周二
8月16日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)75

    OpenAI 谈 Dota 2:自我对弈让系统从远低于人类水平跃升至超人类

    OpenAI 表示其 Dota 2 结果显示,在足够算力下自我对弈(self-play)能让机器学习系统从远低于人类水平跃升至超人类。系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手,且此后仍在提升。监督深度学习系统只能达到训练数据集的水平,而自我对弈系统中可用数据会随智能体变强自动改善。

    推荐理由:OpenAI 以 Dota 2 自我对弈为例,说明数据随智能体变强而自动改善,与监督学习的数据上限形成对照。

8月11日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)79

    OpenAI 打造在 Dota 2 标准 1v1 规则下击败世界顶尖职业选手的 bot

    OpenAI 宣布打造出一个在 Dota 2 标准 1v1 比赛规则下击败世界顶尖职业选手的 bot。该 bot 通过自博弈从零学会游戏,不使用模仿学习或树搜索。OpenAI 称这是迈向能在涉及真实人类的复杂混乱场景中完成明确目标的 AI 系统的一步。

    推荐理由:OpenAI 官方说明该 bot 从零自学习、不用模仿学习或树搜索,读者可据此了解早期自博弈强化学习的思路。

7月20日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)75

    OpenAI 发布强化学习算法 Proximal Policy Optimization(PPO)

    OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,且实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。

    推荐理由:原文说明 PPO 性能可比肩或超过 SOTA 方法且更易实现调参,读者可据此了解它为何成为 OpenAI 默认强化学习算法。

6月13日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 与 DeepMind 合作研究从人类偏好中学习

    OpenAI 与 DeepMind 安全团队合作开发一种算法,通过让人类判断两个候选行为哪个更好来推断人类意图。该工作旨在免去人工编写目标函数,避免用简单代理近似复杂目标时引发危险行为,是构建安全 AI 系统的一步。

    推荐理由:OpenAI 与 DeepMind 安全团队合作的算法,通过人类偏好比较推断目标,减少人工写目标函数带来的风险。

12月5日周一
6月21日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 参与 Google Brain 主导的论文《Concrete Problems in AI Safety》

    OpenAI 与 Berkeley、Stanford 研究者共同署名 Google Brain 研究人员主导的论文《Concrete Problems in AI Safety》。论文探讨了让现代机器学习系统按预期运行的多项研究问题。

    推荐理由:OpenAI 联合 Berkeley、Stanford 研究者参与 Google Brain 主导的论文,读者可从中了解 AI 安全的具体研究问题方向。

4月27日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)74

    OpenAI Gym 公开测试版发布

    OpenAI 发布 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。它包含一套持续扩充的环境(从模拟机器人到 Atari 游戏),并提供一个用于比较和复现结果的网站。

    推荐理由:OpenAI 官方发布强化学习算法开发与比较工具包的公开测试版,读者可据此了解其环境套件与结果复现机制。

12月11日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)84

    OpenAI 宣布成立:非营利 AI 研究公司

    OpenAI 宣布成立,是一家非营利人工智能研究公司。其目标是让数字智能以最有可能造福全人类的方式发展,不受产生财务回报的需求约束,从而更专注于对人类的正面影响。

    推荐理由:OpenAI 官方首次说明自身定位,非营利与不受财务回报约束的目标是理解其后续路线的背景。