OpenAI 发布 Image GPT:用像素序列训练 Transformer 生成图像
OpenAI 发现与语言模型同理,在像素序列上训练的大型 Transformer 模型(Image GPT)可以生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型所含特征在无监督设置下可与顶级卷积网络竞争。
推荐理由:原文指出同一 Transformer 架构在像素序列上也能生成连贯图像,并给出样本质量与分类精度的相关性,可作无监督表征研究的参照。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 发现与语言模型同理,在像素序列上训练的大型 Transformer 模型(Image GPT)可以生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型所含特征在无监督设置下可与顶级卷积网络竞争。
推荐理由:原文指出同一 Transformer 架构在像素序列上也能生成连贯图像,并给出样本质量与分类精度的相关性,可作无监督表征研究的参照。
OpenAI 官网发布论文《Language Models are Few-Shot Learners》,探讨语言模型的少样本学习能力。
OpenAI 发布分析,指出自 2012 年以来,在 ImageNet 分类上训练达到同等性能的神经网络所需算力每 16 个月下降一半。相比 2012 年,现在训练到 AlexNet 水平所需算力减少 44 倍,而同期 Moore's Law 只能带来 11 倍的成本改善。结果表明,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省,并与 Moore's Law 对比,读者可据此理解算法与硬件效率的相对贡献。
OpenAI 推出 Jukebox,一个能以原始音频形式生成音乐的神经网络,可生成包含基础人声演唱的多种流派和艺术家风格的音乐。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。
推荐理由:OpenAI 官方发布音乐生成模型 Jukebox,并开源模型权重和代码,读者可以直接下载探索生成样本。
OpenAI 宣布将其深度学习框架统一标准化为 PyTorch。
推荐理由:OpenAI 官方宣布统一深度学习框架为 PyTorch,读者可据此了解其训练技术栈的走向。
OpenAI 发布关于神经网络语言模型 Scaling Laws 的研究,正文抓取失败,仅标题可用,具体内容无法确认。
OpenAI 在官网发布关于 Dota 2 大规模深度强化学习的研究内容,正文抓取失败,仅标题可用,具体方法和结果以原文为准。
OpenAI 发布 GPT-2 分阶段发布的最终版本,即 15 亿参数的最大版本,同时公开代码和模型权重以帮助检测 GPT-2 模型的输出。OpenAI 表示虽然 8 月以来已有更大的语言模型发布,但仍按原计划完成分阶段发布,为社区提供一个完整的分阶段发布流程测试案例,并继续与 AI 社区讨论负责任发布。
推荐理由:OpenAI 官方说明分阶段发布的最终一步,可作为研究大模型负责任发布流程的参考案例。
OpenAI 训练了一对神经网络,用类人机械手复原魔方。网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并配合一种名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情形,例如被长颈鹿玩偶戳碰,表明强化学习不只能完成虚拟任务,也能解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控实体机械手复原魔方,并给出 ADR 这一可迁移的强化学习技术思路。
OpenAI 用人类反馈微调 774M 参数的 GPT-2 语言模型,使其在摘要和多种风格续写等任务上匹配外部人类标注者的偏好。摘要任务用了 6 万条人工标注,较简单的风格续写任务只需 5 千条;标注者偏好与作者自身偏好并不总是一致,例如摘要任务中标注者偏好整句照抄输入文本,导致模型学会了照抄。作者表示动机是让安全技术更接近「机器与人对话」这一通用任务,认为这是提取人类价值观信息的关键。
推荐理由:原文给出用人类反馈微调 774M 参数 GPT-2 的任务结果,并指出标注者偏好与作者意图不一致导致模型学会照抄的教训。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时,逐步发现越来越复杂的工具使用行为。智能体在游戏中演化出六种不同的策略与反策略,其中部分策略是团队事先不知道该环境所支持的。OpenAI 认为这种简单环境中的自监督涌现复杂性表明,多智能体协同适应未来可能产生极其复杂和智能的行为。
推荐理由:OpenAI 自述多智能体在捉迷藏环境中自发演化出六种策略与反策略,可帮助读者了解多智能体协同适应如何产生复杂行为。
OpenAI 发布 774M 参数的 GPT-2 语言模型,此前已分别于 2 月发布 124M 小模型、5 月分阶段发布 355M 中模型,并与合作伙伴及 AI 社区研究了模型的潜在滥用与社会效益。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 官方说明分阶段放行 774M 模型的决策依据,并附上模型共享协议与发布规范报告,可了解其审慎发布策略。
Microsoft 向 OpenAI 投资 10 亿美元,支持其构建惠益广泛分配的 AGI。双方将在 Microsoft Azure 内开发可扩展至 AGI 的软硬件平台,共同开发新的 Azure AI 超算技术,Microsoft 成为 OpenAI 的独家云服务商。
推荐理由:OpenAI 官宣 Microsoft 投资 10 亿美元并成为其独家云服务商,读者可据此了解双方在 Azure 上共建 AGI 算力平台的合作框架。
OpenAI 开发了 Sparse Transformer,一种在预测文本、图像或声音序列下一项任务上创下新纪录的深度神经网络。它通过改进注意力机制的算法,能从比此前可能的长 30 倍的序列中提取模式。
推荐理由:原文给出 Sparse Transformer 的核心改进点,即注意力算法可处理比此前长 30 倍的序列,读者可据此了解其技术方向。
OpenAI Five 成为首个在电竞项目中击败世界冠军的 AI,周末在决赛中连胜 OG 两局。此前 OpenAI Five 与 DeepMind 的 AlphaStar 都曾在私下对局中战胜职业选手但输掉直播比赛,这也是 AI 首次在直播中战胜电竞职业选手。
OpenAI 宣布成立新的 capped-profit(利润上限)公司 OpenAI LP,用于快速增加在算力和人才上的投入,同时设置制衡机制以实现其使命。
推荐理由:OpenAI 官方宣布成立 capped-profit 公司结构,原文说明了该结构如何兼顾加大算力与人才投入和使命约束。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的文本段落,并在多项语言建模基准上取得 SOTA 表现。该模型无需针对具体任务训练,即可完成初步的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述其无监督语言模型在多项基准上达到 SOTA,且无需针对具体任务训练即可完成多种任务,可据此了解当时模型能力边界。
OpenAI 发布 Spinning Up in Deep RL,一个面向大众的深度强化学习教育资源,目标是让任何人学会成为熟练的深度强化学习实践者。资源包含清晰的 RL 代码示例、教学练习、文档和教程。
推荐理由:OpenAI 官方推出的深度强化学习教育资源,包含代码示例、练习和教程,适合想系统入门该领域的读者。
OpenAI Five 本周在温哥华 The International 2018 上对阵顶级 Dota 2 选手,输掉两局比赛。官方称两局中 OpenAI Five 在前 20-35 分钟内都保持了较大的获胜机会。
推荐理由:OpenAI 官方复盘 OpenAI Five 在 The International 的两场失利,说明其在前 20-35 分钟仍保持优势,可了解当时智能体对战的局限。
OpenAI Five 在三局两胜比赛中击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 99.95 百分位 Dota 玩家战队,其中四人曾职业打 Dota。比赛在现场观众和 10 万同时在线直播观众面前进行。