OpenAI 发布 InstructGPT 并设为 API 默认语言模型
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究中开发、人类在环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:原文说明 InstructGPT 通过人类反馈对齐训练,比 GPT-3 更符合用户意图,并已作为 API 默认模型部署。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究中开发、人类在环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:原文说明 InstructGPT 通过人类反馈对齐训练,比 GPT-3 更符合用户意图,并已作为 API 默认模型部署。
OpenAI 在 API 中推出新的 embeddings 端点,用于处理自然语言和代码任务。该端点可支持语义搜索、聚类、主题建模和分类等应用。
推荐理由:OpenAI 官方宣布 API 新增 embeddings 端点,读者可据此了解语义搜索等任务的官方接入方式。
OpenAI 微调 GPT-3 得到 WebGPT,借助基于文本的网页浏览器更准确地回答开放式问题。
推荐理由:原文给出用文本浏览器微调 GPT-3 以提升开放问答事实准确性的方向,可了解检索增强问答的一种做法。
OpenAI 宣布 GPT-3 支持针对应用场景的微调(fine-tuning),只需一条命令即可完成定制。
推荐理由:OpenAI 官方宣布 GPT-3 支持微调,一条命令即可完成,适合关注定制化模型能力的开发者。
OpenAI 宣布其 API 不再需要候补名单,任何人均可直接使用。官方说明,更广泛的开放得益于安全方面的进展。
推荐理由:原文说明 API 开放申请的原因是安全方面的进展,读者可据此了解 OpenAI 开放策略背后的考量。
OpenAI 发布开源的类 Python 编程语言 Triton 1.0,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能与专家手写代码相当。
推荐理由:官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码,可关注其对研究工作流的影响。
OpenAI 发布论文《Evaluating large language models trained on code》,研究如何评估在代码上训练的大语言模型。抓取仅获取到标题,正文内容暂缺。
OpenAI 发现 CLIP 中存在多模态神经元,无论概念以字面、符号还是概念形式呈现,这些神经元都会响应同一概念。这可能解释了 CLIP 在分类概念的各种出人意料的视觉呈现时的准确性,也是理解 CLIP 及类似模型所学到的关联与偏差的重要一步。
推荐理由:OpenAI 亲自解释了 CLIP 为何能识别概念的非字面视觉呈现,为理解模型学到的关联与偏差提供了线索。
OpenAI 推出神经网络 CLIP,通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:官方介绍 CLIP 用自然语言监督学习视觉概念,可零样本适配任意视觉分类基准,读者可了解其与 GPT 系列能力思路的关联。
OpenAI 训练了名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖广泛可用自然语言表达的概念。
推荐理由:官方宣布文生图模型 DALL·E,可从自然语言描述生成图像,是文生图方向的早期代表工作。
OpenAI 宣布已同意将 GPT-3 授权给 Microsoft,供其用于自己的产品和服务。
推荐理由:OpenAI 官方宣布将 GPT-3 授权给 Microsoft 用于其产品和服务,读者可借此了解 GPT-3 商业化的关键合作动向。
OpenAI 发现与语言模型同理,在像素序列上训练的大型 Transformer 模型(Image GPT)可以生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型所含特征在无监督设置下可与顶级卷积网络竞争。
推荐理由:原文指出同一 Transformer 架构在像素序列上也能生成连贯图像,并给出样本质量与分类精度的相关性,可作无监督表征研究的参照。
OpenAI 官网发布论文《Language Models are Few-Shot Learners》,探讨语言模型的少样本学习能力。
OpenAI 发布分析,指出自 2012 年以来,在 ImageNet 分类上训练达到同等性能的神经网络所需算力每 16 个月下降一半。相比 2012 年,现在训练到 AlexNet 水平所需算力减少 44 倍,而同期 Moore's Law 只能带来 11 倍的成本改善。结果表明,在近期投入较高的 AI 任务上,算法进步带来的收益超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省,并与 Moore's Law 对比,读者可据此理解算法与硬件效率的相对贡献。
OpenAI 推出 Jukebox,一个能以原始音频形式生成音乐的神经网络,可生成包含基础人声演唱的多种流派和艺术家风格的音乐。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。
推荐理由:OpenAI 官方发布音乐生成模型 Jukebox,并开源模型权重和代码,读者可以直接下载探索生成样本。
OpenAI 宣布将其深度学习框架统一标准化为 PyTorch。
推荐理由:OpenAI 官方宣布统一深度学习框架为 PyTorch,读者可据此了解其训练技术栈的走向。
OpenAI 发布关于神经网络语言模型 Scaling Laws 的研究,正文抓取失败,仅标题可用,具体内容无法确认。
OpenAI 在官网发布关于 Dota 2 大规模深度强化学习的研究内容,正文抓取失败,仅标题可用,具体方法和结果以原文为准。
OpenAI 发布 GPT-2 分阶段发布的最终版本,即 15 亿参数的最大版本,同时公开代码和模型权重以帮助检测 GPT-2 模型的输出。OpenAI 表示虽然 8 月以来已有更大的语言模型发布,但仍按原计划完成分阶段发布,为社区提供一个完整的分阶段发布流程测试案例,并继续与 AI 社区讨论负责任发布。
推荐理由:OpenAI 官方说明分阶段发布的最终一步,可作为研究大模型负责任发布流程的参考案例。
OpenAI 训练了一对神经网络,用类人机械手复原魔方。网络完全在仿真中训练,使用与 OpenAI Five 相同的强化学习代码,并配合一种名为 Automatic Domain Randomization(ADR)的新技术。系统能应对训练中从未见过的情形,例如被长颈鹿玩偶戳碰,表明强化学习不只能完成虚拟任务,也能解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控实体机械手复原魔方,并给出 ADR 这一可迁移的强化学习技术思路。