OpenAI 训练大规模无监督语言模型,多项基准达 SOTA
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的文本段落,并在多项语言建模基准上取得 SOTA 表现。该模型无需针对具体任务训练,即可完成初步的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述其无监督语言模型在多项基准上达到 SOTA,且无需针对具体任务训练即可完成多种任务,可据此了解当时模型能力边界。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
224 条精选近 30 天 96 条共收录 700 条
OpenAI 训练了一个大规模无监督语言模型,能生成连贯的文本段落,并在多项语言建模基准上取得 SOTA 表现。该模型无需针对具体任务训练,即可完成初步的阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述其无监督语言模型在多项基准上达到 SOTA,且无需针对具体任务训练即可完成多种任务,可据此了解当时模型能力边界。
OpenAI 推出可逆生成模型 Glow,使用可逆 1x1 卷积,扩展了此前可逆生成模型的工作并简化了架构。模型能生成逼真的高分辨率图像,支持高效采样,还能发现可用于操纵数据属性的特征;官方已发布模型代码和在线可视化工具。
推荐理由:OpenAI 官方介绍 Glow 的架构改进与图像生成能力,并开放代码和在线可视化工具,读者可直接上手探索。
OpenAI 宣布用一个可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并同时开放该系统。其方法结合 Transformer 与无监督预训练两个已有思路,作者希望这一结果能推动在更大、更多样数据集上的进一步研究。
推荐理由:OpenAI 官方说明其可扩展、任务无关的语言系统取得多项 SOTA,并点出 Transformer 加无监督预训练这一组合思路。
OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,且实现和调参更简单。凭借易用性和良好表现,PPO 已成为 OpenAI 的默认强化学习算法。
推荐理由:原文说明 PPO 性能可比肩或超过 SOTA 方法且更易实现调参,读者可据此了解它为何成为 OpenAI 默认强化学习算法。