跳到正文
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2020-09-04精选AI 评分70

OpenAI 用人类反馈强化学习训练更擅长摘要的语言模型

Learning to summarize with human feedback

AI 导读

OpenAI 应用基于人类反馈的强化学习(RLHF)训练语言模型,使其在摘要任务上表现更好。原文仅提供一句概述,未给出更多实验细节。

推荐理由

原文说明 OpenAI 用人类反馈强化学习训练摘要模型,读者可了解 RLHF 在摘要任务上的应用方向。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com