OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2020-09-04精选AI 评分70
OpenAI 用人类反馈强化学习训练更擅长摘要的语言模型
Learning to summarize with human feedback
AI 导读
OpenAI 应用基于人类反馈的强化学习(RLHF)训练语言模型,使其在摘要任务上表现更好。原文仅提供一句概述,未给出更多实验细节。
推荐理由
原文说明 OpenAI 用人类反馈强化学习训练摘要模型,读者可了解 RLHF 在摘要任务上的应用方向。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com