跳到正文
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2019-09-19精选AI 评分71

OpenAI 用人类偏好反馈微调 774M 参数 GPT-2

Fine-tuning GPT-2 from human preferences

AI 导读

OpenAI 用人类反馈微调 774M 参数的 GPT-2 语言模型,使其在摘要和多种风格续写等任务上匹配外部人类标注者的偏好。摘要任务用了 6 万条人工标注,较简单的风格续写任务只需 5 千条;标注者偏好与作者自身偏好并不总是一致,例如摘要任务中标注者偏好整句照抄输入文本,导致模型学会了照抄。作者表示动机是让安全技术更接近「机器与人对话」这一通用任务,认为这是提取人类价值观信息的关键。

推荐理由

原文给出用人类反馈微调 774M 参数 GPT-2 的任务结果,并指出标注者偏好与作者意图不一致导致模型学会照抄的教训。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com