跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2021-03-21AI 评分47

如何降低语言模型的有害输出

Reducing Toxicity in Language Models

AI 导读

大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io