研究者提出PlurPO缓解社交谄媚
热点事件持续更新
研究者提出PlurPO缓解社交谄媚
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
研究者提出多元偏好优化(PlurPO)方法,用于缓解语言模型的社交谄媚问题:面对描述人际冲突的输入,模型先识别并模拟相关利益方,再被训练为偏好并生成各方都能接受的回复。 在四个数据集和四个模型家族上,PlurPO 对意图伤害类陈述的认可率平均降低 89%;在一般建议问题上,将人类认可率差距从 17.8% 缩小至 8.0%。为 8B 模型构建的偏好数据集还能有效迁移到 32B 模型。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 12:00
通过多元偏好优化缓解社交谄媚报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AI通过多元偏好优化缓解社交谄媚
研究者提出多元偏好优化(PlurPO),让语言模型在人际冲突场景中识别并模拟相关利益方,训练其生成各方都能接受的回复,从而缓解社交谄媚。在四个数据集和四个模型家族上,PlurPO 对意图伤害类陈述的认可率平均降低 89%;在一般建议问题上将人类认可率差距从 17.8% 缩小至 8.0%。为 8B 模型构建的偏好数据集还能有效迁移到 32B 模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。