研究:后训练致模型默认坍缩与可引导性丧失
热点事件持续更新
研究:后训练致模型默认坍缩与可引导性丧失
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
arXiv 机器学习分类 2026 年 10 月 5 日的一篇论文指出,后训练不仅收窄大语言模型表达的立场,还会削弱其被上下文引导至未受训练偏好视角的能力。 作者 Jessica Dierking、Itai Shapira、Niclas Boehmer 称,实验将模型微调至文化价值观争议的某一方后,受训立场在日常使用中愈发主导,而识别并忠实执行对立视角的能力持续下降。 作者提出按指定视角分布最大化奖励的替代目标,并给出立场分布匹配(stance-distribution matching)作为实现方案。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 12:00
后训练中丢失了什么?默认坍缩与多元视角下上下文可引导性的丧失报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.LG后训练中丢失了什么?默认坍缩与多元视角下上下文可引导性的丧失
研究发现,后训练不仅收窄大语言模型表达的立场,还会削弱其被上下文引导至未受训练偏好视角的能力。实验将模型微调至文化价值观争议的某一方后,受训立场在日常使用中愈发主导,而识别并忠实执行对立视角的能力持续下降。作者提出按指定视角分布最大化奖励的替代目标,并给出立场分布匹配(stance-distribution matching)作为实现方案。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。