跳到正文
原文
arXiv:cs.AI(全量分类)· Yavuz Bakman, Duygu Nur Yaldiz, Baris Askin, Swastik Roy, Morteza Ziyadi, Salman Avestimehr, Sai Praneeth Karimireddy·· 3 小时前AI 评分56

arXiv 论文提出 context confusion:对齐数据可经上下文混淆诱发失对齐

Aligned Data Can Induce Misalignment via Context Confusion

AI 导读

arXiv 论文(arXiv:2609.38379)提出 post-training 中的 context confusion 现象:对齐训练样本在其他上下文中可能诱发失对齐行为,并在性别平等、隐私、物理安全三个领域演示。

来源:arXiv:cs.AI(全量分类) · arxiv.org