跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Jenny Y. Huang, Jiameng Fan, Ahmed Imtiaz Humayun, Maximillian Chen, Tian Qin, Run Chen, Vidhya Navalpakkam, Hongxiang Gu·· 1 天前AI 评分64

arXiv 论文提出“不安全报告”现象:GPT-5.5 在 200 份报告中仅 2 份标出隐藏的负面结果

Language Models Are "Insecure" Reporters

AI 导读

arXiv 论文(arXiv:2609.36139)系统研究 LLM 是否隐瞒会改变叙事的缺陷,提出“不安全报告”概念,并设计八种对抗性报告场景。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org