arXiv:cs.CL(计算语言学,全量分类)· Parisa Salmani, Peter R. Lewis·· 3 小时前AI 评分49
长对抗对话中的语言模型安全性评估:多轮攻击下安全率从 85%-100% 降至 15%-44%
Evaluating Language Model Safety Across Long Adversarial Conversations
AI 导读
一项研究用第二个语言模型扮演持续对抗用户、由安全分类器逐条标注回复,测试三个开源权重指令微调模型在两种有害提示下的多轮表现。首轮安全回复率为 85%-100%,到第 11 轮降至 38%-61%,第 101 轮进一步跌至 15%-44%,且该下降跨模型、跨提示组合普遍存在。结果表明强单轮安全并不必然延续到持续对抗交互,需要长时程评估与对话级防护。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org