Lilian Weng:Lil'Log(RSS)·2023-10-25 08:00· 2023-10-25AI 评分55Lilian Weng 长文解析 LLM 的对抗攻击:从梯度攻击到越狱提示与红队Adversarial Attacks on LLMsAI 导读Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io#安全/对齐#推理#数据/训练#OpenAI