跳到正文
原文
Lilian Weng:Lil'Log(RSS)·· 2023-10-25AI 评分55

Lilian Weng 长文解析 LLM 的对抗攻击:从梯度攻击到越狱提示与红队

Adversarial Attacks on LLMs

AI 导读

Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。

来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io