LTBD:可学习信任边界提示注入防御
热点事件持续更新
LTBD:可学习信任边界提示注入防御
1 篇报道1 个报道来源2 小时前更新
先了解这件事
报道摘要
针对 LLM 易受提示词注入攻击的问题,研究者提出轻量防御方法 LTBD,在不改动 LLM 参数的前提下,用少量可学习分隔符在输入中显式编码信任边界,区分可信用户指令与不可信外部数据。LTBD 在 AlpacaFarm 上实现 0.00% ASR,在 TaskTracker 上仅 0.11-0.19% ASR,并在攻击者完全了解防御的自适应攻击下依然有效,且推理开销可忽略。
摘自 arXiv:cs.AI
最新进展10月9日 12:00
LTBD:用于提示词注入防御的可学习信任边界分隔符报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv:cs.AILTBD:用于提示词注入防御的可学习信任边界分隔符
针对 LLM 易受提示词注入攻击的问题,研究者提出轻量防御方法 LTBD,在不改动 LLM 参数的前提下,用少量可学习分隔符在输入中显式编码信任边界,区分可信用户指令与不可信外部数据。LTBD 在 AlpacaFarm 上实现 0.00% ASR,在 TaskTracker 上仅 0.11-0.19% ASR,并在攻击者完全了解防御的自适应攻击下依然有效,且推理开销可忽略。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。