跳到正文
原文
arXiv:cs.AI(全量分类)· Michael Lee, Zhipeng Wei, Yue Dong, N. Benjamin Erichson·· 1 天前AI 评分44

AdaLCPI:智能体能否从碎片中重建间接提示词注入?

Divide and Inject: Can Agents Reconstruct an Indirect Prompt Injection from Fragments?

AI 导读

研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。

来源:arXiv:cs.AI(全量分类) · arxiv.org