两项研究提出 Web 智能体抗注入训练框架
先了解这件事
针对 Web 智能体的跨模态提示注入攻击,两项研究各自提出对抗训练防御框架。Haoyu Liu 等提出 DMAST,把智能体与攻击者建模为双人一般和马尔可夫博弈并三阶段共同训练,用于应对双流架构下 DOM 注入同时污染截图与无障碍树的问题;在分布外任务上,作者称其将攻击成功率从 41.2% 降至 21.4%,任务完成率从 6.2% 升至 10.2%,并可与提示词防御互补。 另一项工作中,Sarim Hashmi 等提出 AdvSim2Real,在冻结的网页世界模型里协同演化任务课程、注入对抗者与 Agent,课程以 Agent 约半数成功率为奖励,攻击者仅在注入使成功翻转为失败时获得奖励。作者称,在模拟器中训练使 4B 智能体在有无攻击下完成率均上升,并能抵御未训练过的前沿模型对手、能力增益迁移到真实浏览器;在 150 个网页任务上,面对该未见对手其完成率相对基线提升 33.6%。两项工作的代码均已开源。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月7日 12:00 · 1 篇报道DMAST 多模态智能体对抗安全训练框架arXiv:cs.LG:DMAST:让多模态 Web 智能体抵御跨模态攻击的双模态多阶段对抗安全训练
- 10月7日 12:00 · 1 篇报道提出AdvSim2Real对抗提示注入训练方法arXiv:cs.LG:AdvSim2Real:在网页世界模型中训练 Web Agent 抵御自适应提示注入
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv:cs.LGAdvSim2Real:在网页世界模型中训练 Web Agent 抵御自适应提示注入
论文提出 AdvSim2Real,在冻结的网页世界模型中让任务课程、注入攻击者与 Agent 共同进化,用于防御网页提示注入攻击。课程以 Agent 约半数成功率为奖励,攻击者仅在注入使成功翻转为失败时获得奖励。
- arXiv:cs.LGDMAST:让多模态 Web 智能体抵御跨模态攻击的双模态多阶段对抗安全训练
针对多模态 Web 智能体双流架构易被 DOM 注入同时污染截图与无障碍树的问题,研究者提出双模态多阶段对抗安全训练框架 DMAST,将智能体与攻击者建模为双人一般和马尔可夫博弈并三阶段共同训练。在分布外任务上,DMAST 将攻击成功率从 41.2% 降至 21.4%,任务完成率相对提升超 60%(6.2%→10.2%),优于现有基于训练的防御并可与提示词防御互补,代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。