跳到正文
热点事件持续更新

研究者提出RAISED框架抵御提示注入

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者 Mohamed Dhouib 等发布论文,提出训练框架 RAISED(Robust Attack Invariance through Self-Distillation),用于抵御工具调用型 LLM 智能体面临的间接提示词注入攻击。该框架结合自生成与自蒸馏:模型先在自造的工具使用场景中生成轨迹,再通过自蒸馏让学生在干净与注入版本的同一轨迹上对齐教师的干净上下文行为。 论文称,该方法大幅降低工具响应中提示词注入的攻击成功率,同时在智能体与通用基准上保持原有能力,优于此前的训练期防御方案。该研究针对的问题是现有训练期防御会损害智能体通用能力。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    RAISED:用自蒸馏提升 LLM 智能体对提示词注入的鲁棒性

    针对工具调用型 LLM 智能体易受间接提示词注入攻击、且现有训练期防御会损害通用能力的问题,研究者提出训练框架 RAISED,结合自生成与自蒸馏,让模型先在自造的工具使用场景中生成轨迹,再通过自蒸馏令学生在干净与注入版本的同一轨迹上对齐教师的干净上下文行为。该方法大幅降低工具响应中提示词注入的攻击成功率,同时在智能体与通用基准上保持原有能力,优于此前的训练期防御方案。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。