跳到正文
热点事件持续更新

SkillPoison:用成功经验渐进式投毒LLM技能

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Lizhi Zhang 等作者提出 SkillPoison 攻击框架,针对自改进 LLM Agent 的技能提取流程,仅利用通过验证的成功经验即可投毒,无需任何单条轨迹包含恶意内容。作者称在三个基准上的实验显示,该框架达到 95.71% 的攻击成功率,且所有注入的经验仍保持任务正确,能通过验证和词法检查。 这意味着依赖经验验证与词法审查来过滤恶意轨迹的防御方式,可能无法识别此类投毒。作者已公开代码、数据与实现细节。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    SkillPoison:基于成功经验的渐进式技能投毒攻击框架

    论文提出 SkillPoison,一种针对自改进 LLM Agent 的渐进式技能投毒框架,仅利用通过验证的成功经验即可实施攻击,无需任何单条轨迹包含恶意内容。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。