跳到正文
热点事件观察中

DART 框架检测多轮 LLM 智能体安全风险

1 篇报道1 个报道来源2 天前更新

先了解这件事

报道摘要

研究者提出 DART 框架,通过监测智能体内部表示的累积转变来检测并归因多轮攻击,再用针对性提醒进行干预。在六个模型和两个基准上,DART 将 MT-AgentRisk 的攻击成功率从 84% 降至 25%(平均误报率 12%),ASEval 上从 97% 降至 52%;在 MT-AgentRisk 上全面优于现有多轮防御 ToolShield(后者仅 55%)。

摘自 arXiv:cs.LG

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. arXiv:cs.LG
    DART:通过表示转变检测多轮 LLM 智能体的安全风险

    研究者提出 DART 框架,通过监测智能体内部表示的累积转变来检测并归因多轮攻击,再用针对性提醒进行干预。在六个模型和两个基准上,DART 将 MT-AgentRisk 的攻击成功率从 84% 降至 25%(平均误报率 12%),ASEval 上从 97% 降至 52%;在 MT-AgentRisk 上全面优于现有多轮防御 ToolShield(后者仅 55%)。

本事件热度走势

可比范围当前
3
可比范围峰值
710月4日 01:00
近 24 小时变化
-51%

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。