跳到正文
热点事件持续更新

arXiv论文提出ObligationBench与ObligationGuard

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Youwei Feng等作者在arXiv发表论文,指出现有LLM智能体安全只关注识别被禁止的操作不够,还需识别未履行的安全关键义务。作者称,在GLM-5.3轨迹中,56.92%含未履行义务,仅30.00%含违禁操作。 论文提出ObligationBench,称其为首个评估义务识别能力的基准,包含240条经专家验证的轨迹,覆盖问题解决、功能开发和终端操作三类场景。 论文同时提出ObligationGuard模型。作者报告,现有模型在该基准上最高召回率和精确匹配率仅为48.97%和10.00%;ObligationGuard达到57.52%的召回率和21.67%的精确匹配率,在两项指标上均超过所有被评估模型。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    Agent 安全不止防违禁行为:ObligationGuard 与 ObligationBench 识别未履行义务

    研究指出,仅识别被禁止的操作不足以保障 LLM 智能体安全,还需识别未履行的安全关键义务;在 GLM-5.3 轨迹中 56.92% 含未履行义务,仅 30.00% 含违禁操作。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。