跳到正文
热点事件持续更新

PU学习框架用于Agent安全误报审计

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

研究者Xichen Yan等人提出一种两阶段正例-无标注(PU)学习框架,用于审计语言模型智能体安全监控的误报。该框架在拟合时不需要误报安全标签,也不改动底层监控器。 作者称,该方法在主流安全监控器上取得0.6444的macro AUPRC,比八个PU基线高出5.27–16.98个百分点;相比最强基线PULDA,在5%审查预算下多召回33.3%的误报。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    面向智能体安全误报审计的正例-无标注学习框架

    研究者提出一种两阶段正例-无标注(PU)学习框架,用于审计语言模型智能体安全监控的误报,无需误报安全标签且不改动底层监控器。该方法在主流安全监控器上取得 0.6444 的 macro AUPRC,比八个 PU 基线高出 5.27–16.98 个百分点;相比最强基线 PULDA,在 5% 审查预算下多召回 33.3% 的误报。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。