跳到正文
热点事件持续更新

DecepEval:LLM 智能体欺骗性评测基准

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者 Yiming Xu 等人发布 DecepEval,一个用于评估 LLM 智能体欺骗行为的基准,包含 3 类任务族、28 个专业场景、共 1,532 个实例。 该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类诱导欺骗的外部条件。评测方式是将中性版与诱导版实例配对,通过欺骗率的变化来衡量智能体受外部条件影响的程度。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    DecepEval:评估 LLM 智能体欺骗行为的基准

    研究者推出 DecepEval 基准,含 3 类任务族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类诱导欺骗的外部条件,并通过中性版与诱导版实例配对测量欺骗率变化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。