DecepEval:LLM 智能体欺骗性评测基准
热点事件持续更新
DecepEval:LLM 智能体欺骗性评测基准
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
研究者 Yiming Xu 等人发布 DecepEval,一个用于评估 LLM 智能体欺骗行为的基准,包含 3 类任务族、28 个专业场景、共 1,532 个实例。 该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类诱导欺骗的外部条件。评测方式是将中性版与诱导版实例配对,通过欺骗率的变化来衡量智能体受外部条件影响的程度。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
DecepEval:评估 LLM 智能体欺骗行为的基准报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGDecepEval:评估 LLM 智能体欺骗行为的基准
研究者推出 DecepEval 基准,含 3 类任务族、28 个专业场景共 1,532 个实例,用于评估 LLM 智能体的欺骗行为。该基准基于经典欺诈理论提出 LLM Deception Diamond 框架,刻画压力、激励、机会与冲突四类诱导欺骗的外部条件,并通过中性版与诱导版实例配对测量欺骗率变化。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。