跳到正文
原文
arXiv:cs.AI(全量分类)· Lei Ma, Dennis Hofmann, Haowen Xu, Joshua DeOliveira, Peter VanNostrand, Lei Cao, Elke Rundensteiner·· 1 天前AI 评分42

MAADBench:面向多智能体系统的可刷新异常检测基准

MAADBench: The Refreshable Paradigm for Anomaly Detection in Multi-Agent Systems

AI 导读

针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。

来源:arXiv:cs.AI(全量分类) · arxiv.org