arXiv:cs.AI(全量分类)· Lei Ma, Dennis Hofmann, Haowen Xu, Joshua DeOliveira, Peter VanNostrand, Lei Cao, Elke Rundensteiner·· 1 天前AI 评分42
MAADBench:面向多智能体系统的可刷新异常检测基准
MAADBench: The Refreshable Paradigm for Anomaly Detection in Multi-Agent Systems
AI 导读
针对 LLM 多智能体系统 41%-87% 的失败率,研究者提出 MAADBench——首个可刷新的 MAS 异常检测基准,通过约 10^37 任务空间的采样耦合生成任务缓解任务泄漏,并支持在可配置 LLM 骨干下刷新轨迹生成、自动提供免成本确定性的步骤级标签。
来源:arXiv:cs.AI(全量分类) · arxiv.org