跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Vaishnav Negi, Lev Sorokin, Soroosh Tayebi Arasteh, Andrea Stocco·· 1 天前AI 评分38

车载对话助手多轮对话的自动化评估框架

Automated Evaluation of Multi-Turn Dialogues in In-Car Conversational Assistants

AI 导读

研究者提出一套面向车载对话助手(ICA)的自动化多轮对话测试框架,将系统视为黑盒,通过闭环仿真结合策略引导用户模拟器、对抗策略管理器和两层 LLM 评判器进行评估。在六种 LLM 后端和十二名人工标注者参与的工业级 ICA 测试中,自动评判与人类标注高度一致,策略引导相比无引导仿真每段对话多发现 2.96 倍独特故障类型,故障对话数量增加一倍以上。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org