arXiv:cs.CL(计算语言学,全量分类)· Zheyuan Zhang, Mengyuan Chao, Ke Xiao, Ziyi Chen, Daoan Zhang, Yan Zhang, Yanfang Ye, Wei Xu·· 3 小时前AI 评分45
Drift-Bench++:在沟通失误与意图演变下评测 LLM 智能体的交互式意图对齐
Beyond Oracle Communication: Benchmarking Interactive Intent Alignment Under Miscommunication and Evolving User Intent
AI 导读
研究者提出 Drift-Bench++,一个面向交互式意图对齐的可执行基准构建流程,用于评测 LLM 智能体在用户沟通失误、目标变化和耐心有限时能否持续追踪用户当前意图。配套的 GRIP 评测协议覆盖任务落地、用户真实性、提问有效性和意图演变适应四个维度。实验显示更强的交互始终有帮助,但仍远未达到 oracle 水平,且在 ProdAgent 线上会话中验证了这类失败普遍存在且影响显著。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org