arXiv:cs.CL(计算语言学,全量分类)· Bhavik Mangla·· 1 天前AI 评分48
VoxParity:语音智能体在关键场景下能否听懂声音
Almost Human, Except When It Matters: VoxParity and the Decisions a Voice Should Change
AI 导读
VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org