VoxParity基准测试语音代理对音频线索的响应能力
先了解这件事
2026年9月30日,arXiv cs.CL 发布 VoxParity 基准测试,用于检验语音智能体是否会因听到的声音而改变行动。该基准包含 183 个场景,覆盖 14 个行业,做法是保持同一段文字不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。在 23 个可跑纯文本的系统中,只有 11 个通过。测试还发现错误偏向文字:当音频要求保护时,28 个系统执行常规请求的比例为 41%,而在干净通话中过度反应仅为 12%。2026年10月1日,HuggingFace Daily Papers 将其列为社区热门论文,复述了同一组数据:23 个语音智能体仅 11 个能根据音频线索改变行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化包括求救信号、儿童声音下注、惊恐低语。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- HuggingFace Daily Papers(社区热门论文)VoxParity 基准:23 个语音智能体仅 11 个能根据音频线索改变行动
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
- arXiv:cs.CL(计算语言学,全量分类)VoxParity:语音智能体在关键场景下能否听懂声音
VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。
本事件热度走势
当前热度 15·可比范围峰值 15(10月1日 11:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。