跳到正文
热点事件持续更新

多语言语音模型音系干扰及WLE修复

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Moran Yanuka、Raja Giryes、Moris Alper 发表论文,指出音素级语音模型存在系统性失败模式“音系干扰”:模型默认输入为单一语言并强加其音系,覆盖与之冲突的音素决策。在语码切换输入上,两个音素识别器和一个音素条件 TTS 模型丢失了 32% 至 79% 的此类音素,而对两种语言共有的音素丢失远少。 研究者提出窗口化语言估计(WLE),在推理时修复语言估计。据论文,WLE 在三种模型上消除了 34% 至 69% 的干扰,且识别器的单语性能基本不变。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    多语言语音模型中的音系干扰问题

    音素级语音模型存在一种系统性失败模式——音系干扰:模型默认输入为单一语言并强加其音系,覆盖与之冲突的音素决策。在语码切换输入上,两个音素识别器和一个音素条件 TTS 模型丢失了 32% 至 79% 的此类音素,而对两种语言共有的音素丢失远少。研究者提出窗口化语言估计(WLE),在推理时修复语言估计,在三种模型上消除 34% 至 69% 的干扰,且识别器的单语性能基本不变。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。