跳到正文
热点事件持续更新

TTS噪声清晰度提升的两条技术路径

2 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Seymanur Akti 与 Alexander Waibel 提交论文,提出 prompt-relative 动态激活引导机制,无需重新训练即可控制预训练 TTS 模型,模拟 Lombard 效应中的发声用力增强与超清晰发音。 论文报告称,在已见与未见说话人及多语言测试中,该方法系统改变 Lombard 相关声学特征,保持 89-95% 的说话人相似度,并在 1 dB SNR 背景噪声下将词错误率降低 7-22%。 同一批研究者另一篇论文扩展 F5-TTS,提出零样本合成 Lombard 语音的可控系统,无需 Lombard 专用训练数据,用可学习风格嵌入并以 PCA 定位 Lombard 属性方向,实现发声力度与清晰度的可解释控制。该文报告称方法保持说话人身份与自然度,提升噪声下可懂度,并可泛化到未见说话人。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展

  1. 10月7日 12:00 · 1 篇报道
    提出动态激活引导提升噪声下语音清晰度
    arXiv:cs.CL:Loud and Clear:用动态激活引导让 TTS 模型在噪声环境中说出更清晰的语音
  2. 10月7日 12:00 · 1 篇报道
    提出零样本可控Lombard语音合成方法
    arXiv:cs.CL:F5-TTS 零样本 Lombard 语音合成:用可控风格嵌入调控发声力度

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.CL
    F5-TTS 零样本 Lombard 语音合成:用可控风格嵌入调控发声力度

    研究者扩展 F5-TTS,提出一种零样本合成 Lombard 语音的可控 TTS 系统,无需 Lombard 专用训练数据。该方法引入可学习的风格嵌入,并用 PCA 分析其潜空间以定位与 Lombard 属性相关的方向,从而对发声力度和发音清晰度实现可解释控制并生成不同 Lombard 等级语音。实验显示该方法保持说话人身份与自然度,提升噪声下的可懂度,并可泛化到未见过的说话人。

  2. arXiv:cs.CL
    Loud and Clear:用动态激活引导让 TTS 模型在噪声环境中说出更清晰的语音

    研究提出一种 prompt-relative 激活引导机制,无需重新训练即可动态控制预训练 TTS 模型,模拟 Lombard 效应中的发声用力增强与超清晰发音。在已见和未见说话人及多语言测试中,该方法系统改变 Lombard 相关声学特征,保持 89-95% 的说话人相似度,并在 1 dB SNR 背景噪声下将 WER 降低 7-22%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。