跳到正文
热点事件持续更新

GIVE-KWS视觉证据门控融合方法提出

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Ming-Hsiang Hu、Kuan-Tang Huang、Hung-Shin Lee、Berlin Chen 提交论文,提出 GIVE-KWS 噪声鲁棒关键词识别方法,其融合阶段 GIVE 通过门控交叉注意力让查询音频以唇动为条件。论文称,在 -10 dB 下该方法将未见关键词的 EER 降低 72.9%,平均降低 62.8%。 研究称视觉鲁棒性依赖两个条件:带音素信息的视觉表征,以及注入式融合而非缩放音频特征。在带音素编码器下,注入比掩码在 -10 dB 时带来 4.0–9.3 dB 的有效 SNR 增益;编码器缺乏音素信息时增益近乎消失。该论文已提交至 ICASSP 2027。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.CL
    GIVE-KWS:用门控注入视觉证据实现抗噪的示例查询关键词识别

    GIVE-KWS 通过门控交叉注意力将唇动视觉证据注入查询音频,在 -10 dB 下将未见关键词的 EER 降低 72.9%,平均降低 62.8%。研究发现视觉鲁棒性依赖两个条件:带音素信息的视觉表征,以及注入式融合而非缩放音频特征。在带音素编码器下,注入比掩码在 -10 dB 时带来 4.0-9.3 dB 的有效 SNR 增益;编码器缺乏音素信息时增益近乎消失。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。