跳到正文
热点事件持续更新

FASTDIAR:帧级流式说话人分离系统

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Nikita Torgashov 等作者提交论文预印本,提出 FASTDIAR:把当前最先进的说话人识别架构改造成因果帧级编码器,只读取音频流一次,基于过去两秒的窗口每 80 毫秒输出一个嵌入向量,并配合在线聚类,每次更新以流的自相似性为门控条件。 作者称,该系统仅通过 utterance 级教师模型在模拟和域外混合数据上蒸馏训练,并以一组固定超参数评估;在低重叠基准上以亚秒级延迟成为最准确的流式说话人分离器,说话人数量增长时性能退化远小于基于缓存的系统,在单 CPU 线程上运行速度达实时的 5 倍。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    FASTDIAR:面向流式说话人分离的帧级说话人编码器

    FASTDIAR 将 SOTA 说话人识别架构改造为因果帧级编码器,单次读取音频流,基于过去两秒窗口每 80ms 输出一个嵌入向量,并配合在线聚类。该系统仅通过 utterance 级教师模型的蒸馏训练,在低重叠基准上以亚秒级延迟成为最准确的流式说话人分离器,说话人数量增长时性能退化远小于基于缓存的系统,单 CPU 线程上运行速度达实时的 5 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。