跳到正文

#语音

今日 1 条
今天10月1日周四
9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  2. arXiv:cs.AI(全量分类)29

    AVIO:在音视频场景中学习添加与移除发声物体

    研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。

  3. arXiv:cs.CL(计算语言学,全量分类)48

    VoxParity:语音智能体在关键场景下能否听懂声音

    VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。

  4. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。

  5. Sarvam AI(网页)41

    Sarvam 与 AI4Bharat 发布 Indic DiarBench:覆盖 22 种印度语言的联合说话人分离-ASR 基准数据集

    Sarvam 联合 AI4Bharat 发布 Indic DiarBench,这是首个覆盖全部 22 种印度表列语言、同时标注 ASR 与说话人分离的开源基准数据集,含 108 小时自然多人对话语音,每条录音 2-9 名说话人。数据集包含近场与远场会议、YouTube 野外对话,以及人工校验的转写文本和说话人时间戳,用于联合评估转写与说话人归属。

  6. arXiv:cs.CL(计算语言学,全量分类)41

    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式语义端点检测器,将因果音频窗口直接映射为 Continue/Stop 决策,用于全双工语音交互中的自然轮次切换。它结合冻结语音编码器、轻量模态适配器与参数高效微调的语言模型,并引入置信度门控端点提交和边界聚焦难负样本采样。在 TurnBench 开发集零样本设置下,FD-VAD 以 FP<=0.10 取得最高 EOT 召回率 0.853。

9月24日周四
  1. Apple Machine Learning Research(RSS)38

    Apple 提出半监督联邦 ASR 实用方案:在线伪标签与服务器更新稳定化

    Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务器端标注数据锚定更新两条耦合设计轴缩小与全监督联邦学习的差距。该方案在 11 组对比中 9 组优于最强先前方法,域内平均提升 20.8%、跨域提升 10.0%。服务器必须在轮次间持续用标注数据训练,这一交错更新比种子模型更决定收敛,且稳定化需求取决于种子数据分散度及其与客户端数据的重叠程度。

  2. Apple Machine Learning Research(RSS)37

    Apple 如何通过潜空间蒸馏压缩流式神经音频编码器

    Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。

9月10日周四
7月15日周三
  1. Hugging Face:Blog(RSS)60

    Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量

    Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。

    推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。

5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

4月21日周二
3月19日周四
2月23日周一