跳到正文

#语音

今日 10 条
9月30日周三
  1. Every:最新文章(网页)55

    Monologue 发布:面向 Mac 和 Apple 设备的语音听写与会议转录应用

    Every 推出语音效率应用 Monologue,将任意应用内的语音听写、语音笔记和无机器人会议转录整合为一。支持 Mac、iPhone、iPad 和 Apple Watch,提供 100+ 语言、Mac 离线本地转录、自定义词典,并可通过 MCP、API 和 CLI 让 AI 智能体访问已保存的笔记。Monologue Pro 定价 $15/月或 $144/年,亦包含在 Every 订阅中。

  2. Baseten Base Labs:模型研究58

    Baseten 上线 Qwen3-TTS-12Hz 语音合成模型部署

    Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。

  3. Baseten Base Labs:模型研究23

    VoxCPM2 语音缓存演示:/v1/audio/speech 接口复用参考音频

    Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。

  4. Baseten Base Labs:模型研究49

    Orpheus TTS:Canopy Labs 的实时流式语音模型

    Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。

  5. Baseten Base Labs:模型研究27

    Baseten Orpheus 3B 的 WebSocket 流式 TTS 接入示例

    Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。

  6. HuggingFace Daily Papers(社区热门论文)41

    VoxMem:面向大型音频语言模型的多模态记忆基准

    研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。

  7. arXiv:cs.AI(全量分类)29

    AVIO:在音视频场景中学习添加与移除发声物体

    研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。

  8. arXiv:cs.CL(计算语言学,全量分类)48

    VoxParity:语音智能体在关键场景下能否听懂声音

    VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。

  9. arXiv:cs.CL(计算语言学,全量分类)50

    τ-Multilingual:跨语言语音智能体基准测试

    研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。

  10. Suno:Blog(网页)59

    Suno 宣布与 BMG 达成全球合作,共同开发首个与音乐行业协作的音乐模型

    Suno 首席执行官 Mikey Shulman 宣布与大型音乐公司 BMG 达成全球合作,该合作属于即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将合作打造艺术家与粉丝连接的新体验,并为选择加入的艺术家和词曲作者提供新的经济机会;双方还计划在 Suno: In Session 和 Spark 两个独立艺术家支持项目上深化合作。

  11. Sarvam AI(网页)41

    Sarvam 与 AI4Bharat 发布 Indic DiarBench:覆盖 22 种印度语言的联合说话人分离-ASR 基准数据集

    Sarvam 联合 AI4Bharat 发布 Indic DiarBench,这是首个覆盖全部 22 种印度表列语言、同时标注 ASR 与说话人分离的开源基准数据集,含 108 小时自然多人对话语音,每条录音 2-9 名说话人。数据集包含近场与远场会议、YouTube 野外对话,以及人工校验的转写文本和说话人时间戳,用于联合评估转写与说话人归属。

  12. MiniMax:Blog(网页)50

    MiniMax Speech 2.8 发布:原生音效标签与 10 秒高保真克隆

    MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。

  13. arXiv:cs.CL(计算语言学,全量分类)41

    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式语义端点检测器,将因果音频窗口直接映射为 Continue/Stop 决策,用于全双工语音交互中的自然轮次切换。它结合冻结语音编码器、轻量模态适配器与参数高效微调的语言模型,并引入置信度门控端点提交和边界聚焦难负样本采样。在 TurnBench 开发集零样本设置下,FD-VAD 以 FP<=0.10 取得最高 EOT 召回率 0.853。

  14. Gemini Notebook50

    Gemini Notebook 宣布 Live Voice Chat 已 100% 推送给所有 Pro 用户的移动端。此前其引用内容提到 Live Chat 已面向全部 Ultra 用户推送,支持与笔记本进行约 100 种语言的实时语音对话,由最新音频模型驱动,可就资料提问并获得几乎免手动操作的逐步指引。

    引用Gemini Notebook@Gemini_Notebook

    Live Chat is now 100% rolled out to all Ultra users on mobile 📱✨ Have real-time voice conversations with your notebooks across ~100 languages. Powered by our latest audio models, ask questions about your sources and get step-by-step guidance (almost) completely hands-free.

9月29日周二