跳到正文

#语音

今日 0 条
9月30日周三
  1. Suno:Blog(网页)59

    Suno 宣布与 BMG 达成全球合作,共同开发首个与音乐行业协作的音乐模型

    Suno 首席执行官 Mikey Shulman 宣布与大型音乐公司 BMG 达成全球合作,该合作属于即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将合作打造艺术家与粉丝连接的新体验,并为选择加入的艺术家和词曲作者提供新的经济机会;双方还计划在 Suno: In Session 和 Spark 两个独立艺术家支持项目上深化合作。

  2. MiniMax:Blog(网页)50

    MiniMax Speech 2.8 发布:原生音效标签与 10 秒高保真克隆

    MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。

9月29日周二
9月28日周一
  1. NVIDIA AI48

    工程师之间的合作最棒了 🙌 恭喜 @AIatMeta 推出 Muse Realtime Avatar!我们与他们的团队合作,让模型更高效,这样虚拟形象在你与它对话时就能跟上节奏。

    引用AI at Meta@AIatMeta

    @finkd just unveiled Muse Realtime Avatar, our real-time embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars. Muse Realtime Avatar enables an entirely new range of interactions in @Muse, starting with real-time conversations. 🧵👇 #MetaConnect

9月26日周六
9月25日周五
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月24日周四
  1. Apple Machine Learning Research(RSS)38

    Apple 提出半监督联邦 ASR 实用方案:在线伪标签与服务器更新稳定化

    Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务器端标注数据锚定更新两条耦合设计轴缩小与全监督联邦学习的差距。该方案在 11 组对比中 9 组优于最强先前方法,域内平均提升 20.8%、跨域提升 10.0%。服务器必须在轮次间持续用标注数据训练,这一交错更新比种子模型更决定收敛,且稳定化需求取决于种子数据分散度及其与客户端数据的重叠程度。

  2. Apple Machine Learning Research(RSS)37

    Apple 如何通过潜空间蒸馏压缩流式神经音频编码器

    Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。

9月23日周三
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月16日周三
  1. 蚂蚁 inclusionAI:HuggingFace 新模型62

    蚂蚁 inclusionAI 开源 Realtime-Venus 9B 全双工音视频交互系统

    蚂蚁 inclusionAI 发布 Realtime-Venus,一个支持主动音视频交互、异步委托和可打断全双工对话的开源系统,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点。

    推荐理由:模型卡给出了 Realtime-Venus 的架构组成、全双工与异步委托能力及完整用法,读者可以据此评估它在实时音视频交互场景的可用性。

9月15日周二
9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    OpenAI 在 API 中推出 GPT‑Live‑1 语音模型

    OpenAI 在 API 中推出 GPT‑Live‑1,提供自然的全双工语音对话能力。模型具备更强的指令遵循、自定义语音和电话(telephony)支持。

    推荐理由:官方公告给出 GPT‑Live‑1 的核心能力清单,读者可以据此评估其语音应用场景的适配性。

  2. Apple:Newsroom(RSS)56

    Apple 发布 AirPods 5,开放式耳机的主动降噪提升

    Apple 发布 AirPods 5,开放式耳机设计的主动降噪比 AirPods 4 主动降噪版多消除最多 50% 的外部噪声,并采用全新多孔声学架构和新一代 Adaptive EQ。新品搭配 Siri AI(随 iOS 27 测试版推出)支持免提个人情境问答、头部手势响应和 Live Translation,售价 129 美元,无线充电盒版 149 美元,9 月 18 日正式开售。

9月2日周三
8月27日周四
8月11日周二
  1. Sierra:Blog(RSS)50

    Sierra 为 Agent 推出开箱即用的 IVR 电话导航能力

    Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。

8月8日周六
  1. Sierra:Blog(RSS)44

    Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格

    Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,覆盖多语言、多品牌与多市场场景。该功能结合语音、个性与语言感知行为,并接入 Sierra Agent SDK,支持调整语速、应对打断及对话中切换语音或语言。Sierra 称某智能体搭配自然语音与人格后问题解决率提升近 50%,Voice Personas 现已上线。

7月15日周三
  1. Hugging Face:Blog(RSS)60

    Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量

    Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。

    推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。

7月1日周三
6月23日周二
6月9日周二
  1. Google DeepMind:Blog(RSS)76

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。

    推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。

5月29日周五
5月19日周二
  1. Sierra:Blog(RSS)34

    Sierra 谈语音 AI 的转录难题:多供应商集成与上下文感知如何降低错误率

    Sierra 构建了一套动态路由多家供应商的转录平台,通过并行查询多个转录模型并融合输出,内部基准显示可将话语错误率平均降低约 25%,在转录提升空间更大的语言中最高降低 37%。该平台还支持 70 多种语言,并将对话上下文注入转录过程,使金融服务智能体的输入验证率提升超 25%,整体解决率最高提升 1%、重大转录错误最多减少 15%。

5月14日周四
5月11日周一
5月5日周二
  1. OpenAI Developers(RSS)66

    OpenAI 发布 gpt-realtime-2 语音模型提示词指南

    OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。

    推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。