跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

30条精选相关主题多模态AI 视频产品更新

最新精选

第 1–20 条 · 共 30 条
9月30日周三
  1. xAI:News(网页)64

    xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API

    xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。

    推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。

  2. xAI:News(网页)62

    xAI 推出 Custom Voices,可克隆声音用于 Grok TTS 和 Voice Agent API

    xAI 推出 Custom Voices,录制约一分钟自然语音即可在两分钟内克隆声音,并可在 Grok Text to Speech 和 Voice Agent API 中使用。自定义声音继承全部 TTS 能力(speech tags、多语言输出、REST 与 WebSocket 流式),不额外收费。声音需通过口令朗读和说话人嵌入比对的两阶段验证,无法从已有录音克隆,也无法克隆他人声音。

    推荐理由:xAI 官方说明克隆流程、验证机制和 API 覆盖范围,读者可据此评估在语音应用中的可用性。

  3. xAI:News(网页)66

    xAI 发布 Voice Agent Builder 测试版:无需代码即可在 Grok Voice 上搭建生产级语音智能体

    xAI 宣布 Voice Agent Builder 进入测试版,这是一个运行在 Grok Voice 上的无代码平台,官方称约两分钟即可配置出可用的语音智能体。

    推荐理由:官方给出了完整功能、τ-voice Bench 排名和每分钟计费细节,读者可以据此评估它替代多 API 拼接语音方案的可行性。

  4. xAI:News(网页)68

    xAI 发布 Grok Voice Think Fast 2.0 语音模型

    xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。

    推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。

  5. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  6. Suno:Blog(网页)61

    Suno 推出 Audio Input 功能,任意声音都能生成歌曲

    Suno 发布 Audio Input 功能,Pro 与 Premier 用户可上传或录制音频,从任意声音生成歌曲。片段需在 6 至 60 秒之间,上传后可选择 Extend、设置时间戳、提供曲风并自备歌词。平台表示将屏蔽版权作品上传,含人声的输入将保持私密且不可搜索。

    推荐理由:官方说明了音频上传的使用方式与隐私限制,用户可据此判断如何把自己的声音素材变成 Suno 歌曲。

  7. Suno:Blog(网页)64

    Suno 发布 v4 音乐生成模型,面向 Pro 和 Premier 用户开放测试

    Suno 发布 v4 音乐生成模型,带来更干净的音频、更精准的歌词和更多样化的歌曲结构。新增 Remaster 可将旧模型曲目升级为 v4 音质,新增歌词助手 ReMi,改进封面生成,且 Covers 和 Personas 功能已由 v4 驱动。v4 目前以 beta 形式面向 Pro 和 Premier 用户开放,可在 suno.com 和 iOS 上使用。

    推荐理由:原文来自 Suno 官方,列出了 v4 的具体新功能和可用范围,读者可以据此判断是否升级使用。

  8. Suno:Blog(网页)79

    Suno 与 Warner Music Group 达成合作,将用授权音乐训练新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。

    推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。

9月25日周五
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月24日周四
  1. Greg Brockman78

    OpenAI 宣布 ChatGPT Voice 重大升级,现可使用邮箱、日历、Slack 等插件,并可由 GPT-6 Astra、Sol 和 Luna 驱动。语音功能还登陆网页端和移动端的 ChatGPT Work,用户可仅靠语音在浏览器中创建文档、幻灯片、网站和表格或处理复杂任务,今日起随最新版 App 全球推出。

    引用OpenAI@OpenAI

    We heard you loud and clear. ChatGPT Voice can now: - Use plugins like your email, calendar, and Slack. - Be powered by GPT-6 Astra, Sol, and Luna. - Be used in ChatGPT Work on web and mobile, so you can create docs, decks, sites, and spreadsheets or tackle complex tasks in the browser, just by talking. Rolling out globally today in the latest version of the app.

    推荐理由:OpenAI 官宣 ChatGPT Voice 可调用插件并进入 Work,读者可据此了解语音功能的实际使用边界。

9月23日周三
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月16日周三
  1. 蚂蚁 inclusionAI:HuggingFace 新模型62

    蚂蚁 inclusionAI 开源 Realtime-Venus 9B 全双工音视频交互系统

    蚂蚁 inclusionAI 发布 Realtime-Venus,一个支持主动音视频交互、异步委托和可打断全双工对话的开源系统,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点。

    推荐理由:模型卡给出了 Realtime-Venus 的架构组成、全双工与异步委托能力及完整用法,读者可以据此评估它在实时音视频交互场景的可用性。

9月15日周二
9月10日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)65

    OpenAI 在 API 中推出 GPT‑Live‑1 语音模型

    OpenAI 在 API 中推出 GPT‑Live‑1,提供自然的全双工语音对话能力。模型具备更强的指令遵循、自定义语音和电话(telephony)支持。

    推荐理由:官方公告给出 GPT‑Live‑1 的核心能力清单,读者可以据此评估其语音应用场景的适配性。

8月27日周四
7月15日周三
  1. Hugging Face:Blog(RSS)60

    Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量

    Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。

    推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。