跳到正文

#语音

今日 0 条
9月30日周三
  1. xAI:News(网页)64

    xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API

    xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。

    推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。

  2. xAI:News(网页)68

    xAI 发布 Grok Voice Think Fast 2.0 语音模型

    xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。

    推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。

  3. Sarvam AI(网页)49

    Sarvam AI 发布 Sarvam Edge,将语音识别与合成模型搬上端侧

    Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。

  4. Liquid AI 模型与工程博客(网页)36

    Liquid AI 开源 LFM 与 LEAP SDK 示例、教程及配套工具仓库

    Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。

  5. Baseten Base Labs:模型研究58

    Baseten 上线 Qwen3-TTS-12Hz 语音合成模型部署

    Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。

9月29日周二
9月28日周一
9月25日周五
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。

    推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。

9月23日周三
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型给出语音克隆、逐行导演与多语言覆盖的具体能力,可据此判断语音生成工作流的变化。

9月17日周四
9月16日周三
  1. 蚂蚁 inclusionAI:HuggingFace 新模型62

    蚂蚁 inclusionAI 开源 Realtime-Venus 9B 全双工音视频交互系统

    蚂蚁 inclusionAI 发布 Realtime-Venus,一个支持主动音视频交互、异步委托和可打断全双工对话的开源系统,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点。

    推荐理由:模型卡给出了 Realtime-Venus 的架构组成、全双工与异步委托能力及完整用法,读者可以据此评估它在实时音视频交互场景的可用性。

9月11日周五
8月27日周四
8月25日周二
8月13日周四
8月11日周二
5月12日周二
  1. Lilian Weng39

    过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

5月11日周一
4月23日周四