跳到正文

#语音

今日 10 条
今天10月1日周四
  1. IT之家(RSS)29

    罗技发布 Zone Vibe Pro 头戴式耳机:40mm 驱动单元,支持全天候应用场景

    罗技发布 Zone Vibe Pro 头戴式无线耳机,内置 40mm 驱动单元和 6 个全向 MEMS 麦克风,支持自适应 ANC 降噪与 AI 驱动的语音隔离技术。该耳机聆听续航 66hr(关闭 ANC)/ 30hr(开启 ANC),通话续航 20hr(关闭 ANC)/ 18hr(开启 ANC),标准版定价 259.99 美元,头带、耳垫、电池均可更换。

  2. 🚨 AI News | TestingCatalog56

    Inworld 宣布收购 Ultravox,一个用于构建实时语音智能体的平台,可听、推理、调用工具并在对话中处理轮次和打断。Ultravox 上内置的 Inworld 声音现已运行在 Realtime TTS-2 上,现有 voice ID 无需迁移或修改代码即可继续使用,TTS-2 还为 Ultravox 智能体增加自然语言引导能力。

    引用Inworld AI@inworld

    We’re excited to announce that @ultravox_dot_ai is now part of Inworld. Ultravox is the platform developers use to build real-time voice agents. We've worked with the team for a while through our TTS partnership, and today members of the team that built it are joining Inworld to keep developing it.

  3. Rohan Paul50

    Inworld 宣布收购开发者用于构建实时语音智能体的平台 Ultravox,原团队成员加入 Inworld 继续开发。Ultravox 已将内置语音迁移到 Realtime TTS-2,该模型支持用内联指令在特定语段调整语速、语气和情感表达,例如在讲解复杂步骤时放慢语速再恢复正常。

    引用Inworld AI@inworld

    We’re excited to announce that @ultravox_dot_ai is now part of Inworld. Ultravox is the platform developers use to build real-time voice agents. We've worked with the team for a while through our TTS partnership, and today members of the team that built it are joining Inworld to keep developing it.

  4. Elon Musk47

    @Grok @Bot 的新功能 引用推文内容概括: Grok Bot 新功能: 0:19 团队机器人——创建与团队成员共享的机器人 1:10 财务——通过 @plaid 搜索和管理你的财务 1:32 语音通话——@bot 可在通话中搜索聊天记录,并能优雅处理打断 在 @X 上点赞可触发特殊机器人动画!

    引用matt palmer@mattyp

    What's new in Grok Bot 0:19 Team bots - create bots shared with your team members 1:10 Finances - search and manage your finances with @plaid 1:32 Voice calls - @bot can search chats during calls and gracefully handles interruptions Like this for a special bot animation on @X!

9月30日周三
  1. xAI:News(网页)64

    xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API

    xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。

    推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。

  2. xAI:News(网页)62

    xAI 推出 Custom Voices,可克隆声音用于 Grok TTS 和 Voice Agent API

    xAI 推出 Custom Voices,录制约一分钟自然语音即可在两分钟内克隆声音,并可在 Grok Text to Speech 和 Voice Agent API 中使用。自定义声音继承全部 TTS 能力(speech tags、多语言输出、REST 与 WebSocket 流式),不额外收费。声音需通过口令朗读和说话人嵌入比对的两阶段验证,无法从已有录音克隆,也无法克隆他人声音。

    推荐理由:xAI 官方说明克隆流程、验证机制和 API 覆盖范围,读者可据此评估在语音应用中的可用性。

  3. xAI:News(网页)66

    xAI 发布 Voice Agent Builder 测试版:无需代码即可在 Grok Voice 上搭建生产级语音智能体

    xAI 宣布 Voice Agent Builder 进入测试版,这是一个运行在 Grok Voice 上的无代码平台,官方称约两分钟即可配置出可用的语音智能体。

    推荐理由:官方给出了完整功能、τ-voice Bench 排名和每分钟计费细节,读者可以据此评估它替代多 API 拼接语音方案的可行性。

  4. xAI:News(网页)68

    xAI 发布 Grok Voice Think Fast 2.0 语音模型

    xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。

    推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。

  5. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  6. Suno:Blog(网页)61

    Suno 推出 Audio Input 功能,任意声音都能生成歌曲

    Suno 发布 Audio Input 功能,Pro 与 Premier 用户可上传或录制音频,从任意声音生成歌曲。片段需在 6 至 60 秒之间,上传后可选择 Extend、设置时间戳、提供曲风并自备歌词。平台表示将屏蔽版权作品上传,含人声的输入将保持私密且不可搜索。

    推荐理由:官方说明了音频上传的使用方式与隐私限制,用户可据此判断如何把自己的声音素材变成 Suno 歌曲。

  7. Suno:Blog(网页)64

    Suno 发布 v4 音乐生成模型,面向 Pro 和 Premier 用户开放测试

    Suno 发布 v4 音乐生成模型,带来更干净的音频、更精准的歌词和更多样化的歌曲结构。新增 Remaster 可将旧模型曲目升级为 v4 音质,新增歌词助手 ReMi,改进封面生成,且 Covers 和 Personas 功能已由 v4 驱动。v4 目前以 beta 形式面向 Pro 和 Premier 用户开放,可在 suno.com 和 iOS 上使用。

    推荐理由:原文来自 Suno 官方,列出了 v4 的具体新功能和可用范围,读者可以据此判断是否升级使用。

  8. Suno:Blog(网页)37

    Suno 正式推出 Android 版

    Suno 正式登陆 Android,这是其首个 Android 版本,用户可通过文字提示词创作音乐、发现社区新曲目并分享作品。该版本已包含核心功能,官方表示后续还将持续更新。

  9. Sarvam AI(网页)42

    Sarvam AI 推出 Sarvam Studio:面向多语言内容转换的智能体平台

    Sarvam AI 推出 Sarvam Studio,一个将语音、文本和文档工作流整合到同一工作空间的多语言内容转换平台,支持 AI 视频配音与智能体文档翻译。其配音在约 280 次与 ElevenLabs、YouTube Dub、Rask AI 的盲测对比中获得最高整体偏好,说话人相似度平均得分 0.88。该平台目前通过受控早期 beta 向政府、教育、媒体和出版领域的少量生产合作伙伴开放。

  10. Sarvam AI(网页)49

    Sarvam AI 发布 Sarvam Edge,将语音识别与合成模型搬上端侧

    Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。

  11. Suno:Blog(网页)79

    Suno 与 Warner Music Group 达成合作,将用授权音乐训练新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。

    推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。

  12. Suno:Blog(网页)55

    Suno 发布 Voices 使用指南,给出 6 条提升音色质量建议

    Suno 官方发布 Voices 功能的 6 条使用建议,帮助用户获得更高质量的声音效果。建议包括在安静环境录音、录音前练习、不必追求完美、尽量录制更长参考音频(至少一分钟)、根据曲风匹配声音,并尝试不同曲风。Voices 现已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。

  13. Liquid AI 模型与工程博客(网页)21

    Liquid AI 面向汽车行业的本地多模态车载 AI 助手方案

    Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。

  14. Liquid AI 模型与工程博客(网页)36

    Liquid AI 开源 LFM 与 LEAP SDK 示例、教程及配套工具仓库

    Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。