跳到正文

#语音

今日 0 条
9月30日周三
  1. xAI:News(网页)64

    xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API

    xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。

    推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。

  2. xAI:News(网页)62

    xAI 推出 Custom Voices,可克隆声音用于 Grok TTS 和 Voice Agent API

    xAI 推出 Custom Voices,录制约一分钟自然语音即可在两分钟内克隆声音,并可在 Grok Text to Speech 和 Voice Agent API 中使用。自定义声音继承全部 TTS 能力(speech tags、多语言输出、REST 与 WebSocket 流式),不额外收费。声音需通过口令朗读和说话人嵌入比对的两阶段验证,无法从已有录音克隆,也无法克隆他人声音。

    推荐理由:xAI 官方说明克隆流程、验证机制和 API 覆盖范围,读者可据此评估在语音应用中的可用性。

  3. xAI:News(网页)66

    xAI 发布 Voice Agent Builder 测试版:无需代码即可在 Grok Voice 上搭建生产级语音智能体

    xAI 宣布 Voice Agent Builder 进入测试版,这是一个运行在 Grok Voice 上的无代码平台,官方称约两分钟即可配置出可用的语音智能体。

    推荐理由:官方给出了完整功能、τ-voice Bench 排名和每分钟计费细节,读者可以据此评估它替代多 API 拼接语音方案的可行性。

  4. xAI:News(网页)68

    xAI 发布 Grok Voice Think Fast 2.0 语音模型

    xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。

    推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。

  5. Suno:Blog(网页)76

    Suno 发布 v3 音乐模型

    Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。

    推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。

  6. Suno:Blog(网页)61

    Suno 推出 Audio Input 功能,任意声音都能生成歌曲

    Suno 发布 Audio Input 功能,Pro 与 Premier 用户可上传或录制音频,从任意声音生成歌曲。片段需在 6 至 60 秒之间,上传后可选择 Extend、设置时间戳、提供曲风并自备歌词。平台表示将屏蔽版权作品上传,含人声的输入将保持私密且不可搜索。

    推荐理由:官方说明了音频上传的使用方式与隐私限制,用户可据此判断如何把自己的声音素材变成 Suno 歌曲。

  7. Suno:Blog(网页)64

    Suno 发布 v4 音乐生成模型,面向 Pro 和 Premier 用户开放测试

    Suno 发布 v4 音乐生成模型,带来更干净的音频、更精准的歌词和更多样化的歌曲结构。新增 Remaster 可将旧模型曲目升级为 v4 音质,新增歌词助手 ReMi,改进封面生成,且 Covers 和 Personas 功能已由 v4 驱动。v4 目前以 beta 形式面向 Pro 和 Premier 用户开放,可在 suno.com 和 iOS 上使用。

    推荐理由:原文来自 Suno 官方,列出了 v4 的具体新功能和可用范围,读者可以据此判断是否升级使用。

  8. Suno:Blog(网页)37

    Suno 正式推出 Android 版

    Suno 正式登陆 Android,这是其首个 Android 版本,用户可通过文字提示词创作音乐、发现社区新曲目并分享作品。该版本已包含核心功能,官方表示后续还将持续更新。

  9. Suno:Blog(网页)79

    Suno 与 Warner Music Group 达成合作,将用授权音乐训练新一代模型

    Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。

    推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。

  10. Suno:Blog(网页)55

    Suno 发布 Voices 使用指南,给出 6 条提升音色质量建议

    Suno 官方发布 Voices 功能的 6 条使用建议,帮助用户获得更高质量的声音效果。建议包括在安静环境录音、录音前练习、不必追求完美、尽量录制更长参考音频(至少一分钟)、根据曲风匹配声音,并尝试不同曲风。Voices 现已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。

  11. Liquid AI 模型与工程博客(网页)21

    Liquid AI 面向汽车行业的本地多模态车载 AI 助手方案

    Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。

  12. Liquid AI 模型与工程博客(网页)36

    Liquid AI 开源 LFM 与 LEAP SDK 示例、教程及配套工具仓库

    Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。

  13. Baseten Base Labs:模型研究58

    Baseten 上线 Qwen3-TTS-12Hz 语音合成模型部署

    Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。

  14. Baseten Base Labs:模型研究23

    VoxCPM2 语音缓存演示:/v1/audio/speech 接口复用参考音频

    Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。

  15. Baseten Base Labs:模型研究49

    Orpheus TTS:Canopy Labs 的实时流式语音模型

    Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。

  16. Baseten Base Labs:模型研究27

    Baseten Orpheus 3B 的 WebSocket 流式 TTS 接入示例

    Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。