xAI 发布 Grok Speech to Text 与 Text to Speech 独立 API
xAI 发布 Grok Speech to Text 和 Grok Text to Speech 两个独立音频 API,基于驱动 Grok Voice、Tesla 车辆和 Starlink 客服的同一套技术栈。
xAI 发布 Grok Speech to Text 和 Grok Text to Speech 两个独立音频 API,基于驱动 Grok Voice、Tesla 车辆和 Starlink 客服的同一套技术栈。
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。
推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。
xAI 推出 Custom Voices,录制约一分钟自然语音即可在两分钟内克隆声音,并可在 Grok Text to Speech 和 Voice Agent API 中使用。自定义声音继承全部 TTS 能力(speech tags、多语言输出、REST 与 WebSocket 流式),不额外收费。声音需通过口令朗读和说话人嵌入比对的两阶段验证,无法从已有录音克隆,也无法克隆他人声音。
推荐理由:xAI 官方说明克隆流程、验证机制和 API 覆盖范围,读者可据此评估在语音应用中的可用性。
xAI 宣布 Voice Agent Builder 进入测试版,这是一个运行在 Grok Voice 上的无代码平台,官方称约两分钟即可配置出可用的语音智能体。
推荐理由:官方给出了完整功能、τ-voice Bench 排名和每分钟计费细节,读者可以据此评估它替代多 API 拼接语音方案的可行性。
xAI 发布 21 个新的 Grok Voice 旗舰语音,与原有五个语音并存,全部原生多语言,支持 Grok Voice 的 25+ 种语言,现已上线 realtime Voice Agent API、Text to Speech API 和新的 Grok Voice Agent Builder。
xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。
推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
Suno 上线情人节体验,用户回答三个关于对方的问题后,Suno 会生成三首歌,可在 vdaysong.com 免费试用。该体验灵感来自制作混音带(mixtape)的传统,用户还能在社交媒体分享收到的歌曲,带 @suno_ai_ 标签有机会赢取一束花和三个月 Premier 订阅。
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Suno 发布 Audio Input 功能,Pro 与 Premier 用户可上传或录制音频,从任意声音生成歌曲。片段需在 6 至 60 秒之间,上传后可选择 Extend、设置时间戳、提供曲风并自备歌词。平台表示将屏蔽版权作品上传,含人声的输入将保持私密且不可搜索。
推荐理由:官方说明了音频上传的使用方式与隐私限制,用户可据此判断如何把自己的声音素材变成 Suno 歌曲。
Suno 发布 v4 音乐生成模型,带来更干净的音频、更精准的歌词和更多样化的歌曲结构。新增 Remaster 可将旧模型曲目升级为 v4 音质,新增歌词助手 ReMi,改进封面生成,且 Covers 和 Personas 功能已由 v4 驱动。v4 目前以 beta 形式面向 Pro 和 Premier 用户开放,可在 suno.com 和 iOS 上使用。
推荐理由:原文来自 Suno 官方,列出了 v4 的具体新功能和可用范围,读者可以据此判断是否升级使用。
Suno 正式登陆 Android,这是其首个 Android 版本,用户可通过文字提示词创作音乐、发现社区新曲目并分享作品。该版本已包含核心功能,官方表示后续还将持续更新。
Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。
推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。
Suno 为 Premier 订阅者的生成式音频工作站 Suno Studio 推出 1.2 版本,新增 Remove FX、Warp Markers(含 Quantize)、Alternates 和拍号支持。
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
Suno 官方发布 Voices 功能的 6 条使用建议,帮助用户获得更高质量的声音效果。建议包括在安静环境录音、录音前练习、不必追求完美、尽量录制更长参考音频(至少一分钟)、根据曲风匹配声音,并尝试不同曲风。Voices 现已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。
Suno 宣布改进 Stem Separation 并重做了分轨功能,新增三种拆分方式。Auto Split 可自动拆成最多 12 个 stems,Split from Mix 从下拉菜单选定乐器或人声单独提取,Advanced Split(仅 Premier)支持从近 100 种乐器列表中精确提取;部分最细粒度选项仍在开发中。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
MOSS-TTS-Local-Transformer-v1.5 已在 SGLang-Omni 上实现端到端服务,与 MOSI 和 OpenMOSS 团队合作完成。
Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。
Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,将 LFM2 家族扩展到音频领域。
Liquid AI 发布 LFM2.5-1.2B 模型家族,称其为迄今最强的边缘 AI 版本,预训练从 10T 扩展到 28T tokens,并大规模引入强化学习后训练。
Baseten 推出文本转语音(Text-to-speech)服务,可部署 Orpheus TTS、CAMB.AI 的 MARS6 以及 Qwen3 TTS 12Hz 等语音合成模型。
Baseten 发布基于 OpenAI Whisper 优化的转录与说话人分离方案,Whisper V3 Turbo 在 H100 MIG 上实现超 2400x RTF,Whisper Large V3 达 1800x RTF(1 小时音频约 2 秒转完)。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
Baseten 上部署的 NVIDIA Nemotron 3 ASR(英文)通过 WebSocket 直连 NIM 原生 Riva Realtime API,无需自定义 schema,直接使用 Riva 的 OpenAI-Realtime 风格 JSON 事件协议。
NVIDIA Nemotron 3.5 ASR 是一款面向低延迟流式与批量场景的多语言流式语音识别模型,已在 Baseten 上以 docker_server 形式部署,通过 WebSocket 直连 NIM 原生 Riva Realtime API。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
CAMB.AI 推出前沿文本转语音模型 MARS6,支持 10 种语言的音色与韵律克隆,需商业授权方可使用。模型至少需要文本、参考音频、参考文本和目标语言四项输入,输出默认采用 ADTS AAC 流式响应,也可配置为 flac 流式或返回 base64 编码的 flac 文件。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。