VoxParity 基准:23 个语音智能体仅 11 个能根据音频线索改变行动
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
罗技发布 Zone Vibe Pro 头戴式无线耳机,内置 40mm 驱动单元和 6 个全向 MEMS 麦克风,支持自适应 ANC 降噪与 AI 驱动的语音隔离技术。该耳机聆听续航 66hr(关闭 ANC)/ 30hr(开启 ANC),通话续航 20hr(关闭 ANC)/ 18hr(开启 ANC),标准版定价 259.99 美元,头带、耳垫、电池均可更换。
BestBlogs 10-01 早报精讲 Gemini 4 Argon,其长程推理已用于代码迁移、内存优化与安全防御,并通过 Fairwind 向受信任的网络防御者逐步开放。
https://x.com/i/article/2105450924286353408
Inworld 收购 Ultravox,一家公司同时拥有 AI 智能体的语音能力和运行平台。Ultravox 是开发者构建实时语音智能体的平台,能处理理解、推理、工具调用和打断时的时机控制。
We’re excited to announce that @ultravox_dot_ai is now part of Inworld. Ultravox is the platform developers use to build real-time voice agents. We've worked with the team for a while through our TTS partnership, and today members of the team that built it are joining Inworld to keep developing it.
We’re excited to announce that @ultravox_dot_ai is now part of Inworld. Ultravox is the platform developers use to build real-time voice agents. We've worked with the team for a while through our TTS partnership, and today members of the team that built it are joining Inworld to keep developing it.
语音 AI 创业公司 ElevenLabs 宣布以 $22B 估值进行 $300 million 的 tender offer,允许员工出售部分已归属股份,估值为此前 $11B 的两倍。
What's new in Grok Bot 0:19 Team bots - create bots shared with your team members 1:10 Finances - search and manage your finances with @plaid 1:32 Voice calls - @bot can search chats during calls and gracefully handles interruptions Like this for a special bot animation on @X!
对 @banoffeemusic 来说,创新是本能。一首歌直到让她自己感到惊喜才算完成。 看她如何用 v6 汲取意想不到的影响、融合流派,把她的声音带到新的地方。 做打动你的东西。
xAI 发布 Grok Speech to Text 和 Grok Text to Speech 两个独立音频 API,基于驱动 Grok Voice、Tesla 车辆和 Starlink 客服的同一套技术栈。
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。
推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。
xAI 推出 Custom Voices,录制约一分钟自然语音即可在两分钟内克隆声音,并可在 Grok Text to Speech 和 Voice Agent API 中使用。自定义声音继承全部 TTS 能力(speech tags、多语言输出、REST 与 WebSocket 流式),不额外收费。声音需通过口令朗读和说话人嵌入比对的两阶段验证,无法从已有录音克隆,也无法克隆他人声音。
推荐理由:xAI 官方说明克隆流程、验证机制和 API 覆盖范围,读者可据此评估在语音应用中的可用性。
xAI 宣布 Voice Agent Builder 进入测试版,这是一个运行在 Grok Voice 上的无代码平台,官方称约两分钟即可配置出可用的语音智能体。
推荐理由:官方给出了完整功能、τ-voice Bench 排名和每分钟计费细节,读者可以据此评估它替代多 API 拼接语音方案的可行性。
xAI 发布 21 个新的 Grok Voice 旗舰语音,与原有五个语音并存,全部原生多语言,支持 Grok Voice 的 25+ 种语言,现已上线 realtime Voice Agent API、Text to Speech API 和新的 Grok Voice Agent Builder。
xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。
推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。
xAI 为 Imagine Video 1.5 增加图像与语音参考、纯提示词生成视频和原生 1080p 输出。
推荐理由:原文列出图像与语音参考、文本生成视频和原生 1080p 的可用范围与 API 情况,读者可据此判断能否接入现有工作流。
Suno 上线情人节体验,用户回答三个关于对方的问题后,Suno 会生成三首歌,可在 vdaysong.com 免费试用。该体验灵感来自制作混音带(mixtape)的传统,用户还能在社交媒体分享收到的歌曲,带 @suno_ai_ 标签有机会赢取一束花和三个月 Premier 订阅。
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Suno 发布 Audio Input 功能,Pro 与 Premier 用户可上传或录制音频,从任意声音生成歌曲。片段需在 6 至 60 秒之间,上传后可选择 Extend、设置时间戳、提供曲风并自备歌词。平台表示将屏蔽版权作品上传,含人声的输入将保持私密且不可搜索。
推荐理由:官方说明了音频上传的使用方式与隐私限制,用户可据此判断如何把自己的声音素材变成 Suno 歌曲。
Sarvam AI 推出 AI 配音模型 Sarvam Dub,支持零样本声音克隆与语音生成阶段的原生时长控制,可将原本耗时数周的配音流程压缩到几分钟。其评测覆盖 10 种印度语言和英语、64 位说话人,每套系统测试超 700 条音频,跨语言场景下的说话人相似度领先同类方案。
Sarvam AI 发布 Sarvam Audio,这是 30 亿参数语言模型 Sarvam 3B 的音频扩展,支持五种转录格式并实现最长 60 分钟音频的说话人分离识别。
Sarvam AI 发布面向印度语言的文本转语音模型 Bulbul V3,提供 35+ 专业配音师录制的声音、低延迟流式输出和语音克隆支持。
Suno 发布 v4 音乐生成模型,带来更干净的音频、更精准的歌词和更多样化的歌曲结构。新增 Remaster 可将旧模型曲目升级为 v4 音质,新增歌词助手 ReMi,改进封面生成,且 Covers 和 Personas 功能已由 v4 驱动。v4 目前以 beta 形式面向 Pro 和 Premier 用户开放,可在 suno.com 和 iOS 上使用。
推荐理由:原文来自 Suno 官方,列出了 v4 的具体新功能和可用范围,读者可以据此判断是否升级使用。
Suno 正式登陆 Android,这是其首个 Android 版本,用户可通过文字提示词创作音乐、发现社区新曲目并分享作品。该版本已包含核心功能,官方表示后续还将持续更新。
Sarvam AI 发布 Saaras V3 语音识别模型,原生支持流式低延迟解码,覆盖 22 种官方印度语言和英语。在 IndicVoices 基准上 WER 约 19%,优于 Saaras V2.5(约 22%),并在低资源语言上保持一致精度;训练使用超 100 万小时多语言音频。
Sarvam AI 推出 Sarvam Studio,一个将语音、文本和文档工作流整合到同一工作空间的多语言内容转换平台,支持 AI 视频配音与智能体文档翻译。其配音在约 280 次与 ElevenLabs、YouTube Dub、Rask AI 的盲测对比中获得最高整体偏好,说话人相似度平均得分 0.88。该平台目前通过受控早期 beta 向政府、教育、媒体和出版领域的少量生产合作伙伴开放。
Sarvam AI 发布 Sarvam Edge,推动语音识别、语音合成与多语言翻译模型在设备端本地推理。其端侧语音识别模型参数 74M、FP16 占用约 294MB,支持 10 种印度语言,在 Snapdragon 8 Gen 3 上实时因子约 0.12(RTFx 8.5),首 token 延迟低于 300 毫秒。语音合成同样以单一模型支持 10 种语言和 8 个多语言说话人,无需联网。
Suno 宣布与 Warner Music Group(WMG)达成合作,将基于高质量授权音乐构建超越 v5 的新一代模型,并推出由 WMG 艺人自愿授权的互动创作体验,参与艺人可获得补偿。产品方面,下载功能保留但需付费账号并按档位限制每月下载次数,Suno Studio 维持不变且保留无限下载。
推荐理由:Suno 官方宣布与 WMG 合作,读者可以据此了解授权模型、粉丝互动与下载政策变化如何影响平台使用方式。
Suno 为 Premier 订阅者的生成式音频工作站 Suno Studio 推出 1.2 版本,新增 Remove FX、Warp Markers(含 Quantize)、Alternates 和拍号支持。
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
Suno 官方发布 Voices 功能的 6 条使用建议,帮助用户获得更高质量的声音效果。建议包括在安静环境录音、录音前练习、不必追求完美、尽量录制更长参考音频(至少一分钟)、根据曲风匹配声音,并尝试不同曲风。Voices 现已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。
Suno 宣布改进 Stem Separation 并重做了分轨功能,新增三种拆分方式。Auto Split 可自动拆成最多 12 个 stems,Split from Mix 从下拉菜单选定乐器或人声单独提取,Advanced Split(仅 Premier)支持从近 100 种乐器列表中精确提取;部分最细粒度选项仍在开发中。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
MOSS-TTS-Local-Transformer-v1.5 已在 SGLang-Omni 上实现端到端服务,与 MOSI 和 OpenMOSS 团队合作完成。
Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。
Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,将 LFM2 家族扩展到音频领域。
Liquid AI 发布 LFM2.5-1.2B 模型家族,称其为迄今最强的边缘 AI 版本,预训练从 10T 扩展到 28T tokens,并大规模引入强化学习后训练。
Baseten 推出文本转语音(Text-to-speech)服务,可部署 Orpheus TTS、CAMB.AI 的 MARS6 以及 Qwen3 TTS 12Hz 等语音合成模型。