Baseten 推出低延迟高精度 Whisper 转录与说话人分离方案
Baseten 发布基于 OpenAI Whisper 优化的转录与说话人分离方案,Whisper V3 Turbo 在 H100 MIG 上实现超 2400x RTF,Whisper Large V3 达 1800x RTF(1 小时音频约 2 秒转完)。
Baseten 发布基于 OpenAI Whisper 优化的转录与说话人分离方案,Whisper V3 Turbo 在 H100 MIG 上实现超 2400x RTF,Whisper Large V3 达 1800x RTF(1 小时音频约 2 秒转完)。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
Baseten 上部署的 NVIDIA Nemotron 3 ASR(英文)通过 WebSocket 直连 NIM 原生 Riva Realtime API,无需自定义 schema,直接使用 Riva 的 OpenAI-Realtime 风格 JSON 事件协议。
Every 推出语音效率应用 Monologue,将任意应用内的语音听写、语音笔记和无机器人会议转录整合为一。支持 Mac、iPhone、iPad 和 Apple Watch,提供 100+ 语言、Mac 离线本地转录、自定义词典,并可通过 MCP、API 和 CLI 让 AI 智能体访问已保存的笔记。Monologue Pro 定价 $15/月或 $144/年,亦包含在 Every 订阅中。
NVIDIA Nemotron 3.5 ASR 是一款面向低延迟流式与批量场景的多语言流式语音识别模型,已在 Baseten 上以 docker_server 形式部署,通过 WebSocket 直连 NIM 原生 Riva Realtime API。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
CAMB.AI 推出前沿文本转语音模型 MARS6,支持 10 种语言的音色与韵律克隆,需商业授权方可使用。模型至少需要文本、参考音频、参考文本和目标语言四项输入,输出默认采用 ADTS AAC 流式响应,也可配置为 flac 流式或返回 base64 编码的 flac 文件。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
Eugene Yan 用 Vapi 语音 API 搭配 claude-3-sonnet 搭建了一个可通话的 AI 教练 Tara,用于散步时倾诉焦虑、梳理情绪和演练困难对话。
研究团队提出 VoxPolyMem,一个面向多方语音对话的交互感知多模态记忆框架,结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构,并将检索建模为智能体顺序决策。
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。
VoxParity 基准测试语音智能体是否会因听到的声音改变行动:183 个场景覆盖 14 个行业,同一段文字保持不变、只改音频(如医疗监护仪蜂鸣、无线电中的 mayday、下注的儿童声音),正确答案也随之改变。23 个可跑纯文本的系统只有 11 个通过。错误偏向文字:音频要求保护时,28 个系统执行常规请求的比例为 41%,而干净通话中过度反应仅 12%。
研究者推出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,经母语者审核并评估生成语言与语音输出。在 4,500 通全双工通话和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成率与英语相差 3.2 个百分点以内,韩语和普通话分别下降 14.7 和 8.4 个百分点。
xAI 发布 Grok Voice Transcribe 2.0,官方称其为当前最准确的转录模型之一,准确率是 1.0 的两倍且价格不变,在 Artificial Analysis 排行榜 32 个流式模型中准确率第一。
Suno 宣布自 2026 年 9 月 3 日起实施新的下载限制并更新服务条款。Free 用户终身最多 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次;使用 Suno Studio 的 Premier 订阅者不设下载上限,超出部分可付费购买。
Suno 首席执行官 Mikey Shulman 宣布与大型音乐公司 BMG 达成全球合作,该合作属于即将推出的首个与音乐行业共同开发的音乐模型的一部分。双方将合作打造艺术家与粉丝连接的新体验,并为选择加入的艺术家和词曲作者提供新的经济机会;双方还计划在 Suno: In Session 和 Spark 两个独立艺术家支持项目上深化合作。
Sarvam AI 发布印度语言 ASR 评估实践指南,指出 WER/CER 等为英语设计的指标在口语变体、code-mixing、数字多写法等六类场景下会把正确转写误判为错误。
Sarvam AI 汇总首届 Sarvam Epoch 活动上发布的全部内容,覆盖模型、推理、Agent 平台与硬件。
Sarvam 联合 AI4Bharat 发布 Indic DiarBench,这是首个覆盖全部 22 种印度表列语言、同时标注 ASR 与说话人分离的开源基准数据集,含 108 小时自然多人对话语音,每条录音 2-9 名说话人。数据集包含近场与远场会议、YouTube 野外对话,以及人工校验的转写文本和说话人时间戳,用于联合评估转写与说话人归属。
Sarvam AI 发布语音识别模型 Saaras V4,采用音频编码器加 3B 混合状态空间 LLM 解码器的架构,解码器完全从零自研训练。
MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。
Amazon 发布更快的 Fire TV Stick 4K 流媒体设备,配备全新设计的遥控器,并升级了面向客厅场景的 Alexa+。
IndexTeam 在 ModelScope 发布 Index-Translate 多语言翻译模型家族,覆盖文本、语音、配音和长文档翻译。
FD-VAD 是一种无需 ASR 的流式语义端点检测器,将因果音频窗口直接映射为 Continue/Stop 决策,用于全双工语音交互中的自然轮次切换。它结合冻结语音编码器、轻量模态适配器与参数高效微调的语言模型,并引入置信度门控端点提交和边界聚焦难负样本采样。在 TurnBench 开发集零样本设置下,FD-VAD 以 FP<=0.10 取得最高 EOT 召回率 0.853。
Live Chat is now 100% rolled out to all Ultra users on mobile 📱✨ Have real-time voice conversations with your notebooks across ~100 languages. Powered by our latest audio models, ask questions about your sources and get step-by-step guidance (almost) completely hands-free.
用 Suno Studio,你可以录制自己的声音,把它变成任何东西。 电吉他只是开始。
ElevenLabs 发布语音模型 Eleven v4 和面向实时语音智能体的 Turbo 版本,v4 能更准确地跟随脚本中的情绪、停顿和音效标签,并在长篇内容中保持音色一致。
波士顿语音智能初创公司 Modulate 完成 2500 万美元新融资,由 Future Ventures 领投,Hyperplane 与 Lakestar 参投。