Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
小米发布 MiMo-V2.5-ASR,一款面向多语言、方言及复杂声学场景的鲁棒语音识别模型。该模型主打在跨语言、方言和嘈杂环境下的稳定识别表现,具体参数与评测数据尚未在仓库说明中披露。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展:其推理栈已采用 NVIDIA Dynamo 1.0,并与 NVIDIA 合作推出基于 NemoClaw 和 OpenShell 运行时的智能体部署方案。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
OpenAI 开发者 Cookbook 发布教程,演示在同一 Realtime WebSocket 会话上通过带外的 response.create 请求(conversation 设为 none。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米 MiMo 团队发布 MiMo-Audio-Tokenizer,一个统一音频分词器,可同时提取语义信息并实现高保真音频重建。该模型已在 GitHub 开源。
OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。
推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。
OpenAI 发布实时翻译指南,介绍用 gpt-realtime-translate 模型将源音频流式输入专用翻译端点 /v1/realtime/translations,在说话者讲话的同时获得翻译音频和字幕增量,适用于同声传译、多语言通话、直播和会议等场景。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 在 DevDay 上展示了实时功能与演示,涵盖语音、流式传输和低延迟。内容聚焦开发者可用的实时能力,具体模型版本与参数未在原文中披露。
Mistral AI 为 Le Chat 推出一批新功能:Deep Research 预览模式可生成带引用的结构化研究报告;语音模式由新语音输入模型 Voxtral 驱动。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。