Mistral AI 发布首个语音合成模型 Voxtral TTS
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展:其推理栈已采用 NVIDIA Dynamo 1.0,并与 NVIDIA 合作推出基于 NemoClaw 和 OpenShell 运行时的智能体部署方案。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
FireRedTeam 推出 FireRedVAD,一款工业级语音活动检测(VAD)与音频事件检测模型,支持 100+ 语言,性能超越 Silero-VAD、TEN-VAD、FunASR-VAD 和 WebRTC-VAD。该项目定位为 SOTA 工业级方案,具体参数规模与开源方式尚未披露。
Together AI 发布 SF Streets 和 US Streets 两个语音识别基准,测试 15 个模型在街名转写上的表现,平均错误率达 39%,非英语母语者准确率比英语母语者低 18 个百分点(46% vs 64%)。
FireRedTeam 发布 FireRedASR2,一个集 ASR、VAD、LID 和标点模块于一体的工业级语音识别系统。
Mistral 发布 Voxtral Transcribe 2 系列语音转写模型,含 Voxtral Mini Transcribe V2 批量转写和 Voxtral Realtime 实时转写两款。
推荐理由:官方给出了两个语音转写模型的能力、延迟配置和 API 定价,其中实时版以 Apache 2.0 开放权重,便于评估落地成本。
阿里云 Qwen 团队在 GitHub 开源 Qwen3-ASR 系列 ASR 模型,支持多语言语音、音乐和歌曲识别,并提供语言检测与时间戳预测功能。仓库地址:https://github.com/QwenLM/Qwen3-ASR。
阿里云通义团队开源 Qwen3-TTS 语音合成模型系列,支持稳定且富有表现力的流式语音生成、自由音色设计和逼真的声音克隆。
美团 LongCat 团队发布开源模型 LongCat-Video-Avatar,统一支持 Audio-Text-to-Video、Audio-Text-Image-to-Video 和 Video Continuation 三种生成模式,兼容单流与多流音频输入,提供单人与多人角色动画生成。
OpenAI 开发者 Cookbook 发布教程,演示在同一 Realtime WebSocket 会话上通过带外的 response.create 请求(conversation 设为 none。
美团 LongCat 团队开源全模态模型 LongCat-Flash-Omni,总参数 560B、激活 27B,基于 Shortcut-connected MoE 架构,支持实时音视频交互与最长 128K token 上下文。
美团 LongCat 团队开源 LongCat-Audio-Codec,一套面向语音大语言模型的音频 tokenizer 与 detokenizer 方案,并行生成语义与声学 token,可在极低码率下高保真重建音频。
阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni
推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。
小米发布 MiMo-Audio 音频语言模型,提出音频语言模型是少样本学习者。该模型以 MiMo 命名,已在 GitHub 开源,具体参数规模与评测数据尚未在现有信息中披露。
小米 MiMo 团队发布 MiMo-Audio-Tokenizer,一个统一音频分词器,可同时提取语义信息并实现高保真音频重建。该模型已在 GitHub 开源。
QwenLM 发布 Qwen3-ASR-Toolkit,这是 Qwen3-ASR API 的官方 Python 工具包,支持并行高吞吐调用、稳健的长音频转写和多采样率。该工具包面向需要批量调用 Qwen3-ASR 语音识别能力的开发者。
FireRedTeam 发布 FireRedChat,一套可完全自托管的全双工语音交互解决方案。该方案面向语音与多模态场景,支持用户自行部署运行,无需依赖外部服务。
FireRedTeam 推出 FireRedTTS2,一个面向多说话人对话生成的长音频流式 TTS 系统。该系统支持长音频流式合成,可用于多说话人对话场景。
OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。
推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。
OpenAI 发布实时翻译指南,介绍用 gpt-realtime-translate 模型将源音频流式输入专用翻译端点 /v1/realtime/translations,在说话者讲话的同时获得翻译音频和字幕增量,适用于同声传译、多语言通话、直播和会议等场景。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 在 DevDay 上展示了实时功能与演示,涵盖语音、流式传输和低延迟。内容聚焦开发者可用的实时能力,具体模型版本与参数未在原文中披露。
Mistral AI 为 Le Chat 推出一批新功能:Deep Research 预览模式可生成带引用的结构化研究报告;语音模式由新语音输入模型 Voxtral 驱动。
Mistral 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,采用 Apache 2.0 许可证开源,并可经其 API 调用,价格起价为每分钟 $0.001。
推荐理由:官方发布两款开源语音理解模型,给出了尺寸、许可证、价格和多语言基准对比,可评估其在语音转写工作流中的位置。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中国方言和英语,并在公开普通话 ASR 基准上达到新的 SOTA。该模型还具备出色的歌词识别能力。
FireRedTeam 在 GitHub 开源 FireRedTTS,定位为一个由 LLM 加持的基础 TTS 语音合成系统。本次材料仅提供仓库简介,未给出模型能力、版本或使用细节。