跳到正文

#语音

今日 10 条
3月24日周二
  1. Mistral AI:News(网页)66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。

    推荐理由:官方给出与 ElevenLabs 的对比数据、延迟指标和开源入口,读者可以据此评估它对语音智能体工作流的适配度。

3月19日周四
3月16日周一
3月12日周四
3月3日周二
2月23日周一
2月12日周四
2月5日周四
1月28日周三
1月21日周三
12月13日周六
11月20日周四
10月23日周四
10月17日周五
9月21日周日
  1. 通义 QwenAudio:原创语音项目68

    阿里云 Qwen 团队发布全模态模型 Qwen3-Omni

    阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni

    推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。

9月19日周五
9月16日周二
9月9日周二
9月2日周二
7月21日周一
  1. OpenAI Developers(RSS)66

    OpenAI 发布 gpt-live-transcribe 实时语音转写指南

    OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。

    推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。

7月18日周五
7月17日周四
7月15日周二
1月24日周五
8月15日周四