跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

42条精选相关主题多模态AI 视频产品更新

最新精选

第 41–42 条 · 共 42 条
9月21日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)80

    OpenAI 开源语音识别模型 Whisper

    OpenAI 训练并开源了名为 Whisper 的神经网络,该模型在英语语音识别上的鲁棒性和准确度接近人类水平。

    推荐理由:OpenAI 官方宣布开源 Whisper,读者可以据此了解这款英语语音识别模型在鲁棒性和准确度上的定位。

4月30日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)72

    OpenAI 发布音乐生成神经网络 Jukebox 并开源权重和代码

    OpenAI 推出 Jukebox,一个能以原始音频形式生成音乐的神经网络,可生成包含基础人声演唱的多种流派和艺术家风格的音乐。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。

    推荐理由:OpenAI 官方发布音乐生成模型 Jukebox,并开源模型权重和代码,读者可以直接下载探索生成样本。