跳到正文
原文
Google DeepMind:Blog(RSS)·· 2026-03-26精选AI 评分77

Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

Gemini 3.1 Flash Live: Making audio AI more natural and reliable

AI 导读

Google DeepMind 发布 Gemini 3.1 Flash Live,称其为迄今最高质量的音频与语音模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%。

推荐理由

官方给出了 ComplexFuncBench Audio 和 Audio MultiChallenge 的具体分数,以及各产品线的落地范围,便于评估语音模型选型。

正文 · AI 翻译

2026年3月26日

|

我们最新的语音模型提升了精度并降低了延迟,让语音交互更加流畅、自然和精准。


Valeria Wu

产品经理

Yifan Ding

软件工程师,代表 Gemini 团队


The Gemini emblem sits next to text reading 'Gemini 3.1 Flash Live'. The background has blue, multicolored dots making up a microphone icon

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

今天,我们通过 Gemini 3.1 Flash Live 进一步提升 Gemini 的实时对话能力,这是我们迄今为止质量最高的音频和语音模型。它提供了下一代语音优先 AI 所需的速度和自然节奏,为开发者、企业和普通用户带来更直观的体验。

3.1 Flash Live 已在 Google 各产品中上线:

面向开发者:强大的推理和任务执行能力

我们提升了 3.1 Flash Live 的整体质量,使其更可靠,让开发者和企业能够大规模构建可完成复杂任务的语音优先智能体。在 ComplexFuncBench Audio 这一涵盖多种约束条件下多步骤函数调用的基准测试中,它取得了 90.8% 的分数,领先于我们之前的模型。

ComplexFuncBench audio bar graph

BigBenchAudio bar graph

在 Scale AI 的 Audio MultiChallenge 上,Gemini 3.1 Flash Live 在开启“思考”模式后以 36.1% 的分数领先。该基准测试专门测试在真实音频中常见的打断和犹豫情境下的复杂指令遵循和长程推理能力。

AudioMultiChallenge bar graph

3.1 Flash Live 还改进了语调理解能力,带来更自然的对话。在 Gemini Enterprise for Customer Experience 中,它比 2.5 Flash Native Audio 更能有效识别音高和语速等声学细微差别。它也更擅长根据用户表达的沮丧或困惑动态调整回应。

Verizon、LiveKit 和 The Home Depot 等公司已对 3.1 Flash Live 在其工作流程中的表现给予积极反馈,特别强调了其改进后更自然的对话体验。

Quote from The Home Depot

Quote from Verizon

Quote from LiveKit

Quote from Wavera

Quote from Stream

Quote from YouTube

面向所有人:更自然、更直观的交互

在 Gemini Live 和 Search Live 中,3.1 Flash Live 模型提供更有帮助、更自然的回应,无论你是提出日常快速问题还是进行更复杂的对话。

在 3.1 Flash Live 模型的支持下,Gemini Live 相比前代模型响应更快,并且能够跟踪你的对话线索长达两倍的时间,在较长的头脑风暴中保持你的思路连贯。

3.1 Flash Live 让 Gemini Live 更快、更有帮助

3.1 Flash Live 还天生支持多语言,这促成了本周 Search Live 的全球扩展。通过此次发布,200 多个国家和地区的人们现在可以用自己偏好的语言与 Search 进行实时多模态对话。

使用 Search Live 中的 3.1 Flash Live 获取实时故障排除帮助

试用 Gemini 3.1 Flash Live

3.1 Flash Live 生成的所有音频都带有 SynthID 水印。这种不可感知的水印直接交织在音频输出中,能够可靠地检测 AI 生成的内容,帮助防止虚假信息。有关我们安全和责任方法的更多信息,请参阅模型卡。

从今天开始,体验 3.1 Flash Live 的自然与可靠。我们期待看到你如何与之交互并基于它进行构建。

在您的收件箱中获取 Google 的最新动态

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等更多内容。

您的信息将按照 Google 隐私政策 使用。您可以随时退出。

来源:Google DeepMind:Blog(RSS) · deepmind.google