#语音
#语音
今日 19 条
SpaceXAI@SpaceXAIAI 评分3939
Grok@grokAI 评分3434由 Grok Voice 驱动 ❤️ https://x.ai/voice
引用Neuralink@neuralinkA beautiful surprise
Suno@sunoAI 评分11
SpaceXAI@SpaceXAIAI 评分4646在 fal 中使用 Grok Voice,构建智能、低延迟的 AI 智能体,解决真实的客户问题
引用fal@falGrok Voice is live on fal. The latest speech model from @SpaceXAI that answers in 0.70 seconds and finishes its tool calls before the sentence ends. Transcription with word-level timestamps, text to speech in 30+ voices across 25+ languages, and cloning from two minutes of audio. Every voice in this video is from Grok Voice.
StepFun@StepFun_aiAI 评分5757阶跃星辰与 ACE Studio 发布 StepAudio 3 Music,是 StepFun 首个音乐生成基础模型,可根据提示词和歌词生成完整歌曲。
蚂蚁 inclusionAI:HuggingFace 新模型精选AI 评分6262 蚂蚁 inclusionAI 开源 Realtime-Venus 9B 全双工音视频交互系统
蚂蚁 inclusionAI 发布 Realtime-Venus,一个支持主动音视频交互、异步委托和可打断全双工对话的开源系统,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点。
推荐理由:模型卡给出了 Realtime-Venus 的架构组成、全双工与异步委托能力及完整用法,读者可以据此评估它在实时音视频交互场景的可用性。
StepFun@StepFun_aiAI 评分5757
Logan Kilpatrick@OfficialLoganKAI 评分5757
Google AI@GoogleAI精选AI 评分6666Google 发布迄今最先进的 Gemini Audio 模型:Gemini 3.8 Live 与 3.8 Live Extended Thinking。

推荐理由:官方说明了两款新音频模型在速度成本与推理能力上的分工,读者可据此判断语音交互场景如何选型。
Google DeepMind:Blog(RSS)精选AI 评分8282 Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力与成本取舍。
Google DeepMind@GoogleDeepMindAI 评分5252
Apple:Newsroom(RSS)精选AI 评分6969 Apple 发布 Siri AI 与新一代 Apple Intelligence,随 iOS 27 等系统更新推出
Apple 发布新一代 Apple Intelligence 和全新 Siri AI,后者以英文 Beta 陆续推出,10 月将支持法语、日语、韩语、葡萄牙语和西班牙语。
推荐理由:官方完整说明了 Siri AI 的能力范围、新 Apple Intelligence 功能和各区可用性差异,读者可据此判断升级价值。
Mustafa Suleyman@mustafasuleymanAI 评分3131MAI-Transcribe-2 在 Open Router 上 5 天达到 100 万次请求!它是全球最快、最准确、最便宜的转录模型!
X Square Robot@XSquareRobotAI 评分5050OpenAI:GitHub 新仓库AI 评分3939 OpenAI 发布 openai-live-console 本地语音控制台
OpenAI 在 GitHub 新建 openai-live-console 仓库,这是一个本地语音控制台,支持只读工具与后端委派。
通义 QwenAudio:原创语音项目AI 评分5757 QwenLM 开源 Qwen-Live-Harness 智能体框架
QwenLM 在 GitHub 开源了 Qwen-Live-Harness,一个基于 Qwen Omni Realtime API 驱动的 agent harness。项目支持看、听和行动,并内置记忆功能。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分6565 OpenAI 在 API 中推出 GPT‑Live‑1 语音模型
OpenAI 在 API 中推出 GPT‑Live‑1,提供自然的全双工语音对话能力。模型具备更强的指令遵循、自定义语音和电话(telephony)支持。
推荐理由:官方公告给出 GPT‑Live‑1 的核心能力清单,读者可以据此评估其语音应用场景的适配性。
Apple:Newsroom(RSS)AI 评分5656 Apple 发布 AirPods 5,开放式耳机的主动降噪提升
Apple 发布 AirPods 5,开放式耳机设计的主动降噪比 AirPods 4 主动降噪版多消除最多 50% 的外部噪声,并采用全新多孔声学架构和新一代 Adaptive EQ。新品搭配 Siri AI(随 iOS 27 测试版推出)支持免提个人情境问答、头部手势响应和 Live Translation,售价 129 美元,无线充电盒版 149 美元,9 月 18 日正式开售。
通义 QwenAudio:原创语音项目AI 评分2424 QwenLM 发布 qwen-mm-plugins-hub 文档
QwenLM 为 Qwen-MM-Plugins 推出文档项目 qwen-mm-plugins-hub。该仓库用于说明 Qwen 多模态插件相关内容,目前公开信息仅为一份文档。
Google Gemini@GeminiAppAI 评分4141
Sierra:Blog(RSS)AI 评分5151 Sierra 发布企业级 AI 语音 Agent 指南
Sierra 发布面向企业的 AI 语音 Agent 指南,说明 Voice AI 与 AI 语音 Agent 的区别,以及语音 Agent 从听、理解、推理、执行到控制的完整工作流程。
Google AI Developers@googleaidevsAI 评分3636
Google DeepMind:Blog(RSS)精选AI 评分6565 Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为整洁、带格式的文本。
推荐理由:原文来自官方发布,给出了 WER 数据、双 API 接入方式和开放入口,读者可以据此评估语音转写工作流是否值得迁移。
SpaceXAI@SpaceXAIAI 评分4343在 LiveKit 中使用 Grok Voice 模型,构建实用的语音智能体,全面支持 ZDR
引用LiveKit@livekitWe built a patient intake agent with @SpaceXAI that runs end to end on Grok voice models. Grok STT → Grok 4.3 → Grok TTS, cascaded through LiveKit Inference. Three model strings in one AgentSession. No separate API key, no separate billing, ZDR on every hop. Talk to it: https://xai.livekit.space
FireRedTeam:原创语音与多模态项目AI 评分4848 FireRedTeam 发布 FireRedTTS3:支持多语言多方言语音克隆、指令引导音色设计与语音编辑
FireRedTeam 发布 FireRedTTS3,一款支持多语言与多方言的语音克隆模型,同时具备指令引导的音色设计和语音编辑能力。该模型将语音克隆、音色设计与语音编辑整合在同一系统中,具体参数规模与可用性尚未在原文中披露。
Sierra:Blog(RSS)AI 评分5050 Sierra 为 Agent 推出开箱即用的 IVR 电话导航能力
Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。
Hugging Face:Blog(RSS)AI 评分5656 NVIDIA 发布 Magpie Multilingual TTS 开放权重模型,支持 12 种语言
NVIDIA 发布 Magpie Multilingual TTS 开放权重模型(364M 参数),支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,可在自有基础设施部署并微调。
Sierra:Blog(RSS)AI 评分4444 Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,覆盖多语言、多品牌与多市场场景。该功能结合语音、个性与语言感知行为,并接入 Sierra Agent SDK,支持调整语速、应对打断及对话中切换语音或语言。Sierra 称某智能体搭配自然语音与人格后问题解决率提升近 50%,Voice Personas 现已上线。
Hugging Face:Blog(RSS)精选AI 评分6060 Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量
Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。
推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。
Hugging Face:Blog(RSS)AI 评分5959 Hugging Face 与 Cerebras 用 Gemma 4 打造实时语音 AI 演示
Hugging Face 与 Cerebras 展示了一套开源、模块化的实时语音到语音流水线:Nvidia Parakeet 做语音识别,Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 合成语音回复。
vLLM 官方博客(RSS)AI 评分4848 vLLM-Omni 如何服务多阶段 Qwen3-Omni:经验与教训
vLLM-Omni 将 Qwen3-Omni 拆成 Thinker、Talker、Code2Wav 三阶段流水线,并通过 OpenAI 兼容的 /v1/chat/completions 提供文本与语音生成。
vLLM 官方博客(RSS)AI 评分4949 vLLM-Omni 中的 TTS 推理工程实践
vLLM-Omni 已支持 Qwen3-TTS、VoxCPM2、Fish Speech S2 Pro 和 Higgs Audio V3 等 TTS 系统,并针对各模型瓶颈采用不同优化策略。
Google DeepMind:Blog(RSS)精选AI 评分7676 Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译音频模型
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。
推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。
Together AI 研究与产品博客(RSS)AI 评分4949 Together AI 如何打造全球最快的语音转文字技术栈
Together AI 通过 TensorRT 多 profile 编译、GPU 端条件分支和减少 CPU 拷贝,打造出全球最快的语音转文字技术栈。
Sierra:Blog(RSS)AI 评分3434 Sierra 谈语音 AI 的转录难题:多供应商集成与上下文感知如何降低错误率
Sierra 构建了一套动态路由多家供应商的转录平台,通过并行查询多个转录模型并融合输出,内部基准显示可将话语错误率平均降低约 25%,在转录提升空间更大的语言中最高降低 37%。该平台还支持 70 多种语言,并将对话上下文注入转录过程,使金融服务智能体的输入验证率提升超 25%,整体解决率最高提升 1%、重大转录错误最多减少 15%。
Together AI 研究与产品博客(RSS)AI 评分6262 Together AI 开源视频翻译工具 Violin,支持视频对话助手
Together AI 发布完全开源的视频翻译工具 Violin,基于 Together API 提供 Web 应用、CLI 和 Agent Skill 三种形态,代码以 MIT 协议开源。
Lilian Weng@lilianwengAI 评分3939过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊
引用Thinking Machines@thinkymachinesPeople talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models
Thinking Machines Lab:官方博客(RSS)精选AI 评分7070 Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览
Thinking Machines Lab 宣布 interaction models 研究预览,让模型原生处理实时音频、视频和文本交互,而非依赖外部 harness。
推荐理由:原文由当事团队给出架构设计、能力演示和基准数字,读者可以据此了解交互能力如何内置于模型本身。