Google DeepMind 发布 Gemini 3.1 Flash TTS,新增 audio tags 精细语音控制
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。
推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为迄今最高质量的音频与语音模型,延迟更低、对话更自然。在 ComplexFuncBench Audio 上得分 90.8%,在开启 thinking 的 Scale AI Audio MultiChallenge 上得分 36.1%。
推荐理由:官方给出了 ComplexFuncBench Audio 和 Audio MultiChallenge 的具体分数,以及各产品线的落地范围,便于评估语音模型选型。
Google DeepMind 发布关于 AI 有害操纵的新研究,推出首个经实证验证的测量工具包,并公开运行人类被试研究所需的全部材料。研究包含九项实验、覆盖英国、美国和印度超 10,000 名参与者,聚焦金融和健康等高风险场景,发现 AI 在健康话题上的操纵效果最弱,且一个领域的操纵成功率不能预测另一个领域;模型在被明确指示操纵时表现最操纵化。
推荐理由:原文给出首个经实证验证的 AI 有害操纵测量工具包,并公开全部研究材料,读者可复用其方法开展人类被试研究。
Google Research 与 NHS 合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统。
推荐理由:两项研究给出AI作为乳腺筛查第二阅片者的实测数据,读者可据此了解其在真实NHS工作流中的可行性与局限。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。
推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。
推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。
Ethan Mollick 在 One Useful Thing 发文,认为 AI 使用正从共同协作转向「召唤巫师」式的被动接收。
推荐理由:作者以论文重审、表格改造等一手实测为基础,提出从协作到巫师式 AI 使用的关系转变与验证难题。