跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 61–80 条 · 共 91 条
6月25日周四
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind 在 Gemini 3.5 Flash 中内置 computer use 能力

    Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,从此前的独立 Gemini 2.5 computer use 模型整合进主力 Flash 模型,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动和桌面环境操作的智能体。

    推荐理由:原文给出 computer use 内置于 Gemini 3.5 Flash 的能力和安全措施,读者可据此评估在自动化任务中的可用性。

6月16日周二
  1. Google DeepMind:Blog(RSS)65

    Google DeepMind 发布 AI Control Roadmap 框架,防御可能未对齐的内部 AI 智能体

    Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。

    推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。

6月11日周四
  1. Google DeepMind:Blog(RSS)76

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最高提速 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。

    推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。

6月10日周三
  1. Google DeepMind:Blog(RSS)61

    Google DeepMind 联合多方发起最高 1000 万美元多智能体 AI 安全研究资助

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者的多智能体 AI 安全研究资助,总额最高 1000 万美元。

    推荐理由:原文列出了四个优先研究方向和申请时间线,研究者可以直接据此判断是否提交多智能体安全方向的提案。

  2. vLLM 官方博客(RSS)75

    vLLM 原生支持 Google DeepMind 26B 扩散语言模型 DiffusionGemma

    Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。

    推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。

6月9日周二
  1. Google DeepMind:Blog(RSS)76

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译音频模型

    Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。

    推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。

  2. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行

    Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。

    推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。

6月8日周一
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果:Gemini Guided Learning 提升数学成绩

    Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。

    推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。

6月5日周五
  1. Google Research71

    Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。

    推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。

5月27日周三
  1. Ethan Mollick:One Useful Thing(RSS)68

    Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖

    Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。

    推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。

5月20日周三
5月18日周一
  1. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemini Omni Flash,支持多模态输入生成与对话式编辑视频

    Google DeepMind 发布 Gemini 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成高质量视频,并支持通过自然语言多轮编辑视频、保持角色和场景一致。

    推荐理由:原文介绍了 Gemini Omni Flash 的多模态输入、对话式视频编辑能力和开放范围,读者可以判断它对视频创作流程的影响。

5月17日周日
  1. Google DeepMind:Blog(RSS)65

    Google 扩展内容溯源工具:SynthID 验证进入 Search 与 Chrome,并推出 AI Content Detection API

    Google 扩展内容透明与验证工具:Gemini 应用的 SynthID 图像、视频和音频验证已被使用 5000 万次,该能力今日扩展至 Search,未来几周进入 Chrome。

    推荐理由:原文汇总了内容溯源验证工具在 Search、Gemini、Chrome、Pixel 与 Cloud 的具体落地范围和开放伙伴,读者可据此了解可用入口。

5月16日周六
  1. Google DeepMind:Blog(RSS)71

    Google DeepMind复盘WeatherNext如何帮助NHC提前五天预测飓风Melissa牙买加登陆

    Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。

    推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。

  2. Google DeepMind:Blog(RSS)85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。

5月12日周二
  1. Google DeepMind:Blog(RSS)62

    Google DeepMind 发表 Co-Scientist 多智能体科学假设生成系统,并通过 Hypothesis Generation 开放研究者注册

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。

    推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。

5月6日周三
5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

4月30日周四
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 发布 AI co-clinician 医疗协作智能体研究

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。

    推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。

4月23日周四
  1. Google Research69

    Google Photos Auto frame 上线 3D 视角重排功能,可改变照片拍摄视角

    Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。

    推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。