Google DeepMind复盘WeatherNext如何帮助NHC提前五天预测飓风Melissa牙买加登陆
Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。
推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。
Google DeepMind发文复盘,其AI气象模型WeatherNext帮助美国国家飓风中心(NHC)提前五天以80%置信度预测飓风Melissa将以五级强度登陆牙买加,三天前置信度升至接近100%。
推荐理由:Google DeepMind复盘了WeatherNext在飓风Melissa中的实际应用,读者可以了解AI气象模型提前五天预测快速增强的具体表现和局限。
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。
推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。
Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
Google Research 公布其开放科学资源进展:十余年积累的开源工具与开放数据集已服务全球超 25 万名研究者和开发者。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。
推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。
Google Research 介绍了科学家及学术合作者使用 Empirical Research Assistance(ERA)开展研究的四个方向。公共卫生方面,团队将 COVID-19 住院预测扩展到流感和 RSV,并每周实时向 CDC 相关项目提交预报,在流感与 COVID-19 公开排行榜上处于或接近榜首。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立新合作,属于其 National Partnerships for AI 计划的一部分。
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)架构,将训练拆分到异步解耦的计算岛(learner units),隔离硬件故障让其他部分继续训练。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,可从成功和失败经验中蒸馏结构化推理记忆用于测试时自我进化,并开源了代码。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,推动前沿 AI 在企业的大规模落地。合作包含三大支柱:共建行业专属 AI 能力、让合作伙伴提前使用 Gemini 系列等前沿模型、以及对接 DeepMind 领导层与客户 CEO 和董事会。目前仅 25% 的组织成功将 AI 规模化投入生产。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
Google Research 提出推理优先的合成数据生成框架 Simula,将数据集构建重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双评审质量检查四个步骤,独立控制覆盖度、复杂度与质量。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,将小鼠轴突重建误差降低 4.4%,主要来自合并错误的减少。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建对话,评估高中和大学生的未来技能,现已上线 Google Labs 并开放英文注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分标准打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 提升了空间与物理推理能力,包括指向、计数、成功检测和多视角理解。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮交互,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两个学术智能体框架:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,是唯一超过 50.0 人类基线的框架。
Google Research 提出一个评估 LLM 行为倾向的框架,将 IRI、ERQ 等标准化心理问卷改编为情境判断测试(SJT),在 25 个 LLM 上比较模型与人类标注者的行为分布。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
Google Research 在《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究了标注条目数与每条目标注者数的权衡,发现常用的每条目 1、3、5 名标注者往往不足,可靠结果常需超过 10 名。
Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。
推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言在 60 秒内转化为可运行的 Android XR 应用。
Google Research 发布压缩算法 TurboQuant,在零精度损失下大幅压缩模型体积,可同时用于 KV cache 压缩与向量搜索。它结合 PolarQuant 与 QJL 两种方法:前者通过随机旋转与极坐标量化消除传统量化每块数据需全精度存储常数的内存开销,后者仅用 1 bit 残差纠偏。
Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),可整合数据科学家、领域专家与健康教练角色提供长期健康支持。
Google Research 与 NHS 合作的 AIMS 研究在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统。
推荐理由:两项研究给出AI作为乳腺筛查第二阅片者的实测数据,读者可据此了解其在真实NHS工作流中的可行性与局限。
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前最多 24 小时预测城市山洪风险,属于 Google Earth AI 家族并支持 Crisis Resilience 工作。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
Google 发布 Gemini 3.1 Flash-Lite,定位最快最高效、面向高负载工作负载的模型,官方称在推理、可靠性和可扩展性上超过 2.5 Flash 且成本更低。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
Gemini 3 Deep Think 模式现已面向 Ultra 用户上线。Noam Shazeer 表示该模式使用并行思考线时,在 ARC-AGI-2 和 HLE 等关键推理基准上有明显提升。