Google 在 Flood Hub 上推出基于 AI 的城市山洪预报
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前最多 24 小时预测城市山洪风险,属于 Google Earth AI 家族并支持 Crisis Resilience 工作。
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前最多 24 小时预测城市山洪风险,属于 Google Earth AI 家族并支持 Crisis Resilience 工作。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 会话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在门诊就诊前与 AMIE 进行问诊对话,全程由医生实时监督。
推荐理由:这是 AMIE 首次走出模拟环境的真实临床可行性研究,原文给出了安全性、诊断准确率和患者反馈等一手数据。
Google 发布 Gemini 3.1 Flash-Lite,定位最快最高效、面向高负载工作负载的模型,官方称在推理、可靠性和可扩展性上超过 2.5 Flash 且成本更低。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。
推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。
推荐理由:作者本人官宣发布,说明新模型如何在更低延迟和成本下保留 Pro 级推理能力及可用入口。
Gemini 3 Deep Think 模式现已面向 Ultra 用户上线。Noam Shazeer 表示该模式使用并行思考线时,在 ARC-AGI-2 和 HLE 等关键推理基准上有明显提升。
安全研究员 Johann Rehberger 发文称,Google 上周发布的 Antigravity IDE 存在五个安全漏洞,其中多数继承自 Windsurf,最早在 2025 年 5 月已向 Windsurf 报告但未修复。
Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。
推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。
Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。
Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。
推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。
Ethan Mollick 在 One Useful Thing 发文,认为 AI 使用正从共同协作转向「召唤巫师」式的被动接收。
推荐理由:作者以论文重审、表格改造等一手实测为基础,提出从协作到巫师式 AI 使用的关系转变与验证难题。
Ethan Mollick 提出「Mass Intelligence」时代正在到来,超过十亿人日常使用 AI 聊天机器人,ChatGPT 周活超 7 亿。
安全研究员 Johann Rehberger 发布分析称,Gemini 模型会将隐藏的 Unicode Tag 字符当作指令执行,该问题最早于 2024 年 2 月报告给 Google,至今未在模型或 API 层缓解。
Johann Rehberger 演示如何通过 GitHub issue 中的间接提示词注入,利用 Jules 的 run_in_bash_session 工具和不受限外网访问,让 Jules 下载 Sliver 恶意软件并连接 C2 服务器,实现对开发机的远程控制。
作者报告 Google Jules 编码智能体存在多种数据外泄漏洞,可通过 Markdown 图片渲染和 view_text_website 工具调用在间接提示词注入下将本机数据发送到第三方服务器,攻击甚至可在计划提出前完成,绕过人工审批环节。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic、Google Gemini 下一代模型遇阻后业内关于模型 scaling 已死的叙事转向,认为现在断言模型 scaling 终结为时尚早,且业内高管的预测受商业利益影响,不应盲从。