Google DeepMind 为 Project Genie 接入 Street View 并向 Google AI Ultra 订阅者开放
Google DeepMind 在 Project Genie 中推出 Street View grounding 能力,用户可通过地图图钉选择美国地点并叠加 Ocean World 等风格生成世界,底层技术为 Maps Imagery Grounding。
Google DeepMind 在 Project Genie 中推出 Street View grounding 能力,用户可通过地图图钉选择美国地点并叠加 Ocean World 等风格生成世界,底层技术为 Maps Imagery Grounding。
Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列于产品与工具入口。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 上三个实验工具:基于 Co-Scientist 的 Hypothesis Generation。
Google 扩展内容透明与验证工具:Gemini 应用的 SynthID 图像、视频和音频验证已被使用 5000 万次,该能力今日扩展至 Search,未来几周进入 Chrome。
推荐理由:原文汇总了内容溯源验证工具在 Search、Gemini、Chrome、Pixel 与 Cloud 的具体落地范围和开放伙伴,读者可据此了解可用入口。
剑桥大学 Clare Bryant 教授使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 生成并排序了一批假说,其中优先锁定了一个她此前未关注的蛋白,并逐步将假说细化到具体氨基酸。Bryant 团队正构建含氨基酸突变的细胞系验证,原本需两到三年的实验工作有望在六个月内完成。
爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出将 NLRP3 炎症小体作为连接炎症与代谢的分子桥梁这一新假设,并经实验验证。该假设或为靶向联合疗法铺路,也解释了 resmetirom 为何仅对少数符合条件的患者有效。
Sierra 的 Monitors 是常驻评估层,用 LLM-as-judge 审查每一段对话,追踪智能体质量与客户情绪。每个 monitor 都经过基于团队标注对话和模型一致性的严格评估循环,模型分歧会被反馈进训练与评估集,直到稳定一致。Sierra 还通过 Agent Studio 让企业用自然语言创建自定义 monitor,并走同一套评估流程。
Modem 向所有用户推出 Agent Skills,即可复用的智能体指令集,由 slug、一句触发描述和指令正文三部分组成,在 chat、Slack 和 automations 中统一生效,并与全组织共享。
OpenAI 推出 OpenAI Developers 插件,帮助开发者在 ChatGPT 和 Codex 中构建 AI 应用与智能体,并提供 OpenAI API 接入与配置指引。
Mistral AI 发布 Workflows 公开预览版,一个面向企业 AI 的编排层,提供持久执行、可观测性、容错和人工审批,ASML、ABANCA、CMA-CGM 等客户已在用它自动化关键业务流程。
推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建对话,评估高中和大学生的未来技能,现已上线 Google Labs 并开放英文注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分标准打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致。
Together AI 发布 EinsteinArena,一个让智能体在开放科学问题上互动、讨论和竞争的平台,含实时 API、验证器和公开排行榜,并完全开源。截至 2026 年 4 月 11 日,平台上的智能体已取得 11 项新 SOTA,包括将 11 维 kissing number 下界从 AlphaEvolve 的 593 推进到 604,该结果由多个智能体在 48 小时内接力优化协作完成。
Google 发布两个学术智能体框架:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,是唯一超过 50.0 人类基线的框架。
Sierra 发布面向 AI 智能体的支付功能,成为首个 Level 1 PCI 合规的对话式 AI 平台,并获 Visa Global Service Provider Registry 验证。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排序),称其解决率最高提升 16 个百分点。Linnaeus 直接基于完整对话检索,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责重排序,兼顾精度与成本。Sierra 智能体每天执行超 200 万次搜索,P90 延迟与搜索成本均下降超 75%。
Sierra 发布 Explorer,一款与构建智能体的 Ghostwriter 配合、主动指出智能体待修复与改进之处的"智能体优化智能体"。它像 ChatGPT deep research,但研究对象是客户对话,可诊断性能问题、验证假设并预测趋势,每周推送变化简报,并支持一键在 Ghostwriter 中落地建议。
Mistral AI 发布 Spaces CLI,一个从内部平台工具演化而来、可脚手架项目、启动开发环境并部署的项目工具。
Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。
推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。
Modem 面向所有用户上线 Intercom 集成,通过 webhooks 实时将对话、回复、内部笔记、状态变更和 CSAT 评分汇入其 topic 系统,并与 Slack、Discord、GitHub 讨论并列。
Sierra 发布 Ghostwriter,一个能构建智能体的智能体,用户通过自然语言、SOP、通话记录等输入即可生成覆盖语音、聊天、邮件及 30 多种语言的 production-ready 客服 Agent。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言在 60 秒内转化为可运行的 Android XR 应用。
Modem 面向所有用户上线 PostHog 集成,连接后其智能体可通过 API 实时查询产品分析、功能开关和 A/B 实验数据。用户用自然语言提问,智能体自动生成查询并返回事件计数、漏斗、留存、HogQL 趋势及实验统计显著性结果,还可与 Modem 的 topic 数据交叉比对。
Together AI 扩展 Together Fine-Tuning,新增工具调用、推理和视觉语言模型(VLM)微调支持,训练栈升级后支持 100B+ 参数模型,吞吐最高提升 6×,数据集支持最大 100GB。
Mistral AI 推出 Forge,让企业基于自有专有知识训练前沿级 AI 模型,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可运行在企业自有基础设施内以保留控制权。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据。
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前最多 24 小时预测城市山洪风险,属于 Google Earth AI 家族并支持 Crisis Resilience 工作。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
Modem 面向所有用户上线 Event Automations,让自动化不再按时间表运行,而是在事件发生时唤醒同一个 Modem Agent 执行提示词。
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Together AI 提出缓存感知的预填充-解码分离架构 CPD,在延迟 SLO 下可持续 QPS 比现有分离式设计提升 35–40%,并在存在大型冷提示时保持更紧的尾延迟。
Together AI 推出 Dedicated Container Inference,团队自带 Docker 容器部署视频生成、虚拟人合成、图像处理等自定义生成媒体模型,平台负责自动扩缩、队列、流量隔离和监控。
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
Sierra 发布 Expert Answers,可在 AI 智能体遇到知识缺口、转交人工客服解决后,自动从该次解决过程生成可审核的知识草稿并回灌给智能体。一家数字健康公司用其基于真实客服对话生成的文章做小流量测试,解决率提升 4% 且未增加客服工作量,随后全面铺开。该功能还可配合 Live Assist 将知识同步给整个客服团队。
OpenAI 宣布 Codex 现已可在 JetBrains IDE 中使用,并与 JetBrains 的 Gleb Melnikov 在一个真实的 Kotlin 多平台项目上演示。