HeyGen 与 Google Cloud 合作将 Avatar IV 迁移至 TPU
HeyGen 与 Google Cloud 合作,把 180 亿参数以上的数字人视频扩散模型 Avatar IV 迁移到八芯片 Trillium(v6e)主机上,速度比首个可用版本提升 1.86 倍。
HeyGen 与 Google Cloud 合作,把 180 亿参数以上的数字人视频扩散模型 Avatar IV 迁移到八芯片 Trillium(v6e)主机上,速度比首个可用版本提升 1.86 倍。
Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。
推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 为目标模型完成多项优化,支持 4K+ token 文本与 15K+ token 多模态输入的嵌入推理。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。
推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。
Google 宣布 Agent Development Kit(ADK)for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能完全对齐,并新增 Android 端侧扩展。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证,同时在实验室测试中保持蛋白的生物功能。
推荐理由:原文给出水印在湿实验中不影响蛋白功能、并开放代码与权重的关键细节,读者可据此评估其对生物安全筛查的实际价值。
Google 发布 SynthID Bio,可将不可感知、可验证的水印直接嵌入 AI 设计的蛋白质序列和预测的 3D 结构中,同时保持其生物功能。在针对目标蛋白的实验室测试中,加水印的设计在性能与自然多样性上与未加水印版本相当。该技术旨在为生物安全提供溯源层,并维护开放科学数据库的完整性。
EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。
推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Developers Blog 发布零信任 Agent 系列第二篇,讲解如何将 Customer Support & Returns Agent 的安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时治理层。
Gemini Enterprise Agent Platform 推出 Agent Anomaly Detection 私密预览,这是一个基于推理的智能体监督与审计层,通过分析推理轨迹、工具调用和执行流程识别行为异常、可疑意图与策略违规。
Google 宣布与 Speakeasy 合作,将后者的 OpenAPI 代码生成套件以 AGPLv3 许可开源。
推荐理由:原文交代了闭源 SDK 生成器停服带来的风险,以及 Speakeasy 以 AGPLv3 开源多语言生成套件的具体内容。
Google AI 订阅用户即日起可获得 Google Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。相关权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。
Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
Google Cloud API Gateway 在 Public Preview 中新增远程 MCP 服务器能力,通过在 OpenAPI 3.x 规范中添加 x-google-api-management.mcp 注解并部署,即可把现有 REST 操作暴露为 agent 可调用的 MCP 工具,无需单独搭建和运维 MCP 服务器。
Henry Cavill 与 Googlebook 合作打造一款视频游戏,将于今年 11 月推出。Googlebook 搭载 Gemini Intelligence,提供 Continue on phone 同步、Rambler 语音转文字、Antigravity 等功能。Cavill 将用 Googlebook 构建其个人创作项目。
Xin Liu 与 Eunjo Lee 在 LAS Art Foundation 与 Google Arts & Culture Lab 合作的线上艺术家驻地项目中,用 Google AI 工具创作了《nom nom》和《In Your Eyes, Before My Own》两件作品,探索哲学、心理学与 AI。
白宫宣布推出 America.gov,作为简化公民在线获取联邦服务的统一入口,Google 被列为该计划的技术合作伙伴,将用 Gemini 帮助超过 1 亿人更快、更便捷地获取关键公共资源。Google 表示此举支持政府的数字现代化愿景,让日常公共服务更顺畅、可及且响应及时。
Google 与 XPRIZE 合作的 Future Vision XPRIZE 公布大奖得主,独立电影人 Jeff Synthesized 的作品《The Gifted》从全球 2500 多份投稿中胜出,获得 10 万美元奖金及 250 万美元长片制作资金。
Google Arts & Culture 移动 App 迎来 15 周年改版,新增视觉优先的对话式搜索,用户可用自然语言提问并获得配图与合作伙伴档案中的精选故事。
Google 介绍 Gemini 3.8 Flash 相比 3.7 Flash 在软件工程、Agent 任务和专业领域多步推理上有显著提升,性能常接近更高成本的 frontier 模型。
推荐理由:文章展示了四个社区用 Gemini 3.8 Flash 做出的具体项目,读者可以借此了解模型在多步推理和多模态任务上的实际用法。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 将家族黎巴嫩菜谱直接换算成大型宴会批量配方,避免手工计算香料与酥皮比例出错。Gemini 还能把活动菜单转成分区陈列的采购清单、汇总共用食材并提前排好备餐日程,并针对无麸质、无坚果等饮食限制给出保留风味的替换方案。Edy 表示 Gemini 释放了他的时间,让他少做行政事务、多推广黎巴嫩饮食文化。
Google Display & Video 360 推出 Vertical Video Unification,可在单一平台以程序化方式跨渠道购买和衡量竖屏视频广告,由 Gemini 驱动购买、执行与全漏斗衡量。初期测试中,联合利华 Hellmann's 与 WPP Media 的独立触达提升 24%,单用户成本下降 25%。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。
Chrome 将 Gemini 的媒体理解能力在桌面端扩展到播客及 YouTube 以外的视频,播放后即可提取要点、定位信息或解释难点。Gemini 还能基于标签页内容生成互动测验,已在美印桌面端以英文推出,未来数月扩展至更多地区和移动端。此外 Chrome 新增跨设备发送标签页时保留滚动位置和未填完表单,并支持分屏视图、标签组、沉浸式阅读模式和朗读功能。
Google 在 Google Health 应用中推出 Health Guardian 功能,Pixel Watch 用户可设置血压趋势、胰岛素抵抗趋势和睡眠呼吸质量指标,本周开始启用,首批趋势报告将于 10 月初送达。
Google Photos 上线 5 项更新,其中 Photos in Gemini Spark 支持用一句提示词挑选、提亮并分享家庭合照,面向美国符合条件的 Google AI Pro 和 Ultra 订阅用户。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。
Google 为 Demand Gen 推出九月更新,在 YouTube 广告中上线 Business Agent,观众可在视频广告旁与对话式 AI 互动,通过商品 feed 即时获取产品或品牌信息。