跳到正文

#Google

今日 55 条
9月30日周三
  1. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  2. Anthropic:The Institute(旗舰研究长文 · 网页)32

    Claude 登陆 Google Cloud:用 Anthropic 模型构建高级 AI 智能体

    Anthropic 的 Claude 模型现可在 Google Cloud 上运行,支持 MCP、提示词缓存与专用容量,并可在无服务器基础设施上按负载扩展。该组合将 Anthropic 的安全模型与 Google Cloud 的基础设施、统一治理和安全控制结合,用于构建和部署生产级 AI 智能体。官方称有团队借此将代码开发速度提升 20% 至 30%。

  3. ARC Prize:官方博客72

    ARC Prize 2025 结果与分析:NVARC 以 24.03% 夺冠,官方聚焦 refinement loop 与知识过拟合

    ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。

    推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。

  4. Tomer Tunguz 博客(VC 分析)77

    Google Cloud Q2 2026 营收增长 82% 至 248 亿美元,增速趋同 NVIDIA 数据中心业务

    Google Cloud 2026 年 Q2 营收 248 亿美元,同比增长 82%,超出 223 亿美元的市场预期,增速与 NVIDIA 数据中心业务趋于一致。

    推荐理由:作者用财报数据拆解 Google Cloud 增速与 NVIDIA 数据中心业务趋同的来源,并对比 AWS 利润率变化,提供了一个理解云厂商 AI 需求的视角。

  5. Tomer Tunguz 博客(VC 分析)72

    Tomer Tunguz 分析微软转售前沿模型:Azure 增长 43% 但利润结构与订单集中度承压

    Tomer Tunguz 分析三大云厂商增速分化:Azure 上季度增长 43%、全年收入超 1000 亿美元,Google Cloud 增长 82%,AWS 增长 28%。

    推荐理由:作者以三家云厂商的财报数据对比自建与转售前沿模型的经济结构,指出微软积压订单对 OpenAI 的集中依赖,提供了一个理解云厂商资本开支差异的框架。

  6. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  7. Google Developers Blog(RSS)42

    为什么 Go 是 AI 辅助软件工程的理想语言

    Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。

  8. Google Developers Blog(RSS)62

    Google 用 ADK 构建零信任 AI Agent 的三层安全实践

    Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。

    推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。

  9. Google Developers Blog(RSS)41

    如何用深度学习和 Keras 解码宇宙信号

    Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。

  10. Google Developers Blog(RSS)67

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。

    推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。

  11. Google Developers Blog(RSS)23

    Google Cloud 详解 Gemini Enterprise DevEx Program:以治理工作流冲刺打磨开发者体验

    Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。

  12. Google DeepMind:Blog(RSS)65

    Google DeepMind 发布 SynthID Bio 为 AI 生成的蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证,同时在实验室测试中保持蛋白的生物功能。

    推荐理由:原文给出水印在湿实验中不影响蛋白功能、并开放代码与权重的关键细节,读者可据此评估其对生物安全筛查的实际价值。

  13. Google Blog:AI(RSS)48

    Google 推出 SynthID Bio,将水印技术引入合成生物学

    Google 发布 SynthID Bio,可将不可感知、可验证的水印直接嵌入 AI 设计的蛋白质序列和预测的 3D 结构中,同时保持其生物功能。在针对目标蛋白的实验室测试中,加水印的设计在性能与自然多样性上与未加水印版本相当。该技术旨在为生物安全提供溯源层,并维护开放科学数据库的完整性。

  14. Every:最新文章(网页)15

    Google 隐私权政策:Google 收集哪些信息以及如何使用

    Google 在其隐私权政策中说明,会收集账号信息、用户创建或上传的内容、应用与浏览器及设备信息、活动记录和位置信息,并用于提供服务、维护改进、开发新服务、个性化内容与广告、评估效果、与用户沟通及安全防护。Google 不会根据种族、宗教、性取向或健康状况等敏感类别投放个性化广告,也不会根据 Google 云端硬盘、Gmail 和 Google 相册中的内容投放个性化广告,且不会出售用户个人信息。

  15. Baseten Base Labs:模型研究55

    Baseten 介绍 Google 300M 参数嵌入模型 EmbeddingGemma 及其调用示例

    EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。

  16. Andrej Karpathy:Blog(网页)63

    Karpathy 实测人类在 ImageNet 上的分类准确率并与 GoogLeNet 对比

    Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。

  17. Transluce(网页)75

    Transluce 发布迄今最大规模 AI 模型心理健康危机响应独立评测

    Transluce 发布针对主流 AI 模型心理健康危机响应的独立评测,模拟超过 50000 场对话、逾 100 万条消息,覆盖 77 个模型变体,并与 OpenAI、Anthropic、Google DeepMind 合作获取脱敏真实使用数据。

    推荐理由:原文给出了模拟规模、模型代际对比结果和开放数据集,读者可以据此了解 AI 心理健康安全评测的现状与方法。

  18. Berkeley RDI:Blog(AI 安全与评测)77

    Berkeley RDI 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准:898 个真实漏洞测试 AI 智能体自主攻击能力

    UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。

    推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。

  19. Goodfire Research(网页)50

    Goodfire 推出 Silico:用内部表征做奖励信号,幻觉降低 58%

    Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。