ARC Prize 推出 ARC-AGI Public Leaderboard 并投入 15 万美元验证基金
ARC Prize 官方推出 ARC-AGI-Pub 公开排行榜,使用公开评测集,取消算力限制、允许联网,并提供 15 万美元验证基金,对复现并验证的高分提交报销最高 $2,500 API 费用。
ARC Prize 官方推出 ARC-AGI-Pub 公开排行榜,使用公开评测集,取消算力限制、允许联网,并提供 15 万美元验证基金,对复现并验证的高分提交报销最高 $2,500 API 费用。
ARC Prize 官方公布 2024 年获奖名单并发布技术报告,共 1,430 支团队提交 17,789 份方案,大奖仍未被认领。the ARChitects 以 53.5% 获第一名并获 2.5 万美元,Kaggle 竞赛期间 ARC-AGI-1 SOTA 从 33% 升至 55.5%(MindsAI 因未开源不符获奖资格)。
The Economist 用 1981 年以来覆盖 100 国的世界价值观问卷测试 25 个前沿 AI 模型,按世俗到传统、生存到自我表达两轴绘制分布。
AI 公司在 12 个月内投入 $9.75b 于前向部署工程(FDE),相当于 Accenture 年度人力成本的四分之一。
推荐理由:原文把 $9.75b FDE 投入拆成三种资本结构,并解释部署取代模型能力成为瓶颈后的护城河逻辑。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
ARC Prize Foundation 宣布推出 ARC Prize Verified 计划,通过官方隐藏测试集认证模型在 ARC-AGI 上的成绩,通过者可进入官方榜单并获得认证徽章。
Anthropic 的 Claude 模型现可在 Google Cloud 上运行,支持 MCP、提示词缓存与专用容量,并可在无服务器基础设施上按负载扩展。该组合将 Anthropic 的安全模型与 Google Cloud 的基础设施、统一治理和安全控制结合,用于构建和部署生产级 AI 智能体。官方称有团队借此将代码开发速度提升 20% 至 30%。
ARC Prize 2025 结束,Kaggle 冠军 NVARC 在 ARC-AGI-2 私有集上取得 24.03%(每任务 $0.20),大奖仍未被认领;共 1,455 支队伍提交 15,154 份方案、90 篇论文,获奖方案与论文全部开源。
推荐理由:官方复盘 ARC Prize 2025 结果,提出 refinement loop 框架,并分析知识过拟合与基准设计需要演进的问题。
Google Cloud 2026 年 Q2 营收 248 亿美元,同比增长 82%,超出 223 亿美元的市场预期,增速与 NVIDIA 数据中心业务趋于一致。
推荐理由:作者用财报数据拆解 Google Cloud 增速与 NVIDIA 数据中心业务趋同的来源,并对比 AWS 利润率变化,提供了一个理解云厂商 AI 需求的视角。
Tomer Tunguz 分析三大云厂商增速分化:Azure 上季度增长 43%、全年收入超 1000 亿美元,Google Cloud 增长 82%,AWS 增长 28%。
推荐理由:作者以三家云厂商的财报数据对比自建与转售前沿模型的经济结构,指出微软积压订单对 OpenAI 的集中依赖,提供了一个理解云厂商资本开支差异的框架。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
ARC Prize 公布 2025 年赛事合作伙伴生态,Lambda、Modal、Google Cloud、Groq、Hyperbolic、Strong Compute、RunPod 提供算力支持,AI21 提供模型额度,Granola 提供生产力工具。
Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。
推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。
Google 认为 Go 是 AI 辅助软件工程的理想语言,因为 AI 编程时代开发重心已从写代码转向审查与维护代码。Go 自带格式化、测试框架、依赖管理和安全工具,AI 模型可借助这套端到端工具链更快、更便宜、更可靠地处理 Go 代码。Go 优先可读性而非可写性,其统一风格也为 LLM 提供了更标准化的训练数据。
Google 发布开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials,起步支持规范版本 2.2 和 2.4。
HeyGen 与 Google Cloud 合作,把 180 亿参数以上的数字人视频扩散模型 Avatar IV 迁移到八芯片 Trillium(v6e)主机上,速度比首个可用版本提升 1.86 倍。
Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。
推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。
Google 在 ADK 中推出原生的 live 语音 Agent 评测能力,可用模拟用户以音频说话、对语音回复打分,并复用已有的文本 Agent 评测流程。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 为目标模型完成多项优化,支持 4K+ token 文本与 15K+ token 多模态输入的嵌入推理。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Google 复盘其 AI Agents Challenge 获奖提交,归纳出四种反复出现的工程模式:双向 MCP(智能体既是自身工具的客户端也是可供其他智能体调用的 MCP 服务器)、基于事件总线的并行并发、回退模型必须通过与主模型相同的验证函数,以及在昂贵模型调用前做分层路由。
推荐理由:Google 从获奖提交的真实代码里提炼四种智能体工程模式,双向 MCP、事件驱动并发、同标准回退和分层路由都给出可直接借鉴的做法。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。
Google 宣布 Agent Development Kit(ADK)for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能完全对齐,并新增 Android 端侧扩展。
针对 AI 编程智能体,端到端基准(如 Terminal-Bench、DeepSWE)只能给出综合分数,无法解释涨跌原因,行为评估则断言具体可观测动作,如提示词不明确时是否反问、改构建文件前是否跑本地校验。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证,同时在实验室测试中保持蛋白的生物功能。
推荐理由:原文给出水印在湿实验中不影响蛋白功能、并开放代码与权重的关键细节,读者可据此评估其对生物安全筛查的实际价值。
Google 发布 SynthID Bio,可将不可感知、可验证的水印直接嵌入 AI 设计的蛋白质序列和预测的 3D 结构中,同时保持其生物功能。在针对目标蛋白的实验室测试中,加水印的设计在性能与自然多样性上与未加水印版本相当。该技术旨在为生物安全提供溯源层,并维护开放科学数据库的完整性。
Google 在其隐私权政策中说明,会收集账号信息、用户创建或上传的内容、应用与浏览器及设备信息、活动记录和位置信息,并用于提供服务、维护改进、开发新服务、个性化内容与广告、评估效果、与用户沟通及安全防护。Google 不会根据种族、宗教、性取向或健康状况等敏感类别投放个性化广告,也不会根据 Google 云端硬盘、Gmail 和 Google 相册中的内容投放个性化广告,且不会出售用户个人信息。
EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。
Andrej Karpathy 的 Google 暑期实习工作最终成为 CVPR 2014 Oral 论文《Large-scale Video Classification with Convolutional Neural Networks》。
Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。
PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,其核心特质表达在 Persona Vectors 75 连贯性下限处分别比对比激活加法高出 33.2、18.3 和 17.8 分。
研究用两阶段实验设计在社交媒体信息流中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 四个 LLM 的重复曝光效应,共收集 336,000 条真实性、重要性、情感和兴趣评分。
研究用探针、对比方向和表征相似度考察 Gemma 4 31B 对九种非洲语言及三种对照语言的表征,发现非洲语言间的"非洲 vs 西方"对比方向在多个层上比它们与对照语言更对齐,跨语系比较在十二层中的五层通过 Holm 阈值。
Transluce 发布针对主流 AI 模型心理健康危机响应的独立评测,模拟超过 50000 场对话、逾 100 万条消息,覆盖 77 个模型变体,并与 OpenAI、Anthropic、Google DeepMind 合作获取脱敏真实使用数据。
推荐理由:原文给出了模拟规模、模型代际对比结果和开放数据集,读者可以据此了解 AI 心理健康安全评测的现状与方法。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
UC Berkeley 等机构及 Anthropic、OpenAI、Google 发布 ExploitGym 基准,含 898 个真实漏洞(用户态程序、V8 引擎、Linux 内核),测试 AI 智能体能否把已知漏洞变成完整攻击。
推荐理由:原文给出真实漏洞上智能体自主生成完整攻击代码的成功率和防御绕过数据,读者可据此评估 AI 对攻防两侧的实际影响。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
据 The Information 报道,Google 试点计划向约 100 家数字出版商付费,用于 AI Overviews、AI Mode 和 Gemini 聊天机器人中使用的内容。
Palisade Research 上线 frominside.ai,汇集 OpenAI、Google、Anthropic 现任及前员工的十余段访谈,警告超级智能可能致人类灭绝。