Google Cloud 在 Database Migration Service 中用 Gemini 加速 PostgreSQL 迁移
Google Cloud 的 Database Migration Service(DMS)现已内置由 Gemini 驱动的 AI 代码转换功能,可将 Oracle PL/SQL、SQL Server T-SQL 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL。
Google Cloud 的 Database Migration Service(DMS)现已内置由 Gemini 驱动的 AI 代码转换功能,可将 Oracle PL/SQL、SQL Server T-SQL 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布自主科研原型 Science One Framework 与自动审计工具 CoE Audit。
Modem 的 MCP 服务器和公共 API 向所有用户开放,MCP 客户端可连接 https://mcp.modem.dev/mcp,公共 API 位于 api.modem.dev/v1。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件,Opus 4.7 用 14 小时、251 美元推理成本完成了人类需 2-17 周的任务,25 个目标程序中 17 个有满分运行。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
Modem 发布《Writing Code for Agents》系列第一篇,解释 Claude Code、Codex 等编码智能体主要靠 ripgrep 文本搜索导航代码库,并给出命名、类型、注释位置等可发现的写码建议。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。
推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
OpenAI 在 GitHub 上线新仓库 openai/redcard,定位是借助 Codex 帮助用户从工作中抽身。仓库名与正文均未披露具体功能、版本号或可用性细节。
OpenAI 在 GitHub 发布 openai/codex-security 仓库,提供用于查找、验证和修复安全漏洞的 Codex Security CLI 和 TypeScript SDK。npm 包名为 @openai/codex-security。
Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。
推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
美团发布 LongCat-2.0,总参数 1.6 万亿的 MoE 大语言模型,每 token 激活约 48B,权重以 MIT 协议开源。预训练覆盖超过 35 万亿 token,训练与部署全程基于 AI ASIC 超算集群;模型引入 LongCat Sparse Attention,并在 1M 上下文数据上训练,支持 GPU 与 NPU 部署。
美团发布 LongCat-2.0,一个总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,训练与部署完全基于 AI ASIC 超节点,预训练消耗超过 35 万亿 token。
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1,331 个专家测试。
We’ve been impressed with GLM-5.2 and so are introducing a $9.99/month subscription to give you 2-5x discounted access to it and other open weight models like DeepSeek, Kimi, MiniMax, Mimo, Qwen. Use it on Cline CLI & IDE with $1.99 special promo if sign up via: npm i -g cline
Sebastian Raschka 发布长篇教程,讲解如何用 Ollama 服务 Qwen3.6 35B-A3B 等开源权重模型,并接入 Qwen Code、Codex、Claude Code 三种编码 agent harness,评测代码在 https://github.com/rasbt/local-coding-agent-evals。
阿里巴巴在 GitHub 开源 atrex-kernel-agent,这是一个面向 GPU kernel 实现、分析、profiling 和迭代优化的端到端 Agent 项目。它能通过结构化、以 profiling 为导向的工作流,帮助 Agent 把 PyTorch 逻辑或已有 kernel 转成高性能 GPU kernel。
Together AI 发布多GPU kernel生成基准 ParallelKernelBench(PKB),含87道源自 Megatron-LM、DeepSpeed、TensorRT-LLM 等真实代码库的问题,任务是将 PyTorch + NCCL 参考实现替换为直接通过 NVLink 通信的 CUDA kernel。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Steve Yegge 撰文认为,随着 Fable 级模型因安全问题被美国政府短暂关闭,超级智能将在最多两三代模型之后被政府管控,多数人可用的大模型能力将呈现平台期。
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、启发式论证、博弈论与人格。
browser-use 上线 plugins 仓库,为编码智能体提供 browser-harness 和 video-use 两款插件。该仓库托管在 GitHub,具体功能与用法尚未在现有信息中展开。
Hugging Face 在 GitHub 上线新仓库 tau,将 Pi 的极简编程智能体移植为 Python 版本。该仓库定位为 Pi 编程智能体的 Python 实现,目前公开信息仅说明其为移植项目。
Arvind Narayanan 撰文认为现有证据足以否定 AI 达到某能力阈值就会引发大规模裁员的叙事。
推荐理由:作者用裁员数据和 decide-execute-deliver 框架解释为何 AI 未取代软件工程师,提供了可迁移的分析视角。
小米 MiMo 发布并开源终端编程智能体 MiMo Code V0.1,采用 MIT 许可,内置 MiMo V2.5 多模态模型(限时免费、百万 token 上下文)。
推荐理由:官方宣布 MiMo Code V0.1 开源,列出无限上下文、语音输入等具体能力和一行安装命令,可据此评估迁移成本。
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
Fable 5 is state-of-the-art on nearly all tested benchmarks, with exceptional performance in software engineering, knowledge work, scientific research, and vision. The longer and more complex the task, the larger Fable 5’s lead over our other models.
推荐理由:作者补充了基准之外的第一手使用感受,指出长难题求解能力跃升和安全护栏偏敏感,可作选型参考。
Ethan Mollick 分享了他提前试用首个面向公众发布的 Mythos 级模型 Claude 5 Fable 的体验,认为其明显超越此前所有模型,单个提示词即可连续工作最多十二小时执行多页规格。
推荐理由:作者以亲历测试描述使用感受与局限,给出了可验证的工作时长、成本和黑盒化体验等一手细节。
Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。
Alibaba 在 GitHub 发布 loongsuite-pilot,一个 local-first 的 AI 编码 Agent 遥测收集器,统一以 OpenTelemetry 事件收集 Claude Code、Codex、Cursor 等工具的数据。它提供 token 用量、成本、traces 和安全审计,并可导出到任意目的地。
OpenAI 在 GitHub 上线 openai/role-specific-plugins 仓库,提供面向不同角色的 Codex 插件模板。仓库内容为角色专用的 Codex plugin templates,具体角色划分与模板数量原文未披露。
Steve Yegge 撰文称运行了约50年的技术面试流程正在走向消亡,AI 辅助简历、AI 作弊和岗位快速变化正让传统评估体系失效。他结合在 Amazon 担任 Bar Raiser 和 Google 招聘委员会的经历指出面试结果统计上很差,主张用实习、co-op 等临时雇佣以及他称为 campfire 的付费真实工作试用替代面试,并让候选人的工作成果形成可携带的记录。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。