Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 面向可信网络防御者开放,价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。
推荐理由:官方公告给出定价、输出 token 上限和多个基准分数,读者可以据此评估它在编码与安全防御场景的落点。
推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者逐步开放。
Anthropic 宣布 Claude for Government 正式可用,面向联邦和州政府机构提供 FedRAMP High 授权环境下的 Claude 编码与智能体能力,此前自 7 月起处于公开测试。
Claude Code 发布 v2.1.286,为堆叠的权限请求加上"2 of 5"计数,并支持在全屏列表中点击"N more"行跳转。该版本修复了 claude --resume 和 --continue 在并行工具调用后丢失全部轮次、工具或 hook 返回对象/数字/布尔值时触发 API 400 错误,以及云会话因容器在 transcript 加载中被停止而无法唤醒等问题。
xAI 宣布 Grok 可在 OpenCode 中使用,用户连接 Grok 账号后即可用 Grok Build 编码,该模型同样驱动 xAI 的终端编码智能体。在 OpenCode 内运行 /connect 并选择 xAI,支持 SuperGrok 订阅的 OAuth 浏览器登录,以及面向 SSH 或远程主机的 Headless / Remote / VPS 验证码登录方式。
xAI 发布终端编码智能体 Grok Build 的早期测试版,面向所有 SuperGrok 和 X Premium Plus 订阅者开放。它支持计划模式审批、AGENTS.md、hooks、skills 和 MCP 服务器开箱即用,可将任务分派给并行运行的子代理,并提供 headless 模式(-p)与完整 ACP 支持。用户可输入 /feedback 提交反馈。
推荐理由:官方介绍覆盖计划模式、并行子代理和 headless 模式等能力,读者可据此判断如何接入现有终端工作流。
xAI 宣布 Grok 订阅可直接在开源智能体编程平台 Kilo Code 中使用,SuperGrok 或 X Premium+ 用户无需单独的 API key 即可连接 Grok 账号,调用包括 Grok Build 在内的最新模型。
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
Composer 2.5 已在 Grok Build 中上线,用户输入 /model 后可在菜单中选择该模型。xAI 称其为一款快速、SOTA 的模型,擅长长时间运行任务与遵循复杂指令。
xAI 宣布 Grok 与 X Premium 订阅可在 Warp 终端智能体开发环境中直接使用,覆盖近百万开发者。用户连接 SuperGrok 订阅后即可调用 Grok 模型,包括驱动 Grok Build 的 grok-build-0.1。更多智能体与集成即将面向 SuperGrok 和 X Premium 订阅者推出。
xAI 为 Grok Build 推出 Agent Dashboard,把所有会话集中到一屏,支持并行运行、按状态排序并优先处理等待输入的会话。用户可在 shell 运行 grok dashboard,或在会话内用 /dashboard(Ctrl+\)打开;支持不离开面板查看并回复输出、底部输入框派发新会话、接管任意会话,关闭面板后所有会话继续运行。
xAI 在 Grok Build 中推出 /goal 模式,支持长时自主执行任务,智能体会持续工作直到任务完成并验证,包括审查代码、检查网页或执行脚本。用户只需一行给出目标,智能体会规划方案、把工作拆成进度清单并开始执行,期间可继续追加指令,另有新命令用于监控和引导长时任务,完成后面板显示 Complete 且清单全部勾选。
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
xAI 于 7 月 16 日发布 Grok 4.5,定位为其最强模型,面向编码、智能体任务和知识工作,与 Cursor 联合训练。
推荐理由:官方发布页给出了基准分数、定价、token 效率和免费入口等具体数据,读者可据此与其他模型比较并选择使用场景。
xAI 宣布 Grok Build 支持 Workflows,用自然语言描述任务后由 Grok 规划并在后台分发给数百个并行 agent 执行,完成后汇报结果。
推荐理由:官方说明了 workflows 的编排方式、agent 预算和复用机制,读者可据此判断它适合哪类多智能体任务。
xAI 宣布 Grok 4.5 上线 GitHub Copilot,覆盖云 Agent、Copilot CLI 和 VSCode IDE,用户可在模型选择器中直接选用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI console 直接使用,定价为每百万输入 token $2、每百万输出 token $6。
xAI 推出 Build Mode,用户用自然语言描述想法,Grok 在对话中直接写出代码并生成可运行的预览,可继续修改布局、功能和样式。完成后可发布为 grok.me 链接或自定义域名。Build Mode 以 Early Beta 形式面向 SuperGrok Heavy 订阅用户开放,覆盖 grok.com、iOS 和 Android。
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长程智能体和交互视觉类任务能力,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 分)。
推荐理由:官方公告给出了各基准对比数字、API 定价和开放入口,读者可据此评估 Grok 4.6 在智能体编码上的位置。
xAI 宣布最新编程模型 Grok 4.6 在 GitHub Copilot 上线,覆盖云 agent、Copilot CLI 和 VS Code IDE,用户在模型选择器中选 "Grok 4.6" 即可使用,部分企业和商业用户需在 Copilot 设置中启用。该模型也可通过 SpaceXAI 控制台使用,价格为每百万输入 token $2、每百万输出 token $6。
欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。
TensorZero 团队将自研开源网关部署为 Cursor 与 LLM 提供商之间的自托管代理,成功观察并替换 Cursor 的模型调用。
推荐理由:作者以第一手实验给出自建代理查看 Cursor 提示词的完整路径,还分享了系统提示词和模型分层等可复核的细节。
UC Berkeley 等机构团队发布 OpenSage,一个让 AI 自动生成 Agent 拓扑、合成管理工具并控制分层记忆的 Agent Development Kit。
Visual Studio 现已支持最新版 .NET 与 C# 14,并原生集成 GitHub Copilot 与 Azure AI,覆盖 Web、云、桌面及 AI 工作负载。
GitHub 正在优化 VS Code 中 GitHub Copilot 的 token 效率,以应对其转向按用量计费后每个 token 都变得关键的变化。官方称让智能体框架更省 token 是持续进行的工作,将逐个小的改进持续投入。
Microsoft 生成式 AI 通过深度学习按自然语言提示词生成文本、图像、音乐和代码,区别于仅做分析预测的传统 AI、预测式 AI 和对话式 AI。
METR 发布 RE-Bench 基准,包含 7 个 ML 研究工程环境、71 次人类专家尝试,以及 Claude 3.5 Sonnet 和 o1-preview 智能体的结果,全部开源。
MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。
推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。
METR 发布对前沿模型编写 GPU kernel 能力的测量,用自建 KernelAgent 脚手架在改进版 KernelBench 上测试。相同模型下 KernelAgent 达到 1.81x 平均加速,远高于原 KernelBench 的 1.05x;o3-mini-high 单模型达 1.81x,全模型 best-of-k 达 2.01x。
MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。
推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。
METR 在 arXiv 发布 HCAST(Human-Calibrated Autonomy Software Tasks)基准,包含 189 个机器学习工程、网络安全、软件工程和通用推理任务,并收集 563 条人类基线(超 1500 小时),任务耗时从 1 分钟到 8 小时以上。
METR 提出用任务长度(按人类专家耗时衡量)来度量 AI 能力,发现 6 年来模型能以 50% 可靠性自主完成的任务长度呈指数增长,翻倍时间约 7 个月。当前模型对耗时 4 分钟以内任务成功率近 100%,超过约 4 小时则不足 10%;Claude 3.7 Sonnet 的 50% 成功率时间视界约一小时。
推荐理由:METR 用人类任务时长衡量智能体能力,给出 6 年约 7 个月翻倍的指数趋势及其外推含义。
METR 开展随机对照试验,16 名资深开源开发者在自己的大型开源仓库(平均 22k+ stars、1M+ 行代码)上完成 246 个真实 issue,允许使用 AI(主要是 Cursor Pro 与 Claude 3.5/3.7 Sonnet)时完成任务反而慢 19%。
推荐理由:METR 的随机对照试验给出了 AI 使资深开源开发者变慢 19% 的实测结果,可用于校准基准分数与自我感知之间的落差。
METR 基于其时间视野论文,用 logistic 模型分析 GPQA、MATH、Mock AIME、LiveCodeBench、OSWorld、WebArena、Tesla FSD 等 9 个基准,发现各领域普遍呈指数或略超指数增长。
METR 在来自 stdlib-js 和 hypothesis 两个仓库的 18 个真实任务上,用 Inspect ReAct 智能体运行 Claude 3.7 Sonnet,算法评分下成功率为 38%(±19%,95% CI),但人工抽查的 15 个 PR 中无一可直接合并。
METR 宣布重新设计其开发者生产力实验,认为 2025 年 8 月启动的二次研究中因开发者拒绝无 AI 工作而出现选择效应,使数据无法可靠反映 AI 工具的生产力影响。
推荐理由:原文解释了为何 AI 更广泛采用带来的选择效应使其实验结果不可靠,并给出初步数据与后续研究设计思路。
METR 发布 MirrorCode 基准初步结果,显示 AI 智能体可完成数周时长的编码任务,包括重新实现一个 16000 行代码库。同页还汇总了 349 名技术工作者调查,自报因 AI 工具工作价值中位数提升 1.4–2x,以及跨 9 个基准的时间跨度研究和监测性评测初步结果。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。