Tomer Tunguz:AI 时代软件工程转向系统设计与验证循环
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Theory Ventures 合伙人 Tomer Tunguz 撰文认为 AI 已把软件工程的重心从手写代码转向系统设计,核心是构建让 AI 验证自身输出的循环。
推荐理由:作者结合 Artemis 与 Lauren Tan 的案例,把 AI 时代的软件工程归纳为基于 Meadows 三性质的验证循环设计,视角有可借鉴的分析框架。
OpenAI 发布 GPT-6.1 Sol,因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出,OpenAI 称其在 agentic coding、计算机使用和办公任务上接近 Astra,成本约五分之一。
推荐理由:原文汇总了 GPT-6.1 Sol 的定价与多项基准对比数据,读者可以据此判断它与 Astra、Claude 的成本性能权衡。
OpenAI 在旧金山 Fort Mason 举行 DevDay 2026,作者在现场逐条记录主题演讲与分会场。会上发布个人智能体 Dots(由 GPT-6 Astra 驱动,Pro 和 Enterprise 用户当天可用)、ChatGPT Space 协作空间,以及约 Astra 智能水平但价格为其五分之一的新模型 GPT-6.1 Sol。
推荐理由:作者以第一手现场笔记记录发布会全程,涵盖个人智能体 Dots、新模型和 Codex 更新,还附上现场演示翻车等细节。
OpenAI 发布 GPT-6.1 Sol,定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。
推荐理由:原文点出 GPT-6.1 Sol 的定位与价格对比,读者可以据此判断它在编码等场景的成本取舍。
Latent Space AINews 汇总 OpenAI DevDay 2026 发布内容,包括常驻 Agent 产品 dots(由 GPT-6 Astra 驱动。
推荐理由:汇总了 OpenAI DevDay 的模型、Agent 与定价变化,并补充独立评测数字,方便对照官方口径看待实际表现。
Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载。
推荐理由:原文给出与 GPT-6 Astra 的任务成本对比和 Bedrock 安全控制细节,读者可据此评估在自有工作流中采用的成本收益。
Announcing dots. Dots work 24/7 for you, learn from your feedback, have their own computer, browser and can be connected to over 4k apps in our ecosystem. They’re powered by Astra our best model yet. Included in your Pro plan, without drawing down on any of your usage. You can even call a dot while it’s working. We’re getting you started with your primary dot today and soon you’ll be able to create entire teams of them.
推荐理由:作者本人澄清了 dot 的计费方式,直接使用不消耗额度,可帮读者准确理解实际成本。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:Arena 的实测榜单数据显示该模型以约 1/5 的成本进入 WebDev 前四,读者可据此权衡性价比选型。
OpenAI 推出 Codex cloud environments,关闭笔记本后智能体仍可继续工作。环境可复用,仓库、依赖、脚本和设置已预先就位,减少配置、加快启动。
推荐理由:原文说明 Codex 云环境的可复用特性,读者可以据此判断关闭笔记本后让智能体继续运行的用法。
推荐理由:官方同时给出能力升级点与缓存输入 95% 折扣定价,开发者可据此评估长时运行编码智能体的成本与迁移价值。
推荐理由:原文给出了产品的能力范围和使用方式,开发者可以据此判断哪些日常编码事务可以交给它处理。
推荐理由:原文给出具体价格与能力对比,读者可以据此判断它在大语言模型选型中是否值得替换现有方案。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。
推荐理由:指南围绕 Sonnet 5.5 与 Opus 5.5 的选型、迁移调参和 Claude Code 使用给出实操建议,便于开发者上手。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作。
推荐理由:文章给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它适合承接哪类持续运行的编码任务。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:原文给出 Sonnet 5.5 相对 Sonnet 5 的速度、成本和适用场景,读者可据此判断是否切换日常 Claude Code 任务。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.
推荐理由:作者以 Claude Code 修复 bug 的视频演示新模型编码能力,可借此直观感受 Sonnet 5.5 相对上代的实际表现。
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,输出速度提升超过 30%,单任务成本最多降低 30%,在多项基准上接近 Opus 5.5。
推荐理由:对比 Sonnet 5.5 与 Opus 5.5、Sonnet 5 的基准与定价,可看清中端模型在编码任务上的跃升与成本取舍。