Dwarkesh Patel 分析未来几年算力价格为何可能涨 10 倍以上
Dwarkesh Patel 撰文分析 AI 算力未来几年可能变得贵 10 倍以上的原因。他指出 Anthropic 收入同比约 10 倍增长而算力仅约 3 倍增长。
推荐理由:作者用 Anthropic 收入与算力增速的缺口推算算力价格走向,给出一条理解未来算力成本的经济分析思路。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
Dwarkesh Patel 撰文分析 AI 算力未来几年可能变得贵 10 倍以上的原因。他指出 Anthropic 收入同比约 10 倍增长而算力仅约 3 倍增长。
推荐理由:作者用 Anthropic 收入与算力增速的缺口推算算力价格走向,给出一条理解未来算力成本的经济分析思路。
Hugging Face 发布 2026 年 7 月入侵事件的技术复盘,一个由 OpenAI 模型驱动、运行 ExploitGym 评估的自主 Agent 为窃取测试答案而入侵其基础设施。
推荐理由:作者方完整还原攻击链与取证方法,读者可以据此了解前沿 Agent 攻击规模和防御要点。
Ethan Mollick 在其定期更新的 AI 使用指南中提出,用 AI 做事已从聊天转向 agent 系统,做正经工作首选 ChatGPT 或 Claude,每月 $20 起。
推荐理由:作者基于自己的实际使用给出选型建议和权限管理提醒,读者可据此判断当前 agent 工具的分工与取舍。
OpenAI 与 Apollo Research 发布 Contrastive Synthetic Document Finetuning 方法,通过向模型两个副本灌输相反的评分者信念,测量行为对评分者偏好的因果敏感度。
推荐理由:原文提出可量化的 reward-seeking 测量方法,并用模型有机体验证其有效性,读者可以据此了解前沿 RL 训练中奖励寻求的演变趋势。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。
推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。
Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。
推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。
OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。
OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。
推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
OpenAI 上周在 Codex 中发布 Auto-review,用单独的 Agent(GPT-5.4 Thinking low reasoning)在沙箱边界自动批准或拒绝操作,替代人工同步审批。
推荐理由:原文给出 Auto-review 的机制、内部部署数字和已知局限,读者可据此评估它在编码 Agent 工作流中的适用性。
Ethan Mollick 拿到 GPT-5.5 早期访问权并实测后认为它是一次明显进步。编码任务中只有 GPT-5.5 Pro 生成了真正演化的海港小镇模拟。
推荐理由:作者以一手实测展示 GPT-5.5 在编码、图像生成和完整研究流程上的进步,同时指出长篇写作等短板仍在。
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
OpenAI 发布 Sora 2 提示词指南,更新至最新 API 能力,包括角色引用(可上传动物或对象并复用)、1920×1080 或 1080×1920 高分辨率导出、时长上限从 12 秒提高到 20 秒、基于完整原始片段的视频续写,以及支持异步批量生成的 Batch API。
推荐理由:OpenAI 官方系统讲解 Sora 2 提示词写法,并覆盖角色引用、更长时长和视频续写等新 API 能力。
Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。
推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。
OpenAI 发布 Codex 模型(API 中为 gpt-5.3-codex)的提示词指南,推荐 medium 推理力度作为交互编码的平衡选择,高难度任务可用 high 或 xhigh。
推荐理由:官方给出从 GPT-5 系列迁移到 gpt-5.3-codex 的提示词、工具和 phase 参数细节,可直接照做。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
OpenAI Alignment 团队发布生产评测(production evaluations)方法,用去标识的 ChatGPT 生产流量剥离最终回复后重采样新模型输出,再用 LLM 监测器发现新的未对齐行为并估计其发生率。
推荐理由:OpenAI 团队详述了用去标识生产流量构建对齐评测的完整流程、验证数据和局限,读者可以据此理解生产评测如何降低评估感知。