Ethan Mollick 实测 Claude Code 并详解其智能体机制
Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。
推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。
Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。
推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。
QwenLM 推出 qwen-code-examples,汇集 Qwen Code 的实用示例与最佳实践。该仓库面向开发者,提供可直接参考的代码范例,帮助上手 Qwen Code 的使用。
OpenAI 开发者 Cookbook 发布 gpt-image-1.5 图像模型提示词指南。该模型在写实度、准确性和可编辑性上较前代有明显提升,支持高质量渲染与低延迟场景。指南给出提示词结构、显式约束、迭代式小步修改等方法,并用信息图、照片级写实、UI 模型、Logo、风格迁移、虚拟试穿、多图合成、儿童绘本角色一致性等示例演示生成与编辑工作流。
推荐理由:官方指南给出提示词结构、约束写法和质量与延迟取舍方法,示例覆盖生成与编辑的常见生产场景,可直接迁移到实际工作流。
OpenAI 发布 GPT-5.2 提示词指南,称其在企业级和智能体工作负载中提升了准确性、指令遵循、token 效率和多模态理解,但默认 reasoning_effort 为 none 且仍对提示词敏感。
推荐理由:OpenAI 官方给出 GPT-5.2 的提示词模式与迁移步骤,开发者可以直接套用其中模板和 evals 流程。
Sebastian Raschka 在 Ahead of AI 发表长文,解读 DeepSeek V3.2 相比 V3/R1 的主要变化。
OpenAI 开发者 Cookbook 发布教程,演示在同一 Realtime WebSocket 会话上通过带外的 response.create 请求(conversation 设为 none。
OpenAI 开发者 Cookbook 发布教程,演示如何用 Codex CLI 将 COBOL 投资组合系统等 legacy 代码库现代化,方法以一个 ExecPlan 为核心,拆为五个阶段:选定试点流、盘点与发现、设计与规格、实现与并行验证、沉淀为可复用模板。
Sebastian Raschka 系统介绍当前标准自回归 Transformer LLM 之外的四类替代方向:线性注意力混合、文本扩散模型、代码世界模型和小型递归 Transformer。
OpenAI 发布演示视频,展示如何用 Codex 的多模态能力设计、迭代并构建应用前端界面。Channing Conger 和 Romain Huet 演示了将 Codex cloud 作为前端设计伙伴,从手机创建 Codex 任务、草图构思新功能到多模态功能的不同用法。
OpenAI 发布一段 5 分钟演示,展示如何用 Codex CLI 搭配 GPT-5-Codex 完成开发任务。视频依次演示规划多人游戏实现、使用 CLI 命令、落地实现方案、部署游戏并试玩。
OpenAI Developers 发布了一场实操演示,展示通过 AI 智能体和工具调用(tool calling)为代码库提速的工具链。演示以动手实操形式呈现,聚焦于提升编码速度。
内容讨论在 Cursor 中让 Codex 式智能体协作的上下文策略,核心围绕智能体与上下文窗口展开。
OpenAI 发布视频介绍其最新开放模型系列 gpt-oss,支持开发者对模型进行适配、扩展和微调,并可与 GPT-5 结合使用以构建灵活的高影响力应用。视频还展示了 NVIDIA DGX Spark AI 计算机的现场演示。
多个团队分享了用 Codex 端到端交付真实软件的经验教训。内容聚焦 Codex 在产品交付流程中的实际应用。
Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。
推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。
Answer.AI 的 Jeremy Howard 用 SolveIt 把 Andrej Karpathy 两小时 tokenizers 视频教程改写成带可运行代码、超链接和图片的书稿章节。他采用两阶段"双对话"流程:先把带时间戳的转录稿拆成小段逐条补充超链接、代码示例等素材,再用充实后的转录稿分节撰写正文,避免一次性让 AI 转换导致内容平淡、遗漏概念和幻觉。
Sebastian Raschka 长文讲解 LLM 评测的四种主要方法:多选题基准(如 MMLU)、验证器、偏好排行榜(如 LM Arena)和 LLM-as-a-judge,并配从零实现的代码示例。
Sebastian Raschka 发布长文教程,用纯 PyTorch 从零讲解并实现 Qwen3 的 Dense 与 Mixture-of-Experts 架构。
OpenAI 发布 Web search 指南,介绍模型如何通过网页搜索获取最新信息并返回带来源引用的答案。
OpenAI 发布 API 速率限制指南,说明速率限制按组织级和项目级而非用户级设定,并随所用模型不同而变化。限制指标包括 RPM、RPD、TPM、TPD、IPM 及部分流式音频模型的每分钟音频分钟数,任一指标先触顶即受限。付费用量层级分为 Build、Launch、Grow,随累计充值额自动升级,层级越高速率限制越高。
OpenAI 发布 Evals 入门指南,介绍如何用平台 Datasets 功能创建数据集、编写提示词并生成输出来评估模型表现。Evals 平台正在弃用,现有内容在过渡期内仍可用,2026 年 10 月 31 日起对现有用户转为只读,11 月 30 日关停。
Sebastian Raschka 基于官方代码和技术报告分析 OpenAI 时隔 GPT-2 后发布的开放权重模型 gpt-oss-120b 和 gpt-oss-20b 的架构变化,包括 RoPE、SwiGLU、MoE、GQA、128 token 滑动窗口注意力、RMSNorm、注意力偏置和 sinks,以及让模型适配单张 GPU 的 MXFP4 量化。
OpenAI 发布函数调用官方指南,讲解如何用 JSON schema 定义的函数工具和自由文本的自定义工具连接模型与外部系统,示例覆盖 Responses API 和 Chat Completions。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线。基线模型在 Playground、Stadium 等易混类别上出错,还会幻觉出不存在的类别名;微调后分类更准确。整个流程通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
OpenAI 在 Responses API 中提供托管式 file search 工具,模型可通过语义与关键词检索,从预先上传到 vector store 的文件知识库中取回信息并自动调用。
OpenAI 发布 Batch API 使用指南,该接口以异步方式批量发送请求,成本比同步 API 低 50%,并提供更高的速率限制,每批任务在 24 小时内完成。Batch API 支持 /v1/responses、/v1/chat/completions、/v1/embeddings 等 7 个端点,输入文件为 .jsonl 格式,单个文件上限 200 MB,每个文件只能包含单一模型的请求。
OpenAI 发布对话状态管理指南,介绍三种跨轮次保留上下文的方式:手动传入历史消息、用 Conversations API 创建带持久标识的会话对象、以及通过 previous_response_id 串联响应。
OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。
推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling、Agents SDK 与 tool calling。内容聚焦 agentic 场景下的工具调用能力。
OpenAI Developers 分享在质量、性能与开销之间取得平衡的策略,围绕准确率、延迟和成本三个维度做取舍。内容聚焦如何为具体场景选择合适的权衡方案。
OpenAI 发布推理模型使用指南,说明 o 系列模型(如 o3、o4-mini)擅长规划、复杂决策和高精度任务,GPT 模型(如 GPT-4.1)更适合快速低成本的明确任务,多数 AI 工作流可组合两者,用 o 系列做规划、GPT 做执行。
OpenAI 发布 Evals API 使用指南,介绍如何通过 API 以编程方式配置评估,用 data_source_config 定义测试数据 schema、用 testing_criteria 设置评分器,并以 IT 工单分类为例演示完整流程。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling 与 Agents SDK。内容围绕 agentic 工具调用展开。
OpenAI 发布 Evals 最佳实践指南,讲解如何为 LLM 应用设计评估,并宣布 Evals 平台将于 2026 年 10 月 31 日对现有用户转为只读、11 月 30 日关停。指南覆盖从单轮交互到多智能体四种架构中非确定性出现的环节,给出指标型评估、人工评估和 LLM-as-a-judge 的取舍建议,并提醒用 gpt-6-astra 构建 LLM 评审时需先与人工标注校验一致性。
OpenAI 发布 Agents SDK 快速入门,通过 pip install openai-agents 安装,用 Agent 定义名称与 instructions,再由 Runner.run 执行并返回 RunResult。
OpenAI 发布实时翻译指南,介绍用 gpt-realtime-translate 模型将源音频流式输入专用翻译端点 /v1/realtime/translations,在说话者讲话的同时获得翻译音频和字幕增量,适用于同声传译、多语言通话、直播和会议等场景。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 发布构建智能体指南,对比 Agents API、Agents SDK 与 Responses API 三种运行时的选型。Agents API 由 OpenAI 托管 Codex harness,支持自动上下文压缩、多智能体编排、程序化工具调用和 MCP 服务器;Agents SDK 在应用内运行,由 runner 处理智能体循环与 handoff。
OpenAI Developers 发布视频演示如何使用 4o 模型创建图像,内容围绕图像生成功能展开。
OpenAI 发布内置工具指南,说明在 Responses API、Agents API 和 Agents SDK 中如何配置 web search、function calling。