如何用 SolveIt 把 Karpathy 的 tokenizers 视频做成书稿章节
Answer.AI 的 Jeremy Howard 用 SolveIt 把 Andrej Karpathy 两小时 tokenizers 视频教程改写成带可运行代码、超链接和图片的书稿章节。他采用两阶段"双对话"流程:先把带时间戳的转录稿拆成小段逐条补充超链接、代码示例等素材,再用充实后的转录稿分节撰写正文,避免一次性让 AI 转换导致内容平淡、遗漏概念和幻觉。
Answer.AI 的 Jeremy Howard 用 SolveIt 把 Andrej Karpathy 两小时 tokenizers 视频教程改写成带可运行代码、超链接和图片的书稿章节。他采用两阶段"双对话"流程:先把带时间戳的转录稿拆成小段逐条补充超链接、代码示例等素材,再用充实后的转录稿分节撰写正文,避免一次性让 AI 转换导致内容平淡、遗漏概念和幻觉。
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
Answer.AI 推出 Solveit 平台并开设五周课程 How to Solve it With Code,10 月 20 日前开放报名,此前已有 1000 名预览用户使用一年。
OpenAI 发布函数调用官方指南,讲解如何用 JSON schema 定义的函数工具和自由文本的自定义工具连接模型与外部系统,示例覆盖 Responses API 和 Chat Completions。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业编码栈,包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件。
OpenAI 发布 Background mode 指南,开发者可在 GPT-5.2 和 GPT-5.2 Pro 上异步执行长任务,通过将 API 请求的 background 设为 true 并以 GET 端点轮询状态,避免超时和连接问题。ZDR 项目需配合 store=false,响应数据临时落盘约 10 分钟;仅显式设置 store=true 时响应才会在轮询期后保留。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling、Agents SDK 与 tool calling。内容聚焦 agentic 场景下的工具调用能力。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling 与 Agents SDK。内容围绕 agentic 工具调用展开。
OpenAI 发布 Agents SDK 快速入门,通过 pip install openai-agents 安装,用 Agent 定义名称与 instructions,再由 Runner.run 执行并返回 RunResult。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 发布构建智能体指南,对比 Agents API、Agents SDK 与 Responses API 三种运行时的选型。Agents API 由 OpenAI 托管 Codex harness,支持自动上下文压缩、多智能体编排、程序化工具调用和 MCP 服务器;Agents SDK 在应用内运行,由 runner 处理智能体循环与 handoff。
OpenAI 发布内置工具指南,说明在 Responses API、Agents API 和 Agents SDK 中如何配置 web search、function calling。
OpenAI 发布面向 JavaScript/TypeScript 的开源 Agents SDK,用于构建多智能体工作流,支持 OpenAI API 及其他提供商。
OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。
OpenAI 发布 Computer Use 官方指南,说明模型可通过浏览器和桌面界面填写表单、测试用户流程或完成应用内任务。
OpenAI Agents SDK(Python)是一个轻量级多智能体工作流框架,支持 OpenAI Responses 和 Chat Completions API 以及 100+ 其他 LLM。
OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。
推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
Mistral 发布企业级 AI 编程助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持 80+ 编程语言,可在云端、专属容量或本地 GPU 气隙部署。
Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
Mistral AI 展示 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并拆解为开发任务,最终在 Linear、Jira 等项目管理工具中自动创建工单。
Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。
Answer.AI 发布 ShellSage,一款运行在终端里的 AI 系统管理助手,可通过 pip install shell_sage 安装,需配置 ANTHROPIC_API_KEY。