OpenAI Evals 入门指南:用 Datasets 编写评估
OpenAI 发布 Evals 入门指南,介绍如何用平台 Datasets 功能创建数据集、编写提示词并生成输出来评估模型表现。Evals 平台正在弃用,现有内容在过渡期内仍可用,2026 年 10 月 31 日起对现有用户转为只读,11 月 30 日关停。
OpenAI 发布 Evals 入门指南,介绍如何用平台 Datasets 功能创建数据集、编写提示词并生成输出来评估模型表现。Evals 平台正在弃用,现有内容在过渡期内仍可用,2026 年 10 月 31 日起对现有用户转为只读,11 月 30 日关停。
OpenAI 发布函数调用官方指南,讲解如何用 JSON schema 定义的函数工具和自由文本的自定义工具连接模型与外部系统,示例覆盖 Responses API 和 Chat Completions。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于未微调基线。基线模型在 Playground、Stadium 等易混类别上出错,还会幻觉出不存在的类别名;微调后分类更准确。整个流程通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
OpenAI 在 Responses API 中提供托管式 file search 工具,模型可通过语义与关键词检索,从预先上传到 vector store 的文件知识库中取回信息并自动调用。
OpenAI 发布 Batch API 使用指南,该接口以异步方式批量发送请求,成本比同步 API 低 50%,并提供更高的速率限制,每批任务在 24 小时内完成。Batch API 支持 /v1/responses、/v1/chat/completions、/v1/embeddings 等 7 个端点,输入文件为 .jsonl 格式,单个文件上限 200 MB,每个文件只能包含单一模型的请求。
OpenAI 发布对话状态管理指南,介绍三种跨轮次保留上下文的方式:手动传入历史消息、用 Conversations API 创建带持久标识的会话对象、以及通过 previous_response_id 串联响应。
OpenAI 发布实时语音转写指南,推荐麦克风、通话等直播音频流使用 gpt-live-transcribe 模型,通过 WebSocket 或 WebRTC 建立会话后随语音返回增量转写文本。
推荐理由:OpenAI 官方指南,给出实时转写的会话配置、延迟档位取舍和多语言用法,可直接照做。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling、Agents SDK 与 tool calling。内容聚焦 agentic 场景下的工具调用能力。
OpenAI Developers 分享在质量、性能与开销之间取得平衡的策略,围绕准确率、延迟和成本三个维度做取舍。内容聚焦如何为具体场景选择合适的权衡方案。
OpenAI 发布推理模型使用指南,说明 o 系列模型(如 o3、o4-mini)擅长规划、复杂决策和高精度任务,GPT 模型(如 GPT-4.1)更适合快速低成本的明确任务,多数 AI 工作流可组合两者,用 o 系列做规划、GPT 做执行。
OpenAI 发布 Evals API 使用指南,介绍如何通过 API 以编程方式配置评估,用 data_source_config 定义测试数据 schema、用 testing_criteria 设置评分器,并以 IT 工单分类为例演示完整流程。
OpenAI 的 Build hour 演示了智能体如何调用工具来完成任务,涉及 Responses API、function calling 与 Agents SDK。内容围绕 agentic 工具调用展开。
OpenAI 发布 Evals 最佳实践指南,讲解如何为 LLM 应用设计评估,并宣布 Evals 平台将于 2026 年 10 月 31 日对现有用户转为只读、11 月 30 日关停。指南覆盖从单轮交互到多智能体四种架构中非确定性出现的环节,给出指标型评估、人工评估和 LLM-as-a-judge 的取舍建议,并提醒用 gpt-6-astra 构建 LLM 评审时需先与人工标注校验一致性。
OpenAI 发布 Agents SDK 快速入门,通过 pip install openai-agents 安装,用 Agent 定义名称与 instructions,再由 Runner.run 执行并返回 RunResult。
OpenAI 发布实时翻译指南,介绍用 gpt-realtime-translate 模型将源音频流式输入专用翻译端点 /v1/realtime/translations,在说话者讲话的同时获得翻译音频和字幕增量,适用于同声传译、多语言通话、直播和会议等场景。
OpenAI 发布 Realtime API 与音频指南,讲解如何构建语音到语音的 voice agent,模型直接处理音频、维护对话状态并可调用工具。
OpenAI 发布构建智能体指南,对比 Agents API、Agents SDK 与 Responses API 三种运行时的选型。Agents API 由 OpenAI 托管 Codex harness,支持自动上下文压缩、多智能体编排、程序化工具调用和 MCP 服务器;Agents SDK 在应用内运行,由 runner 处理智能体循环与 handoff。
OpenAI Developers 发布视频演示如何使用 4o 模型创建图像,内容围绕图像生成功能展开。
OpenAI 发布内置工具指南,说明在 Responses API、Agents API 和 Agents SDK 中如何配置 web search、function calling。
OpenAI Codex 编程入门介绍,概述了使用 OpenAI Codex 进行编程的相关内容。
OpenAI DevDay 举办蒸馏(distillation)专题活动,讨论高效蒸馏模型的策略。内容聚焦蒸馏方法本身,未披露具体模型、参数规模或基准数据。
OpenAI DevDay 设立结构化输出(structured outputs)专场,讲解 JSON 与 schema 相关技术。内容围绕结构化输出的实现方式展开,属于 DevDay 的技术分享环节。
OpenAI 发布 Computer Use 官方指南,说明模型可通过浏览器和桌面界面填写表单、测试用户流程或完成应用内任务。
Mistral 提出用 LLM as a Judge 结合 RAG Triad 框架评估 RAG 系统,从上下文相关性、有据性和答案相关性三个维度打分。其 API 新增的结构化输出功能可定义评分 schema,让评判 LLM 输出机器可读的分数,从而构建更可靠的自动化评估流程。
Answer.AI 研究员 Sarah Pan 发布 WebGPU Puzzles,基于 Answer.AI 的 gpu.cpp,参考 Sasha Rush 的 CUDA Puzzles,让初学者可直接在浏览器中学习 GPU 编程基础。项目附带详细解答以降低入门门槛;作者同期分享了从 fast.ai 课程、MIT Primes 研究到一作论文入选 NeurIPS 的经历。
Mistral AI 展示 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并拆解为开发任务,最终在 Linear、Jira 等项目管理工具中自动创建工单。
Answer.AI 的 ShellSage 依赖 tmux 运行,而 iTerm2 的 tmux 控制模式(tmux -CC)可让 tmux 以原生标签页渲染,用户无需学习 tmux 快捷键即可默认启用 ShellSage。