OpenAI 发布 gpt-realtime-2 语音模型提示词指南
OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。
推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。
OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。
推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。
面向 AI 原生团队的多租户 GPU 集群设计需同时满足池化容量、租户隔离与自助访问三项要求,避免为每个团队单独建集群导致 GPU 夜间和周末闲置。架构上采用共享层加租户层的两层模式,共享层由集中控制面管理高性能存储与 InfiniBand/Ethernet 网络,租户层为每个团队提供专属 GPU 节点、存储 PVC 及自选编排层(Kubernetes、Slurm 等)。
Sebastian Raschka 撰文介绍自己为文章和 LLM-Gallery 绘制 LLM 架构图的工作流。他从官方技术报告入手,但指出如今论文尤其工业界开放权重模型的论文细节变少,因此通常直接查看 Hugging Face Model Hub 上的 config 文件和 transformers 库参考实现来获取架构细节。
Johann Rehberger 用 ChatGPT 生成一张解谜式对抗图像,诱导 Claude Opus 4.7 在分析时调用 memory 工具,写入姓名 Neo、43 岁、NASA 宇航员等虚假记忆。
OpenAI 发布 API 部署检查清单,指导开发者基于 Responses API 和 GPT-6 模型族(gpt-6-astra、gpt-6.1-sol、gpt-6-luna)配置生产工作负载。
Sebastian Raschka 发文讲解编码智能体与 coding harness 的整体设计,提出六大组件:实时仓库上下文、提示词结构与缓存复用、结构化工具与权限校验、控制上下文膨胀、结构化会话记忆、带边界的子智能体委派。
Sebastian Raschka 发布 LLM 架构画廊(含 45 个条目和可视化模型卡),并撰文图解现代开源权重模型中的注意力变体。
OpenAI 发布 Sora 2 提示词指南,更新至最新 API 能力,包括角色引用(可上传动物或对象并复用)、1920×1080 或 1080×1920 高分辨率导出、时长上限从 12 秒提高到 20 秒、基于完整原始片段的视频续写,以及支持异步批量生成的 Batch API。
推荐理由:OpenAI 官方系统讲解 Sora 2 提示词写法,并覆盖角色引用、更长时长和视频续写等新 API 能力。
Mistral AI 基于 open-source 编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并通过 RuboCop 和 SimpleCov 自定义工具在 CI/CD 中无人工干预运行。
推荐理由:Mistral 详述了在 Vibe 上构建 Rails 测试智能体的上下文工程与自定义工具方案,给出可复用的步骤和实测分数。
OpenAI 发布 Codex 模型(API 中为 gpt-5.3-codex)的提示词指南,推荐 medium 推理力度作为交互编码的平衡选择,高难度任务可用 high 或 xhigh。
推荐理由:官方给出从 GPT-5 系列迁移到 gpt-5.3-codex 的提示词、工具和 phase 参数细节,可直接照做。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
Answer.AI 的 Piotr Czapla 报告,Claude Opus 4.6、Sonnet 4.5、Haiku 4.5 会幻觉调用未被授予的工具(如 read_secret、GitHub MCP 的 get_me),且 API 不拦截;在 Gemini、Grok 上也能复现类似行为。
推荐理由:作者实测多家模型会调用未授权工具且 API 不拦截,指出这会瓦解能力分离防御,并给出客户端校验的简单修复。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或故障时保持智能体行为一致。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
Sebastian Raschka 撰文将推理时扩展(inference-time scaling)的各类方法整理为更清晰的类别,涵盖 Chain-of-Thought、Self-Consistency、Best-of-N、带验证器的拒绝采样、Self-Refinement 和解路径搜索,并补充近几个月的新研究。
Mistral AI 团队排查 vLLM 在 P/D 分离部署(NIXL/UCX、Mistral Medium 3.1、开启图编译)下每分钟约 400 MB 的内存泄漏。
推荐理由:原文完整复盘从 Heaptrack、pmap、BPFtrace 到 GDB 的内存泄漏排查路径,方法可迁移到类似的深层依赖问题。
作者发布了一个 next-auth/Auth.js 会话 Cookie 的编码/解码工具,并说明攻击者只需获得 NEXTAUTH_SECRET(新版为 AUTH_SECRET),结合 HKDF 派生密钥和默认 salt(即 Cookie 名)即可伪造任意用户身份的有效会话 Cookie。
QwenLM 推出 qwen-code-examples,汇集 Qwen Code 的实用示例与最佳实践。该仓库面向开发者,提供可直接参考的代码范例,帮助上手 Qwen Code 的使用。
OpenAI 开发者 Cookbook 发布 gpt-image-1.5 图像模型提示词指南。该模型在写实度、准确性和可编辑性上较前代有明显提升,支持高质量渲染与低延迟场景。指南给出提示词结构、显式约束、迭代式小步修改等方法,并用信息图、照片级写实、UI 模型、Logo、风格迁移、虚拟试穿、多图合成、儿童绘本角色一致性等示例演示生成与编辑工作流。
推荐理由:官方指南给出提示词结构、约束写法和质量与延迟取舍方法,示例覆盖生成与编辑的常见生产场景,可直接迁移到实际工作流。
OpenAI 发布 GPT-5.2 提示词指南,称其在企业级和智能体工作负载中提升了准确性、指令遵循、token 效率和多模态理解,但默认 reasoning_effort 为 none 且仍对提示词敏感。
推荐理由:OpenAI 官方给出 GPT-5.2 的提示词模式与迁移步骤,开发者可以直接套用其中模板和 evals 流程。
OpenAI 团队介绍为 gpt-5-codex 和 gpt-5.1-codex-max 训练专用智能体代码审查器的方法,作为纵深防御安全策略中的输出监控手段。
推荐理由:OpenAI分享了训练专用代码审查Agent的实践经验,读者可了解精度优先的部署权衡和验证比生成更省算力的发现。
OpenAI 开发者 Cookbook 发布教程,演示在同一 Realtime WebSocket 会话上通过带外的 response.create 请求(conversation 设为 none。
OpenAI 开发者 Cookbook 发布教程,演示如何用 Codex CLI 将 COBOL 投资组合系统等 legacy 代码库现代化,方法以一个 ExecPlan 为核心,拆为五个阶段:选定试点流、盘点与发现、设计与规格、实现与并行验证、沉淀为可复用模板。
Sebastian Raschka 系统介绍当前标准自回归 Transformer LLM 之外的四类替代方向:线性注意力混合、文本扩散模型、代码世界模型和小型递归 Transformer。
OpenAI 发布演示视频,展示如何用 Codex 的多模态能力设计、迭代并构建应用前端界面。Channing Conger 和 Romain Huet 演示了将 Codex cloud 作为前端设计伙伴,从手机创建 Codex 任务、草图构思新功能到多模态功能的不同用法。
OpenAI 发布一段 5 分钟演示,展示如何用 Codex CLI 搭配 GPT-5-Codex 完成开发任务。视频依次演示规划多人游戏实现、使用 CLI 命令、落地实现方案、部署游戏并试玩。
OpenAI Developers 发布了一场实操演示,展示通过 AI 智能体和工具调用(tool calling)为代码库提速的工具链。演示以动手实操形式呈现,聚焦于提升编码速度。
内容讨论在 Cursor 中让 Codex 式智能体协作的上下文策略,核心围绕智能体与上下文窗口展开。
OpenAI 发布视频介绍其最新开放模型系列 gpt-oss,支持开发者对模型进行适配、扩展和微调,并可与 GPT-5 结合使用以构建灵活的高影响力应用。视频还展示了 NVIDIA DGX Spark AI 计算机的现场演示。
OpenAI 展示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的工作流,内容涉及 codex 与 IDE 扩展。
推荐理由:官方演示了 Codex 与主流代码编辑器的搭配方式,可帮助开发者了解如何把工作流收进编辑器内完成。
多个团队分享了用 Codex 端到端交付真实软件的经验教训。内容聚焦 Codex 在产品交付流程中的实际应用。
Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。
推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。
Answer.AI 的 Jeremy Howard 用 SolveIt 把 Andrej Karpathy 两小时 tokenizers 视频教程改写成带可运行代码、超链接和图片的书稿章节。他采用两阶段"双对话"流程:先把带时间戳的转录稿拆成小段逐条补充超链接、代码示例等素材,再用充实后的转录稿分节撰写正文,避免一次性让 AI 转换导致内容平淡、遗漏概念和幻觉。
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
OpenAI 在 GitHub 发布 openai-apps-sdk-examples 仓库,展示可与 Apps SDK 配合使用的示例 UI 组件,以及把组件作为工具暴露的多个 MCP 服务器,包括 Pizzaz、3D 太阳系、购物车和带 OAuth 认证的示例。
Sebastian Raschka 长文讲解 LLM 评测的四种主要方法:多选题基准(如 MMLU)、验证器、偏好排行榜(如 LM Arena)和 LLM-as-a-judge,并配从零实现的代码示例。
Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
Sebastian Raschka 发布长文教程,用纯 PyTorch 从零讲解并实现 Qwen3 的 Dense 与 Mixture-of-Experts 架构。