OpenAI Codex 编程入门介绍
OpenAI Codex 编程入门介绍,概述了使用 OpenAI Codex 进行编程的相关内容。
OpenAI Codex 编程入门介绍,概述了使用 OpenAI Codex 进行编程的相关内容。
OpenAI DevDay 举办蒸馏(distillation)专题活动,讨论高效蒸馏模型的策略。内容聚焦蒸馏方法本身,未披露具体模型、参数规模或基准数据。
OpenAI DevDay 设立结构化输出(structured outputs)专场,讲解 JSON 与 schema 相关技术。内容围绕结构化输出的实现方式展开,属于 DevDay 的技术分享环节。
OpenAI 发布 Computer Use 官方指南,说明模型可通过浏览器和桌面界面填写表单、测试用户流程或完成应用内任务。
安全研究者 Johann Rehberger 构建了 mcp-com-server,一个可同时托管多个 COM 对象的 MCP server,通过 CreateObject、Get/Set Property、InvokeMethod、QueryInterface 等工具实现 Windows 与 Office 自动化。
安全研究者 Johann Rehberger 实测 ChatGPT o3 的新 chat history 记忆功能,发现它并非全文检索过往对话,而是在系统提示中维护 Assistant Response Preferences。
Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。
Mistral 提出用 LLM as a Judge 结合 RAG Triad 框架评估 RAG 系统,从上下文相关性、有据性和答案相关性三个维度打分。其 API 新增的结构化输出功能可定义评分 schema,让评判 LLM 输出机器可读的分数,从而构建更可靠的自动化评估流程。
Answer.AI 研究员 Sarah Pan 发布 WebGPU Puzzles,基于 Answer.AI 的 gpu.cpp,参考 Sasha Rush 的 CUDA Puzzles,让初学者可直接在浏览器中学习 GPU 编程基础。项目附带详细解答以降低入门门槛;作者同期分享了从 fast.ai 课程、MIT Primes 研究到一作论文入选 NeurIPS 的经历。
Mistral AI 展示 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并拆解为开发任务,最终在 Linear、Jira 等项目管理工具中自动创建工单。
Answer.AI 的 ShellSage 依赖 tmux 运行,而 iTerm2 的 tmux 控制模式(tmux -CC)可让 tmux 以原生标签页渲染,用户无需学习 tmux 快捷键即可默认启用 ShellSage。
Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。
推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。
Lilian Weng 在 Lil'Log 发布长文,系统梳理扩散模型用于视频生成的方法。文章先讲从零训练的参数化、采样与 3D U-Net、DiT 架构(如 VDM、Imagen Video、Sora),再讲如何改造预训练图像模型生成视频(Make-A-Video、Video LDM、SVD、Lumiere),最后介绍 Text2Video-Zero、ControlVideo 等免训练适配方法。
Lilian Weng 发布长文《Thinking about High-Quality Human Data》,梳理高质量人工标注数据的两个方向:数据收集操作步骤与质量保证。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。
Lilian Weng 在 Lil'Log 发布 The Transformer Family 2.0,对三年前的旧版综述做了大幅重构和扩充,篇幅约为旧版两倍。
Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。
神经网络切线核(NTK)是一种通过梯度下降解释神经网络训练演化过程的核方法,可说明足够宽的神经网络在最小化经验损失时为何能稳定收敛到全局最小值。该文深入剖析 NTK 的动机与定义,并证明无限宽神经网络在不同初始化下均能确定性收敛。
Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。
推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。
Lilian Weng 发布系列博客第三篇,介绍训练数据不足时的两类数据生成思路:对已有样本做增强,以及用预训练大语言模型合成新数据。
面对标注数据有限的有监督任务,主动学习在固定标注预算 B 下从无标注数据集中挑选最有价值的样本交给人工标注,以最大化模型性能提升。文章梳理了不确定性采样(最小置信度、margin、熵)、Query-By-Committee 以及多样性采样等采样策略,并区分了数据噪声带来的偶然不确定性与模型参数导致的可认知不确定性。
Lil'Log 发布“Learning with not Enough Data”系列第一篇,聚焦半监督学习,即同时利用有标注和无标注数据训练模型。文章梳理了平滑性、聚类、低密度分离与流形四种假设,并介绍一致性正则化方法,如 Π-model 等,指出该领域研究多集中于视觉任务,语言任务更常用预训练加微调范式。
Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。
Lilian Weng 在 Lil'Log 发表的长文系统讲解扩散模型:通过马尔可夫链逐步加噪再学习反向去噪来生成数据,涵盖 DDPM 的变分下界训练目标、与 NCSN 的联系、β 调度与方差参数化等核心内容。
推荐理由:作者原创长文系统讲解扩散模型,从 DDPM 前反向过程到 DDIM、LDM、DiT 等演进,兼顾数学推导与方法脉络。
对比表示学习的目标是学习一个嵌入空间,使相似样本对彼此靠近、不相似样本对彼此远离,可同时用于监督和无监督场景,在自监督学习中尤为强大。文章梳理了对比损失、Triplet Loss、Lifted Structured Loss、N-pair Loss 和 NCE 等训练目标,指出近期趋势是在一个 batch 中纳入多组正负样本对。
大型预训练语言模型从互联网数据中不可避免地习得有害行为和偏见,安全部署需对生成过程施加强控制。Lilian Weng 在文中梳理了有害内容的定义分歧、Zampieri 等人提出的三级攻击性语言分类体系(OLID 数据集),以及专家标注、众包、专业审核员和合成数据四类毒性检测数据收集方式。
Lilian Weng 在 Lil'Log 发表长文,系统梳理如何引导无条件预训练语言模型生成可控内容,涵盖解码策略(温度采样、top-k、nucleus sampling。
推荐理由:文章系统梳理了在不改动语言模型权重与微调两条路线下的主要可控文本生成方法,并给出各自优劣与适用场景。
Lilian Weng 在 Lil'Log 发布长文,综述构建开放域问答(ODQA)系统的常见方法。
推荐理由:作者系统梳理了开放域问答的检索器阅读器、检索器生成器和闭卷三类框架,并给出各模型的预训练与联合训练对比。
神经架构搜索(NAS)通过自动学习高性能网络拓扑,由搜索空间、搜索算法和评估策略三大组件构成。搜索空间从早期的逐层序列化表示发展到 NASNet 的 cell 重复堆叠结构,后者支持跨数据集迁移并可通过调整 cell 重复次数缩放模型。Zoph & Le 2017 的实验曾用 800 块 GPU 并行运行 28 天,NASNet 还提出 ScheduledDropPath 显著提升最终性能。
深度强化学习中的探索策略综述,涵盖 epsilon-greedy、UCB、Boltzmann 探索、Thompson sampling 等经典方法,以及熵损失项和基于噪声的探索。文章重点讨论 hard-exploration 与 Noisy-TV 两大难题,并介绍以内在奖励作为探索奖励的思路,包括基于计数的探索与密度模型伪计数方法。
Lilian Weng 在 Lil'Log 发文梳理 Transformer 家族,聚焦原始 Transformer 如何针对更长注意力跨度、更低内存与计算开销、RL 任务求解等方向被改进。
Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。
Lilian Weng 在 Lil'Log 发表关于自监督表征学习的综述,核心思想是利用数据自带的信息构造 pretext task,从而在无标注数据上以监督方式训练,目标是学到可迁移到下游任务的中间表征而非任务本身的准确率。
Lilian Weng 在 Lil'Log 发文详解进化策略(ES)这类黑盒优化算法,目标为实数向量 x ∈ ℝⁿ。文章介绍了最基础的 Simple Gaussian ES,以及通过协方差矩阵 C 追踪样本间依赖关系、解决探索空间无法快速调整问题的 CMA-ES。
元强化学习(Meta-RL)是在强化学习领域做元学习,训练时在一批 MDP 上学习、测试时快速适应新任务,Wang et al. (2016) 与 Duan et al. (2017) 的 RL² 同时提出这一思路。与普通 RL 不同,策略观测除当前状态 s_t 外还加入上一动作 a_{t-1} 与上一奖励 r_{t-1},并采用 LSTM 策略以隐状态记忆轨迹特征。
域随机化(DR)通过在仿真器中随机化视觉外观与物理动力学参数,让策略在多样化环境中训练后直接迁移到真实机器人。相比需要真实数据的域适应,DR 几乎不需要真实样本;OpenAI 用该方法让灵巧手完成连续旋转物体的任务。DR 可被理解为一种双层优化,即学习随机化参数的分布以最大化真实环境表现。
Lilian Weng 在 Lil'Log 发表长文,系统梳理上下文相关词向量与预训练语言模型的方法演进。
Lil'Log 目标检测系列第 4 篇聚焦快速检测模型,涵盖 SSD、RetinaNet 和 YOLO 家族,这些均属单阶段检测器,跳过区域候选步骤、直接在密集采样位置上做检测,速度更快但精度可能略有下降。
Meta-Learning(元学习)旨在让模型仅凭少量训练样本就能快速学习新概念与新任务,因此也被称为"learning to learn"。其核心做法是在多种学习任务上训练模型,使每个数据集被视为一个数据样本,从而优化模型在任务分布上的表现,包括训练时未见过的新任务。