OpenAI 发布推理模型最佳实践指南,讲解 o 系列与 GPT 模型如何分工协作
OpenAI 发布推理模型使用指南,说明 o 系列模型(如 o3、o4-mini)擅长规划、复杂决策和高精度任务,GPT 模型(如 GPT-4.1)更适合快速低成本的明确任务,多数 AI 工作流可组合两者,用 o 系列做规划、GPT 做执行。
OpenAI 发布推理模型使用指南,说明 o 系列模型(如 o3、o4-mini)擅长规划、复杂决策和高精度任务,GPT 模型(如 GPT-4.1)更适合快速低成本的明确任务,多数 AI 工作流可组合两者,用 o 系列做规划、GPT 做执行。
Sam Altman 发文称技术起飞已经开始,人类接近构建数字超级智能,且过程比想象中平缓。他判断 2025 年出现能完成真实认知工作的 Agent,2026 年可能产生能发现新洞见的系统,2027 年可能出现能在现实世界执行任务的机器人;科学家用 AI 后生产力提升两到三倍,ChatGPT 平均每次查询耗电约 0.34 瓦时、用水约 0.000085 加仑。
Mistral AI 发布首个推理模型 Magistral,分为 Magistral Small(24B 参数,Apache 2.0 开源)和 Magistral Medium(企业版)两个版本。
推荐理由:官方发布同时给出开源小模型和 AIME 等基准分数,读者可以据此比较两个版本的能力与部署选择。
Lilian Weng 发布长文《Why We Think》,综述测试时计算与思维链推理的研究进展。文章覆盖并行采样与顺序修订等解码方法、DeepSeek-R1 等强化学习训练范式、CoT 忠实性与 reward hacking 风险,以及测试时计算与预训练缩放的互换边界。
小米发布 MiMo,一个从预训练到后训练全流程优化推理能力的语言模型。该模型旨在释放语言模型的推理潜力,相关代码与模型已托管于 GitHub 的 XiaomiMiMo/MiMo 仓库。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic、Google Gemini 下一代模型遇阻后业内关于模型 scaling 已死的叙事转向,认为现在断言模型 scaling 终结为时尚早,且业内高管的预测受商业利益影响,不应盲从。
Lilian Weng 在 Lil'Log 发布长文,系统梳理针对大语言模型的对抗攻击,假定攻击只发生在推理时、模型权重固定,并区分白盒与黑盒两类威胁模型。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。
Lilian Weng 在 Lil'Log 发布 The Transformer Family 2.0,对三年前的旧版综述做了大幅重构和扩充,篇幅约为旧版两倍。
Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。
神经网络切线核(NTK)是一种通过梯度下降解释神经网络训练演化过程的核方法,可说明足够宽的神经网络在最小化经验损失时为何能稳定收敛到全局最小值。该文深入剖析 NTK 的动机与定义,并证明无限宽神经网络在不同初始化下均能确定性收敛。
Lilian Weng 在 Lil'Log 发表长文,系统梳理如何引导无条件预训练语言模型生成可控内容,涵盖解码策略(温度采样、top-k、nucleus sampling。
推荐理由:文章系统梳理了在不改动语言模型权重与微调两条路线下的主要可控文本生成方法,并给出各自优劣与适用场景。
Lilian Weng 在 Lil'Log 发布长文,综述构建开放域问答(ODQA)系统的常见方法。
推荐理由:作者系统梳理了开放域问答的检索器阅读器、检索器生成器和闭卷三类框架,并给出各模型的预训练与联合训练对比。
深度强化学习中的探索策略综述,涵盖 epsilon-greedy、UCB、Boltzmann 探索、Thompson sampling 等经典方法,以及熵损失项和基于噪声的探索。文章重点讨论 hard-exploration 与 Noisy-TV 两大难题,并介绍以内在奖励作为探索奖励的思路,包括基于计数的探索与密度模型伪计数方法。
Lilian Weng 在 Lil'Log 发文梳理 Transformer 家族,聚焦原始 Transformer 如何针对更长注意力跨度、更低内存与计算开销、RL 任务求解等方向被改进。
Lilian Weng 梳理了强化学习中的课程学习(Curriculum Learning)方法,即通过从简单到复杂地安排训练样本来加速模型收敛。文章回顾了 Elman 1993 年用课程训练神经网络学习语言语法的早期工作,以及 Bengio 等人 2009 年关于干净样本与渐进难度样本的综述,并介绍了任务特定课程、PCG 程序化生成关卡、POET 等五类课程设计思路。
元强化学习(Meta-RL)是在强化学习领域做元学习,训练时在一批 MDP 上学习、测试时快速适应新任务,Wang et al. (2016) 与 Duan et al. (2017) 的 RL² 同时提出这一思路。与普通 RL 不同,策略观测除当前状态 s_t 外还加入上一动作 a_{t-1} 与上一奖励 r_{t-1},并采用 LSTM 策略以隐状态记忆轨迹特征。
Lilian Weng 在 Lil'Log 发表注意力机制综述教程,从 seq2seq 的定长上下文向量缺陷讲起,解释注意力如何解决长句遗忘问题,并给出 Content-base、Additive、Scaled Dot-Product 等多种对齐分数函数的汇总表。
推荐理由:原文系统梳理了注意力机制从 seq2seq 到 Transformer 的各种形式与对齐分数函数,适合作为理解后续模型架构的基础参考。
Lilian Weng 在 Lil'Log 发布强化学习综述教程,从智能体与环境交互的基本概念讲起,覆盖 MDP、Bellman 方程、动态规划、蒙特卡洛方法。
推荐理由:文章系统梳理了强化学习的核心概念与经典算法,从动态规划到策略梯度再到 AlphaGo Zero,适合作为入门起点。
多臂老虎机问题刻画了探索与利用的两难:面对 K 台奖励概率未知的老虎机,需在有限信息下最大化累计奖励。文章给出 Bernoulli 多臂老虎机的形式化定义与 regret 损失函数,并介绍 ε-Greedy 与 Upper Confidence Bounds(UCB)两类策略,代码实现见 lilianweng/multi-armed-bandit。
Lilian Weng 在 Lil'Log 发表综述文章,讲解如何解释机器学习模型的预测。文章从金融、医疗、司法等场景对模型可信度的需求出发,先介绍线性回归、朴素贝叶斯、决策列表、随机森林等自带可解释性的模型,再讲解预测分解、局部梯度解释向量和 LIME 等黑盒模型局部解释方法,并概述 BETA 和 DARPA 的可解释 AI(XAI)项目等全局解释方向。