Lilian Weng 长文解析 LLM 驱动的自主智能体系统
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。
OpenAI 通过 Video PreTraining(VPT)在海量无标注的 Minecraft 人类游玩视频上训练神经网络,仅使用少量标注承包商数据。经微调后模型能合成钻石工具,这一任务熟练人类通常需要超过 20 分钟(24,000 个操作);模型使用键盘和鼠标的原生人类接口,是迈向通用计算机操作智能体的一步。
推荐理由:原文给出 VPT 用少量标注数据加海量无标注视频训练出会玩 Minecraft 的模型,可了解视频预训练在通用操作智能体上的思路。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时,逐步发现越来越复杂的工具使用行为。智能体在游戏中演化出六种不同的策略与反策略,其中部分策略是团队事先不知道该环境所支持的。OpenAI 认为这种简单环境中的自监督涌现复杂性表明,多智能体协同适应未来可能产生极其复杂和智能的行为。
推荐理由:OpenAI 自述多智能体在捉迷藏环境中自发演化出六种策略与反策略,可帮助读者了解多智能体协同适应如何产生复杂行为。
OpenAI 提出一项 AI 安全技术:训练智能体就某一话题互相辩论,由人类判断谁获胜,以此辅助监督模型行为。
推荐理由:OpenAI 提出用智能体互相辩论、由人类裁判胜负来训练 AI 的安全方法,为对齐研究提供了一条可参考的思路。