跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 341–351 条 · 共 351 条
6月5日周四
5月27日周二
  1. Mistral AI:News(网页)67

    Mistral 发布 Agents API,内置连接器与智能体编排

    Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。

    推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。

5月21日周三
4月18日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    Anthropic 发布 Claude Code 智能体编码最佳实践指南

    Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。

    推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。

12月19日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)79

    Anthropic 工程指南:构建高效 Agent 的简单可组合模式

    Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。

    推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。

6月23日周五
  1. Lilian Weng:Lil'Log(RSS)80

    Lilian Weng 长文解析 LLM 驱动的自主智能体系统

    Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。

    推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。

3月15日周三
6月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 通过 Video PreTraining(VPT)在海量无标注的 Minecraft 人类游玩视频上训练神经网络,仅使用少量标注承包商数据。经微调后模型能合成钻石工具,这一任务熟练人类通常需要超过 20 分钟(24,000 个操作);模型使用键盘和鼠标的原生人类接口,是迈向通用计算机操作智能体的一步。

    推荐理由:原文给出 VPT 用少量标注数据加海量无标注视频训练出会玩 Minecraft 的模型,可了解视频预训练在通用操作智能体上的思路。

9月17日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    OpenAI 观察到多智能体交互中涌现的工具使用行为

    OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时,逐步发现越来越复杂的工具使用行为。智能体在游戏中演化出六种不同的策略与反策略,其中部分策略是团队事先不知道该环境所支持的。OpenAI 认为这种简单环境中的自监督涌现复杂性表明,多智能体协同适应未来可能产生极其复杂和智能的行为。

    推荐理由:OpenAI 自述多智能体在捉迷藏环境中自发演化出六种策略与反策略,可帮助读者了解多智能体协同适应如何产生复杂行为。

5月3日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)60

    OpenAI 提出通过辩论实现 AI 安全的方法

    OpenAI 提出一项 AI 安全技术:训练智能体就某一话题互相辩论,由人类判断谁获胜,以此辅助监督模型行为。

    推荐理由:OpenAI 提出用智能体互相辩论、由人类裁判胜负来训练 AI 的安全方法,为对齐研究提供了一条可参考的思路。