跳到正文
原文
OpenRouter:Announcements(RSS)·· 2026-06-16精选AI 评分67

OpenRouter 推出 subagent 服务端工具,让模型把机械任务委托给更便宜的 worker 模型

Subagent: Let Your Model Delegate the Busywork

AI 导读

OpenRouter 推出 openrouter:subagent 服务端工具,在 tools 数组中加入一行配置后,模型可在生成过程中把总结、数据提取、模板填充等自包含任务委托给更小更便宜的 worker 模型,结果回传给编排模型。

推荐理由

原文给出工具用法、计费方式和与 advisor 的差异,读者可据此判断能否用廉价 worker 模型降低智能体工作流成本。

正文 · AI 翻译

将 openrouter:subagent 添加到你的 tools 数组中,你的模型就能在生成过程中将独立的任务委托给一个更小、更便宜、更快的 worker 模型。总结文档、提取结构化数据、起草样板内容、重新格式化文本:worker 处理这些任务并将结果传回。你的前沿模型可以继续统筹编排,而无需在常规工作上消耗昂贵的 token。

在 chatroom 中试用,阅读文档,或按照 cookbook 配方 将其接入你的应用。

{
  "model": "anthropic/claude-opus-4.8",
  "messages": [{ "role": "user", "content": "Audit this release: summarize the changelog, list breaking changes, and draft the announcement." }],
  "tools": [
    {
      "type": "openrouter:subagent",
      "parameters": { "model": "z-ai/glm-5.2" }
    }
  ]
}

模型自行决定何时委托。它只会对不需要其全部能力的任务调用 subagent。

在你的代码库中寻找 subagent 的使用机会

将此提示粘贴到你的编码 agent 中,让它扫描你的项目,找出通过 subagent 委托可以降低成本的地方:

Read through this codebase and identify places where an OpenRouter API call
could benefit from the openrouter:subagent server tool. Look for patterns where
a frontier model is doing mechanical sub-tasks inline: summarization, data
extraction, reformatting, boilerplate generation, or schema conversion.

For each candidate, explain:
1. Which file and function
2. What the sub-task is
3. Why it's a good fit for delegation (self-contained, predictable output, doesn't need the full conversation context)
4. A code snippet showing how to add the subagent tool to that call

Reference docs: https://openrouter.ai/docs/guides/features/server-tools/subagent
Cookbook recipe: https://openrouter.ai/docs/cookbook/building-agents/subagent-server-tool

前沿大脑,预算之手

Claude Opus 4.8 每百万输入 token 收费 5 美元。GPT-5.5 收费 5 美元。GLM 5.2 收费 1.40 美元。前沿模型与 worker 之间的输入价格相差 3.6 倍,输出相差 5.7 倍。(Claude Fable 5 在被下架前是每百万 token 10/50 美元,RIP。)

前沿模型在做代码审查时,不需要花费自己的 token 去总结一份 2,000 行的变更日志,或重新格式化一个 JSON blob。这些是机械性任务,指令明确、输出可预测。subagent 以 GLM 的价格处理它们,而编排器则专注于真正需要推理的部分。

在一个包含 20 次工具调用的复杂 agentic 工作流中,可能有 5-8 次是 subagent 委托:总结、数据提取、模板填充、格式转换。前沿模型负责编排和判断。你降低了每请求成本,同时没有触及困难部分的质量上限。

底层工作原理

worker 模型只能看到委托模型在 task_description 中显式传入的内容。没有父对话,没有先前上下文,任务之间没有记忆。每次委托都是一个干净、隔离的工作单元。

  1. 任何模型都可以作为 worker。 用 parameters.model 固定它(模型目录 中的任何模型都可以)。像 z-ai/glm-5.2 这样的开源模型很适合机械性任务。如果你不指定模型,它会回退到外层请求模型。

  2. worker 拥有自己的工具。 给 worker 提供 openrouter:web_search,它就能在响应前将输出建立在最新来源之上。worker 在内部运行自己的工具循环;只有最终文本会返回给你的模型。

  3. 递归被阻止。 subagent 不能调用自身。深度标头和自引用检查可防止无界嵌套,并且每次请求的委托上限为 10 次。

{
  "tools": [
    {
      "type": "openrouter:subagent",
      "parameters": {
        "model": "z-ai/glm-5.2",
        "instructions": "You are a fast, focused worker. Complete the task exactly as described.",
        "tools": [{ "type": "openrouter:web_search" }]
      }
    }
  ]
}

Subagent 与 advisor

这两个工具指向相反的方向。advisor 将困难决策上报给更强的模型。subagent 将常规工作委托给更便宜的模型。

AdvisorSubagent
方向向上(咨询更强的模型)向下(委托给更便宜的模型)
worker 选择模型每次调用时选择由工具定义固定
使用场景“帮我思考一下这个”“帮我做这个机械性任务”
记忆跨请求重放记录无(每个任务相互隔离)

在同一请求中同时使用两者。你的前沿模型就架构决策咨询 advisor,并将总结委托给 subagent。不同工具用于不同类型的工作。

计费

子代理 token 按工作模型的费率计费,与编排器分开计算。如果你的编排器是 Claude Opus 4.8(每百万 token $5/$25),而工作模型是 GLM 5.2(每百万 token $1.40/$4.40),则每个模型的 token 按各自的价格计费。两者都会显示在你的活动页面上。

开始使用

在你的 tools 数组中添加一行:

{ "type": "openrouter:subagent", "parameters": { "model": "z-ai/glm-5.2" } }

模型会自行决定何时使用它。阅读完整文档了解所有参数、工作工具和递归细节,或按照cookbook 配方进行可用的集成。

来源:OpenRouter:Announcements(RSS) · openrouter.ai