跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)· Kenny Rogers·· 2026-06-16精选AI 评分67

Subagent:让模型把琐碎任务委托出去

Subagent: Let Your Model Delegate the Busywork

AI 导读

OpenRouter 推出 openrouter:subagent 服务器工具,允许前沿模型在生成过程中将独立的琐碎任务(如文档总结、结构化数据提取、文本重格式化)委托给更小、更便宜、更快的 worker 模型执行,从而节省前沿模型的 token 消耗。

推荐理由

这是 OpenRouter 对 agent 交互模式的一个小但实用的创新,让主模型自动将摘要、格式化等确定性子任务分派给更便宜的小模型,做多模型编排的开发者可以直接拿来用。

正文 · AI 翻译

Subagent: Let Your Model Delegate the Busywork

将 openrouter:subagent 添加到你的 tools 数组中,你的模型就能在生成过程中把自包含的任务委派给一个更小、更便宜、更快的 worker 模型。总结文档、提取结构化数据、起草样板内容、重新格式化文本:worker 负责处理,并把结果回传。你的前沿模型继续负责编排,而无需在例行工作上消耗昂贵的 token。

在 chatroom 中试用,阅读文档,或按照 cookbook 配方 将其接入你的应用。

{
  "model": "anthropic/claude-opus-4.8",
  "messages": [{ "role": "user", "content": "Audit this release: summarize the changelog, list breaking changes, and draft the announcement." }],
  "tools": [
    {
      "type": "openrouter:subagent",
      "parameters": { "model": "z-ai/glm-5.2" }
    }
  ]
}

由模型决定何时委派。它只会对不需要其完整能力的任务调用 subagent。

在你的代码库中寻找 subagent 的应用机会

将这段提示词粘贴到你的编码智能体中,让它扫描你的项目,找出通过 subagent 委派可以降低成本的地方:

Read through this codebase and identify places where an OpenRouter API call
could benefit from the openrouter:subagent server tool. Look for patterns where
a frontier model is doing mechanical sub-tasks inline: summarization, data
extraction, reformatting, boilerplate generation, or schema conversion.

For each candidate, explain:
1. Which file and function
2. What the sub-task is
3. Why it's a good fit for delegation (self-contained, predictable output, doesn't need the full conversation context)
4. A code snippet showing how to add the subagent tool to that call

Reference docs: https://openrouter.ai/docs/guides/features/server-tools/subagent
Cookbook recipe: https://openrouter.ai/docs/cookbook/building-agents/subagent-server-tool

前沿的大脑,预算级的双手

Claude Opus 4.8 每百万 input token 收费 $5。GPT-5.5 收费 $5。GLM 5.2 收费 $1.40。前沿模型与 worker 之间在 input 上有 3.6 倍的差距,在 output 上有 5.7 倍的差距。(Claude Fable 5 在被下架前是每 M token $10/$50,RIP。)

前沿模型做代码审查时,不需要消耗自己的 token 去总结一份 2000 行的变更日志,或者重新格式化一段 JSON 数据。这些都是机械性任务,指令明确、输出可预测。子智能体以 GLM 的价格处理它们,而编排器则专注于那些真正需要推理的部分。

在一个包含 20 次工具调用的复杂智能体工作流中,大概有 5-8 次是子智能体委派:总结、数据提取、模板填充、格式转换。前沿模型负责编排和判断。你在不触及困难部分质量上限的前提下,降低了每次请求的成本。

底层工作原理

工作模型只能看到委派模型在 task_description 中显式传入的内容。没有父对话,没有先前的上下文,任务之间也没有记忆。每次委派都是一个干净、隔离的工作单元。

  1. 任何模型都可以作为工作模型。用 parameters.model 来指定它(模型目录中的任何模型都可以)。像 z-ai/glm-5.2 这样的开源模型很适合处理机械性任务。如果你不指定模型,它会回退到外层请求所用的模型。

  2. 工作模型有自己的工具。给工作模型配上 openrouter:web_search,它就能在响应之前用最新的来源来支撑其输出。工作模型在内部运行自己的工具循环;只有最终文本会返回给你的模型。

  3. 递归被阻止。 子智能体不能调用自身。深度标头和自引用检查可防止无界嵌套,每次请求的委派上限为 10 次。

{
  "tools": [
    {
      "type": "openrouter:subagent",
      "parameters": {
        "model": "z-ai/glm-5.2",
        "instructions": "You are a fast, focused worker. Complete the task exactly as described.",
        "tools": [{ "type": "openrouter:web_search" }]
      }
    }
  ]
}

子智能体 vs. 顾问

这两个工具指向相反的方向。顾问将困难决策上报给更强的模型。子智能体则将常规工作委派给更便宜的模型。

顾问子智能体
方向向上(咨询更强的模型)向下(委派给更便宜的模型)
工作模型选择模型在每次调用时选择由工具定义固定
使用场景“帮我理清这个思路”“帮我完成这个机械性任务”
记忆跨请求的对话记录重放无(每个任务相互隔离)

在同一个请求中同时使用两者。让你的前沿模型就架构决策咨询顾问,并将摘要任务委派给子智能体。不同的工作类型使用不同的工具。

计费

子智能体的 token 按工作模型的费率计费,与编排器分开计算。如果你的编排器是 Claude Opus 4.8(每 M tokens $5/$25),而工作模型是 GLM 5.2(每 M tokens $1.40/$4.40),那么每个模型的 token 都按各自的单价计费。两者都会显示在你的活动页面上。

在你的 tools 数组中添加一行:

{ "type": "openrouter:subagent", "parameters": { "model": "z-ai/glm-5.2" } }

由模型决定何时使用它。阅读完整文档了解所有参数、工作工具和递归细节,或参照cookbook 示例完成一个可用的集成。

来源:OpenRouter:Announcements(RSS) · openrouter.ai