SkillHone:基于持久决策历史的持续智能体技能演进工具
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
SkillHone 通过持久决策历史将技能修订与评估证据配对,记录诊断、修订、证据和结果。角色分离的子智能体在实践探测上运行候选技能,并基于先前决策提出修订,实现跨会话改进。在深度研究基准上,SkillHone 无需预集成搜索栈,在 GAIA 上超越商业深度研究智能体 15.8 分,在 WebWalkerQA-EN 上超越 3.2 分,同时优于先前技能进化方法。内部工具中介分析场景中,平均准确率提升 18.8 分。
SkillHone 把 agent 技能进化从一次性优化变成了持续记录的迭代过程,在 GAIA 上超越商业 agent 15.8 个点,做 agent 产品的团队该认真读一下。
该工作完成于作者在中国腾讯公司微信AI部门实习期间。
摘要
AI智能体技能通过任务特定的程序、脚本和参考资料扩展了语言模型智能体的能力,但它们所针对的任务和环境却在不断变化。现有方法在有限的运行周期内改进技能,并且只保留最终产物,丢弃了后续智能体在解释先前修订、评估和被拒绝的备选方案时所需的决策历史。我们引入了SkillHone,一个基于持久化决策历史实现智能体技能持续演化的框架。SkillHone将技能修订与提供实践反馈的评估侧证据配对,记录结构化的诊断、修订、证据和结果历史。通过角色分离的子智能体,在带有脱敏报告的实践探针上运行候选技能,并根据先前的决策提出修订建议,从而无需重新发现过往推理即可实现跨会话的优化。在深度研究基准测试中,SkillHone无需预集成的搜索栈即可运行,在GAIA上比商业支持的深度研究智能体高出15.8个百分点,在WebWalkerQA-EN上高出3.2个百分点,同时也超越了先前的技能演化方法。我们进一步将SkillHone部署在内部工具介导的分析场景中,在七个设置下平均准确率提升了18.8个百分点。
SkillHone:通过持久化决策历史实现智能体技能持续演化的框架
李志伟††感谢:该工作完成于作者在中国腾讯公司微信AI部门实习期间。胡勇 中国腾讯公司微信AI部门 zhiweili.jay@foxmail.com rightyonghu@tencent.com 技能:https://github.com/Tencent/SkillHone 项目页面:https://zwlijay.github.io/SkillHone-Project
1 引言
技能已成为扩展基于大语言模型的智能体的核心机制。技能是一个可命名、可加载的模块,包含特定任务的流程、脚本、参考资料和输出规范,智能体可针对某类工作调用该模块(Xu and Yan, 2026; Ling et al., 2026)。在已部署的智能体系统(如 Claude Code、Codex 和 Hermes)中,技能是专业化的基本单元。开发一项稳健的技能绝非一次性事件,而是一个持续创建与适配的过程。即使在初始形成阶段,技能也需要严格的调试和持续更新,以拓宽其适用范围或修补未处理的边缘情况。随着环境变化和 API 更新,这种创建-维护循环会持续存在,因此每次修改背后的逻辑必须在其整个生命周期内得以保留和可维护。核心方法论问题在于:后续的智能体如何能在多次开发会话中持续改进一项技能,同时不丢失先前变更背后的逻辑。
现有的智能体技能改进方法可归纳为两条代表性路径。合成式构建方法(如 Skill-Creator111https://github.com/anthropics/skills/blob/main/skills/skill-creator)将任务描述、示例或支持文档转化为可加载的技能,然后将生成的工件交给后续会话使用。GEPA 风格的反思式优化方法(包括 Hermes-Agent-Self-Evolution (Hermes-SE)222https://github.com/NousResearch/hermes-agent-self-evolution)利用 GEPA(Agrawal et al., 2026)对技能、提示词、工具描述和代码进行迭代变异、评估和筛选。这些路径在单次优化运行中对于生成或改进技能很有用,但它们基本上将输出视为一个更好的工件。
这种以工件为中心的观点缺失了持续维护所需的决策上下文。后续的智能体可能会继承最新的技能,但无法获得结构化的历史记录,无法了解是哪项诊断促成了修订、哪些备选方案被否决、观察到了哪些评估证据、以及为何接受了某个结果。同样的问题也适用于支持技能改进的评估证据:当后续智能体依赖探针、验证器、追踪记录或经过编辑的报告时,它们还需要知道该证据反映了哪种失败模式,以及它如何影响了先前的决策。如图 1 所示,速率限制、API 变更和功能弃用会随时间推移出现,后续的优化步骤可能会重复执行一个之前成功但已不再匹配当前失败模式的修复。持久的决策历史能让后续优化恢复每次修订的原因,避免重新引入过时的修复。缺少这一上下文,一个局部看似合理的修复可能会重复旧的修改,或使后续优化变得更加困难。
我们引入了 SkillHone,这是一个面向智能体的工具框架,用于在支持技能的智能体框架中实现技能的持续演进。SkillHone 将不断演进的技能与支持其改进的评估资产一同维护,并将技能修订和评估证据视为承载决策的要素。对于技能修订,历史记录包含诊断、提议的修订方案、评估证据和结果。对于评估证据,它记录使用了哪些探针或报告、它们暴露了哪种失败模式、以及证据如何证明了结果的合理性。这样一来,后续的智能体就能继承技能、证据以及先前变更背后的理由。
这段历史是在诊断、修订和评估过程中,由许多局部决策累积而成的。因此,SkillHone 使用角色限定的子智能体调度(而非固定的多智能体系统)来在循环运行时生成这些记录:它仅假设一个能够启动具有分离权限的范围限定调度的智能体运行时。这使得该框架可移植到 Claude Code、Codex 和 Hermes 等不同的智能体运行时上,同时将优化过程与未删减的评估资产分离开来。评估子智能体可以检查探针和追踪记录,并运行候选技能,但只向优化端返回经过删减的证据。优化子智能体则利用这些证据和先前的决策记录来形成诊断并起草技能修订方案,而无法访问隐藏的探针目标或验证器。在多次会话中,相互关联的诊断、修订、证据和结果历史记录,使得后续的智能体能够继续技能的演进,而无需重新推导先前的决策。
我们在原始开放网络环境下的深度研究基准测试中评估了 SkillHone,在此环境中,智能体必须组织信息检索,而没有预先集成的搜索栈。与技能演进基线以及一个配备商业检索功能的深度研究智能体相比,SkillHone 在 GAIA 和 WebWalkerQA-EN 基准测试中,在固定的评估时间骨干模型下取得了最强的平均结果;由此产生的技能包还能迁移到不同的执行骨干模型(Claude Sonnet 4.6)上,而无需额外优化,这表明性能提升反映的是技能流程本身,而非对单一模型的拟合。我们还将 SkillHone 部署到重复性的内部工具中介分析场景中,它提升了底层工具使用技能的表现。
贡献。
- 1.
我们识别出以工件为中心的技能改进与持续性技能维护之间存在差距。长期运行的技能需要持久的决策历史记录,而非单一的优化工件,这样后续的智能体才能理解技能修订方案以及支持这些修订的评估证据。
- 2.
我们引入了 SkillHone,这是一个面向智能体的通用框架,用于实现持续的智能体技能演进。它在分离的角色下记录诊断、修订、证据和结果。
- 3.
我们证明,SkillHone 在公开基准测试和实际部署中均能有效提升技能开发效果。
2 方法
2.1 问题设定
在本文中,技能是一种可加载的构件,它封装了智能体在完成某一类任务时所使用的指令、流程、参考资料和输出规范。SkillHone 保持模型后端和外部工具不变;其目标是帮助智能体在多次开发会话中维护并改进这一技能构件。
SkillHone 维护两个相互关联的仓库。技能仓库存储正在修订的技能包。技能评估仓库则存储练习探针、标准答案、验证器、追踪记录、脱敏报告以及其他用于为技能改进提供反馈的评估资产。优化端仅能查看脱敏报告,无法访问未脱敏的目标、验证器或追踪记录。被接受的修订会生成一系列技能,其过程由练习反馈以及将诊断、候选修订、评估和结果关联起来的持久化决策历史所引导。
2.2 SkillHone 运行框架
如图 2 所示,SkillHone 将每个开发步骤拆分为优化调度和评估调度。这些调度具有角色边界,从而使得诊断、修订、脱敏证据和结果能够被记录为可审计的决策历史。附录 E(表 5)列出了常见的调度模式及其权限边界。
我们将该运行框架形式化定义为
其中 为优化智能体团队, 为评估智能体团队, 为运行时调度器。
优化侧维护技能仓库,其中包含当前的 SKILL.md、脚本、参考资料、模板及其他技能资产。优化调度器可以检查当前技能、阅读先前的决策记录与失败摘要、形成诊断、提出类型化修订、审查候选变更,并记录已采纳的结果。典型的调度任务包括:根据脱敏报告诊断失败原因、整合先前资源、提出限定范围的修订方案,以及起草补丁以修复问题。
评估侧基于技能评估仓库运行,该仓库包含探针、验证套件、回归测试集、追踪记录和评估报告。评估调度器可以检查标准答案与追踪记录,在探针项目上运行当前技能,分析失败原因并生成脱敏报告。评估侧无权写入技能仓库。反之,优化侧可以修改技能,但无法访问未脱敏的探针目标、验证器或执行追踪记录。这种隔离机制防止实践反馈成为直接的记忆目标。
调度器是一个消息路由器,而非决策权威机构。在每一步中,它在两侧之间路由脱敏证据与审查请求,并记录已采纳的结果。采纳决策依据相应侧可用的证据做出,确保决策历史始终与产生该历史时的权限边界保持一致。
2.3 持久化决策历史
SkillHone 的核心设计目标之一是让技能进化能够跨会话持久化。后续的智能体不应只获取最新的技能快照,还应继承技能为何变更、考虑了哪些替代方案、候选方案如何被评估、以及哪些结果被采纳或拒绝的结构化记录。
SkillHone 将每个开发步骤表示为一个决策记录
其中 是诊断结果, 是候选修订方案, 是脱敏后的评估证据, 是最终结果。结果可以是采纳修订、拒绝修订、请求进一步修改,或推迟诊断。截至第 次迭代的决策历史为 。
决策记录不仅仅是版本差异。差异对比只显示文件如何变化;而决策记录则将这种变化与其所针对的问题、用于评估的证据以及最终决策联系起来。这种区别对于持续演进至关重要。当环境发生变化时,后续的子智能体可以检查该记录,以确定故障是否为新的、是否已尝试过类似的修复方案,以及之前为何拒绝了某个替代方案。
给定一份新的脱敏报告后,优化子智能体会从记录库中检索相关的先前记录。它们可能会重新审视旧的诊断,根据新证据修改被拒绝的补丁,或者避免进行已经失败的重复编辑。因此,决策历史充当了演进过程本身的持久记忆。它使智能体能够审计先前的变更,并持续改进技能,而无需重新推导相同的诊断结论。
1:初始技能 ,技能库 ,评估库
2:
3:循环执行
4: 评估调度器运行于 并导出
5: 优化调度器检索 ,然后提出
6: 评估调度器返回 的脱敏证据
7: 决策
8: 如果接受则 ,否则
9:
10:循环结束
11:返回
3 实验
| GAIA | WebWalkerQA-EN | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| 设置 | 系统 | L1 | L2 | L3 | 平均 | 简单 | 中等 | 困难 | 平均 |
| 精选搜索 | deep-research agent | 61.9 | 47.0 | 26.3 | 48.8 | 58.5 | 62.3 | 67.1 | 63.2 |
| 原始开放网络 | Existing-Skills | 64.3 | 33.3 | 21.1 | 41.7 | 51.2 | 48.5 | 52.6 | 50.2 |
| Skill-Creator | 64.3 | 37.9 | 21.1 | 44.1 | 36.6 | 36.9 | 40.8 | 38.1 | |
| Hermes-SE | 73.8 | 40.9 | 31.6 | 50.4 | 53.7 | 51.5 | 55.3 | 53.0 | |
| SkillHone(我们的方法) | 76.2 | 66.7 | 31.6 | 64.6 | 53.7 | 69.2 | 68.4 | 66.4 | |
我们在公开的深度研究基准上,将 SkillHone 与现有的技能构建和优化方法进行了评估,所有方法均使用固定的执行时间智能体主干;我们检验了所得技能包在不同主干间的迁移能力,并报告了一项针对重复性内部工具中介分析场景的部署研究。
3.1 实验设置
我们在深度研究场景中实例化这一对比,因为信息检索是最广泛使用的智能体工作负载之一,并且天然受益于可复用的技能:任务要求智能体结合搜索、导航、提取、验证和恢复能力,在变化的网络来源中工作,因此外部资源存在速率限制、间歇性故障和格式变化,这要求智能体能够诊断故障、修正技能,并保留这些修正背后的评估证据。
我们使用两个开放域基准测试:GAIA(Mialon 等人,2024)的纯文本验证子集和 WebWalkerQA(Wu 等人,2025)的英文分集。GAIA 强调跨异构来源的多步信息检索和事实依据,而 WebWalkerQA-EN 则侧重于网页导航和信息提取。
我们比较两种评估设置:
- •
精选搜索:深度研究智能体使用商业检索服务,不维护自己的搜索栈。
- •
原始开放网络:智能体没有预集成的搜索工具。它们通过通用智能体运行时、公共网络访问以及可移植的技能包来运行,这些技能包组织了搜索、解析、提取和恢复流程。由于这些技能依赖公共页面和免费或社区搜索接口,它们必须在没有托管检索服务的情况下处理速率限制、不可用的端点以及变化的页面格式。
我们将优化技能的控制器与执行和评估技能的后端分离开来。Claude Opus 4.6 作为开发阶段的控制器,负责读取反馈、形成诊断并修正技能包。Qwen3.6-35B-A3B(Qwen 团队,2026)作为执行和评估后端,用于在开发阶段运行技能并生成最终的基准测试分数。
为了驱动技能进化,我们从公开发布的 WebShaper 数据集(Tao 等人,2025)中采样了 20 个项目,该数据集与 GAIA 和 WebWalkerQA-EN 不重叠,并将它们适配到我们的智能体执行环境中。这些项目作为所有技能进化基线方法的共享开发数据,每种方法根据自身的优化流程使用它们。
3.2 基线方法
原始开放网络对比从共享的现有技能池开始。我们通过一个智能体从 ClawHub 和 SkillHub 中选取与搜索相关的社区技能来构建这个技能池;附录 A 列出了所选技能。该技能池提供给所有可比较的原始开放网络系统,以确保公平对比;各系统的区别在于它们是否以及如何调整这些初始技能。
原始开放网络对比包含一个直接使用设置和三个技能开发系统:
- •
现有技能:直接将技能作为可移植技能包加载,不进行进一步优化。
- •
技能创造者:应用内置的迭代技能优化。
- •
Hermes-SE:应用反思式技能优化。
- •
SkillHone:运行完整的框架,包含角色分离的子智能体、经过编辑的评估反馈以及持久化的决策历史。
所有原始开放网络系统都生成相同的可移植技能包接口:一个包含可选脚本、参考资料、模板和支持资源的 SKILL.md 入口文件。它们的区别仅在于技能包的开发方式。
3.3 主要结果
表 1 报告了最终的基准测试结果。SkillHone 在两个基准测试上都取得了最佳平均分,在 GAIA 和 WebWalkerQA-EN 上分别达到 [原文此处为空白/占位符],比深度研究智能体高出 [原文此处为空白/占位符] 分,尽管在评估时并未使用预集成的搜索工具。性能提升主要集中在较难的分项上,这些分项需要决定如何搜索、提取证据、验证发现以及从失败尝试中恢复。
在原始开放网络设置中,SkillHone 也优于共享技能池的技能开发基线:在 GAIA/WebWalkerQA-EN 上比技能创造者高出 [原文此处为空白/占位符] 分,比 Hermes-SE 高出 [原文此处为空白/占位符] 分。与现有技能的差距表明,仅仅让智能体接触到相关技能是不够的:SkillHone 将它们转化为一个任务流程,用于决定何时广泛搜索、追踪某个来源、验证答案以及从失败路径中恢复,因此主要收益来自组织方式而非单个组件。
图 3 进一步评估了向 Claude Sonnet 4.6 的迁移效果:在此骨干模型上无需额外优化,SkillHone 在 GAIA 上达到 [原文此处为空白/占位符],比 Hermes-SE/现有技能/技能创造者高出 [原文此处为空白/占位符] 分。
附录 C(图 4)比较了 SkillHone 和 Hermes-SE 在同一组练习探针上的优化轨迹,展示了在持久决策历史下的范围性回滚与在标量信号下的全候选接受之间的差异。
3.4 消融实验
为了分离两种核心机制,我们在原始开放网络环境和上述相同的 Qwen3.6-35B-A3B 执行主干下分别对每种机制进行消融实验。无决策历史设置保留了角色分离的子智能体,但每一步仅从最新的技能工件开始,并像反思基线那样对标量信号进行优化。无角色分离设置保留了决策历史,但让单个子智能体同时访问技能仓库和未经编辑的评估资产。
表 2 显示,决策历史占据了更大份额:移除它导致 GAIA/WebWalkerQA-EN 下降 / 个百分点,而移除角色分离则下降 / 个百分点。
3.5 部署研究
我们进一步在内部工具介导的分析场景中评估 SkillHone,以测试它是否能改进用于重复性分析请求的技能,而不仅限于公开网络基准测试。我们从内部工作流中选取了几个重复性场景及其对应的种子技能,然后应用 SkillHone 在每个场景的固定精确匹配评估集上改进相应技能(附录 F)。
表 3 总结了所选场景。SkillHone 在七个选定技能中改进了其中六个,使其优于种子版本,在计数、聚合、结构解析和跨度检索方面提升最大。剩余的场景(列表过滤)在总体层面保持稳定。在所有列出的场景中,SkillHone 将准确率平均提升了 个百分点,其中初始流程未充分指定可复用分析步骤的场景提升最为显著。
| 场景 | |
|---|---|
| 计数 | |
| 聚合 | |
| 结构解析 | |
| 密度估计 | |
| 跨度检索 | |
| 过滤排序 | |
| 列表过滤 | |
| 平均值 |
4 相关工作
智能体技能与技能获取。
近期对智能体技能的抽象化,将特定任务的流程、脚本、参考资料和惯例打包成可复用的工件,大语言模型智能体可按需加载(Xu and Yan, 2026; Ling et al., 2026)。诸如 Li et al. (2026) 和 Han et al. (2026) 等基准测试衡量了技能在通用任务和软件工程场景中的帮助程度,而技能获取方法则研究从探索与反馈中自动发现(Yang et al., 2025)、基于强化学习的演化(Vishe et al., 2026; Xia et al., 2026)以及特定领域的构建(Liu et al., 2026)。这些工作侧重于将技能作为输出进行生成或评估;而 SkillHone 则保留了优化上下文——失败模式、候选修订方案及结果——使得后续智能体能够继承决策历史,从而让未来的改进成为可能。
提示词、系统与技能的优化。
在语言系统优化领域,纯提示词方法利用大语言模型提出并选择改进后的指令(Zhou et al., 2022; Yang et al., 2024a);Reflexion 风格的智能体利用语言反馈来改进多次尝试中的行为(Shinn et al., 2023);DSPy 将语言模型流水线构建为可声明式编程、并可进行端到端编译与优化的程序(Khattab et al., 2023)。与之更相关的是,GEPA 通过反思方式演化语言系统的组件(Agrawal et al., 2026),而 Hermes-SE 则将这种风格应用于技能、提示词、工具描述和代码。这些方法在单次运行中基于标量信号进行优化;SkillHone 则允许后续智能体从先前运行停止的地方继续,审计已尝试过的方案,并避免重复编辑。
多智能体协作与智能体开发工作流。
多智能体大语言模型系统表明,角色专业化能够提升协作式问题解决能力(Talebirad 与 Nadiri,2023;Guo 等人,2024;Wang 等人,2024;Tran 等人,2025)。MetaGPT 将智能体组织为专业化角色,以生成类似软件制品的内容(Hong 等人,2024),而 SWE 类基准测试(Jimenez 等人,2024;Yang 等人,2024b;Xia 等人,2025)则在任务自然表现为诊断、代码修改和测试的环境中研究大语言模型智能体。SkillHone 将角色分离用于不同目的:优化子智能体提出技能修订方案,评估子智能体测试候选方案并在权限受限的分发器下返回经过编辑的证据,从而积累可供智能体读取的决策历史,同时减少从评估资产向优化侧的信息泄露。
5 结论
我们提出了 SkillHone,这是一个通过角色分离的子智能体、经过编辑的实践反馈以及将问题、修订、证据和结果关联起来的持久决策历史来演化技能的框架。在 GAIA 和 WebWalkerQA-EN 上,SkillHone 超越了迭代式和反思式技能开发基线以及深度研究智能体,并在七个重复出现的内部场景中平均提升了种子技能的表现。该技能包可迁移至不同的执行后端而无需进一步优化,这表明性能提升来自技能流程本身,而非对特定模型的拟合。决策历史使后续智能体能够改进技能,而无需重新推导先前的决策。
局限性
目前 SkillHone 仅能独立演化单一技能;本工作未涉及对多个相互依赖的技能进行联合演化,包括跨共享资源的协调以及重叠的失败模式。
参考文献
- L. A. Agrawal, S. Tan, D. Soylu, N. Ziems, R. Khare, K. Opsahl-Ong, A. Singhvi, H. Shandilya, M. J. Ryan, M. Jiang, C. Potts, K. Sen, A. Dimakis, I. Stoica, D. Klein, M. Zaharia, and O. Khattab (2026) GEPA:反思式提示词演化可超越强化学习。载于第十四届国际学习表征会议,外部链接:Link,引用自:§1, §4。
- T. Guo、X. Chen、Y. Wang、R. Chang、S. Pei、N. V. Chawla、O. Wiest 和 X. Zhang(2024)《基于大语言模型的多智能体:进展与挑战综述》。arXiv 预印本 arXiv:2402.01680。引用自:§4。
- T. Han、Y. Zhang、W. Song、C. Fang、Z. Chen、Y. Sun 和 L. Hu(2026)《SWE-skills-bench:智能体技能在真实世界软件工程中是否真正有用?》。arXiv 预印本 arXiv:2603.15401。引用自:§4。
- S. Hong、M. Zhuge、J. Chen、X. Zheng、Y. Cheng、J. Wang、C. Zhang、S. Yau、Z. Lin、L. Zhou 等(2024)《MetaGPT:面向多智能体协作框架的元编程》。收录于国际学习表征会议,第 2024 卷,第 23247–23275 页。引用自:§4。
- C. E. Jimenez、J. Yang、A. Wettig、S. Yao、K. Pei、O. Press 和 K. Narasimhan(2024)《Swe-bench:语言模型能否解决真实世界的 GitHub 问题?》。收录于国际学习表征会议,第 2024 卷,第 54107–54157 页。引用自:§4。
- O. Khattab、A. Singhvi、P. Maheshwari、Z. Zhang、K. Santhanam、S. Vardhamanan、S. Haq、A. Sharma、T. T. Joshi、H. Moazam 等(2023)《Dspy:将声明式语言模型调用编译为自我改进的流水线》。arXiv 预印本 arXiv:2310.03714。引用自:§4。
- X. Li、W. Chen、Y. Liu、S. Zheng、X. Chen、Y. He、Y. Li、B. You、H. Shen、J. Sun 等(2026)《SkillsBench:基准测试智能体技能在多样化任务中的表现》。arXiv 预印本 arXiv:2602.12670。引用自:§4。
- G. Ling、S. Zhong 和 R. Huang(2026)《智能体技能:基于数据分析的 Claude 技能研究,用于扩展大语言模型功能》。arXiv 预印本 arXiv:2602.08004。引用自:§1、§4。
- X. Liu、X. Luo、L. Li、G. Huang、J. Liu 和 H. Qiao(2026)《SkillForge:在云技术支持中锻造领域特定、自我进化的智能体技能》。arXiv 预印本 arXiv:2604.08618。引用自:§4。
- G. Mialon、C. Fourrier、T. Wolf、Y. LeCun 和 T. Scialom(2024)《Gaia:通用 AI 助手的基准》。收录于国际学习表征会议,第 2024 卷,第 9025–9049 页。引用自:§3.1。
- Qwen 团队(2026)《Qwen3.6-35B-A3B:智能体编程能力,现已全面开放》。外部链接:Link。引用自:§3.1。
- N. Shinn、F. Cassano、A. Gopinath、K. Narasimhan 和 S. Yao(2023)《Reflexion:基于语言智能体的口头强化学习》。收录于《神经信息处理系统进展》第 36 卷,第 8634–8652 页。引用于:§4。
- Y. Talebirad 和 A. Nadiri(2023)《多智能体协作:发挥智能大语言模型智能体的力量》。arXiv 预印本 arXiv:2306.03314。引用于:§4。
- Z. Tao、J. Wu、W. Yin、J. Zhang、B. Li、H. Shen、K. Li、L. Zhang、X. Wang、Y. Jiang、P. Xie、F. Huang 和 J. Zhou(2025)《WebShaper:通过信息寻求形式化实现智能体数据合成》。外部链接:2507.15061,链接。引用于:§3.1。
- K. Tran、D. Dao、M. Nguyen、Q. Pham、B. O’Sullivan 和 H. D. Nguyen(2025)《多智能体协作机制:大语言模型综述》。arXiv 预印本 arXiv:2501.06322。引用于:§4。
- Y. Vishe、R. Surana、X. Jiang、Z. Huang、X. Li、N. L. Kuang、T. Yu、R. A. Rossi、J. Shang、J. McAuley 等人(2026)《Skill-R1:通过强化学习实现智能体技能进化》。arXiv 预印本 arXiv:2605.09359。引用于:§4。
- L. Wang、C. Ma、X. Feng、Z. Zhang、H. Yang、J. Zhang、Z. Chen、J. Tang、X. Chen、Y. Lin 等人(2024)《基于大语言模型的自主智能体综述》。载于《计算机科学前沿》第 18 卷第 6 期,第 186345 页。引用于:§4。
- J. Wu、W. Yin、Y. Jiang、Z. Wang、Z. Xi、R. Fang、L. Zhang、Y. He、D. Zhou、P. Xie 等人(2025)《WebWalker:大语言模型网页遍历能力基准测试》。收录于《第 63 届计算语言学协会年会论文集(第一卷:长论文)》,第 10290–10305 页。引用于:§3.1。
- C. S. Xia、Z. Wang、Y. Yang、Y. Wei 和 L. Zhang(2025)《Live-SWE-Agent:软件工程智能体能否实时自我进化?》。arXiv 预印本 arXiv:2511.13646。引用于:§4。
- P. Xia、J. Chen、H. Wang、J. Liu、K. Zeng、Y. Wang、S. Han、Y. Zhou、X. Zhao、H. Chen 等人(2026)《SkillRL:通过递归技能增强强化学习进化智能体》。收录于 ICLR 2026 终身智能体研讨会:学习、对齐与进化。引用于:§4。
- R. Xu 和 Y. Yan(2026)《大语言模型的智能体技能:架构、获取、安全及未来路径》。arXiv 预印本 arXiv:2602.12430。引用于:§1、§4。
- C. Yang、X. Wang、Y. Lu、H. Liu、Q. V. Le、D. Zhou 和 X. Chen(2024a)《大语言模型作为优化器》。收录于《国际学习表征会议》,第 2024 卷,第 12028–12068 页。引自第 4 节。
- J. Yang、C. E. Jimenez、A. Wettig、K. Lieret、S. Yao、K. Narasimhan 和 O. Press(2024b)《SWE-agent:智能体-计算机接口实现自动化软件工程》。《神经信息处理系统进展》第 37 卷,第 50528–50652 页。引自第 4 节。
- Y. Yang、S. Kang、J. Lee、D. Lee、S. Yun 和 K. Lee(2025)《通过探索与迭代反馈实现语言智能体的自动化技能发现》。arXiv 预印本 arXiv:2506.04287。引自第 4 节。
- Y. Zhou、A. I. Muresanu、Z. Han、K. Paster、S. Pitis、H. Chan 和 J. Ba(2022)《大语言模型是达到人类水平的提示词工程师》。收录于《第十一届国际学习表征会议》。引自第 4 节。
附录 A 现有社区技能
共享的现有技能池由智能体从 ClawHub 和 SkillHub 上与搜索相关的社区技能中选取:
- •
web-pilot
- •
web-content-fetcher
- •
scholar-search
- •
query-dbpedia
- •
multi-search-engine
- •
literature-review
- •
geepers-data
- •
duckduckgo-websearch
- •
deep-research-pro
- •
ddgs-search
附录 B 仓库工作流示例
在我们的实现中,SkillHone 通过类似 GitHub 的仓库工作流来实现持久化的决策历史。Issue 记录已诊断的故障模式,Pull Request 包含提议的技能修订,合并或拒绝决策则记录最终接受的结果。这是使演化过程可审计的一种具体接口,而非 SkillHone 的必需接口。
表 4 展示了一次深度研究技能运行的仓库记录。这五行对应图 4 中所示的五次非种子 SkillHone 迭代。该表突出显示,SkillHone 优化的是整个技能包,包括指令、脚本和参考文献,而不仅仅是像 Hermes-SE 对比中那样重写单个 SKILL.md 正文。
| 迭代 | Issue | PR | 变更文件 |
|---|---|---|---|
| 1 | #1 DuckDuckGo 搜索、错误处理与时间管理 | #2 DuckDuckGo 搜索、错误处理与时间管理 | SKILL.md (+29/-13), scripts/ddg_search.sh (+25/-0), scripts/web_search.sh (+25/-7), scripts/wiki_page.sh (+15/-3), scripts/wiki_search.sh (+15/-3), scripts/wiki_section.sh (+39/-9), scripts/wikidata_lookup.sh (+52/-0) |
| 2 | #3 真实网络搜索、脚本修复、提前写入策略 | #4 真实网络搜索、脚本修复、提前写入策略 | SKILL.md (+33/-48), scripts/ddg_search.py (+53/-0), scripts/fetch_url_jina.sh (+25/-0), scripts/web_search.sh (+6/-6), scripts/wiki_page.sh (+3/-3), scripts/wiki_search.sh (+3/-3), scripts/wiki_section.sh (+7/-7) |
| 3 | #11 合并迭代1和迭代2的最佳成果,采用更轻量的验证和更严格的预算 | #12 合并迭代1和迭代2的最佳成果 | SKILL.md (+33/-40) |
| 4 | #15 名称格式问题及更严格的预算 | #16 名称格式规则与Wikidata SPARQL | SKILL.md (+13/-6), scripts/wikidata_sparql.py (+59/-0) |
| 5 | #19 将预算回退至20,同时保留名称规则和SPARQL | #21 将预算回退至20,保留名称规则和SPARQL | SKILL.md (+45/-46) |
附录C 优化轨迹
图4比较了在同一组练习探针上,一次SkillHone运行与一次Hermes-SE运行的表现。两者均从同一种子技能开始。SkillHone通过有针对性的后续编辑,从初始状态逐步提升,并从两次性能倒退的修订中恢复。Hermes-SE则在标量验证信号下接受或跳过整个提示词候选方案。这说明了持久决策历史的操作价值:后续修订可以在保留有用编辑的同时,针对变更中有问题的部分进行修正。
附录D 评估仓库与编辑
SkillHone 使用一个技能评估仓库,在技能开发过程中提供练习反馈。该仓库存储探针任务实例、标准答案、验证器、来源元数据以及执行轨迹。探针条目可能来自现有来源,例如人工编写的案例、历史失败案例或环境衍生的检查项。它仅假设评估子智能体能够针对可用的探针条目运行当前技能,并将经过脱敏处理的报告导出到优化端。
对于每个探针条目,我们用 表示任务实例,用 表示标准答案,用 表示验证器,用 表示来源元数据。运行当前技能会产生
其中 是验证结果。优化端仅接收一份经过脱敏处理的问题报告
该报告总结了失败模式、汇总结果和诊断假设,而不暴露未脱敏的标准答案、验证器或执行轨迹。最终的基准评估保持在优化循环之外。
附录 E 子智能体调度模式与权限
表 5 中的角色并非 SkillHone 预先配置的固定身份。它们是运行时调度器在运行开发循环时观察到的重复出现的调度模式。每个子智能体按需创建,被分配到一个受权限约束的团队,并且仅被授予该次调度所需的操作权限。
团队边界是结构性机制。优化子智能体可以写入技能仓库,但无法访问未脱敏的探针目标、验证器或执行轨迹。评估子智能体可以检查探针和轨迹,但不能写入技能仓库。运行时调度器创建子智能体并路由工件,但它不直接编辑任何一个仓库。
| 团队 | 调度模式 | 权限边界 |
| 优化 | 提议者 | 读取脱敏报告和决策历史;写入诊断信息;无权访问探针目标或验证器。 |
| 优化 | 探索者 | 当修订需要时,搜索外部资源以寻找可复用的模式;无权访问探针目标或验证器。 |
| 优化 | 开发者 | 编辑并提出类型化的修订方案;无权访问未脱敏的评估资产。 |
| 优化 | 审查者 | 使用经过脱敏处理的证据和先前的决策记录来审查待定的技能变更;无权访问探测目标或验证器。 |
| 优化 | 决策器 | 根据记录的证据接受或拒绝候选修订版本;无权访问未经脱敏处理的评估资产。 |
| 评估 | 执行器 | 在探测项目上运行;可以检查预言机目标、验证器和追踪记录;无技能仓库写入权限。 |
| 评估 | 诊断器 | 分析结果和追踪记录;更新评估诊断信息;无技能仓库写入权限。 |
| 评估 | 报告器 | 为优化端生成经过脱敏处理的问题报告;无修订决策权。 |
| 评估 | 审计器 | 检查探测元数据、追踪记录和脱敏报告,以确保评估端的一致性;无技能仓库写入权限。 |
| 运行时 | 调度器 | 创建子智能体并在仓库之间路由工件;无直接技能编辑权限,也无权访问未经脱敏处理的探测目标。 |
附录 F 部署评估协议
表 3 中的每个场景都是一项重复出现的、以工具为中介的分析任务。每个场景的评估集由具有代表性的、经去标识化处理的请求组成,其参考答案由大语言模型标注生成,并经人工标注员验证;存在分歧时通过复核解决。准确率是与已验证参考答案的精确匹配。植入的技能和 SkillHone 优化后的技能在相同的固定评估集上、在相同的运行时配置下运行,因此报告的结果反映的是技能层面的变化,而非评估集的漂移。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org