跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-03精选AI 评分72

SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

AI 导读

SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。

推荐理由

把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。

正文 · AI 翻译
Refer to caption
(a)宏观层面的平均性能画像。
Refer to caption
(b)微观层面的验证收敛轨迹。
图1:SkillOpt-Lite 的整体性能画像与优化速度。(a)雷达图展示了在所有评估模型规模上平均后的宏观能力对比,显示相较于初始技能和原始 SkillOpt 均取得了全面的性能提升。(b)在代表性追踪片段上的微观收敛曲线表明,我们的最小可行流水线能够在紧凑的 10 批次范围内,实现显著加速的策略优化和更高的验证上限(迄今为止的最佳 val_hard 值)。

引言

AI 智能体已从研究原型转变为标准生产工具 [2, 17, 16]。实际部署表明,智能体的真实世界能力不仅取决于其基础大语言模型(LLM),还取决于基础模型、其运行框架(harness)及其领域启发式规则(技能)之间的相互作用。由于基础模型在推理期间保持冻结状态,智能体工程通常简化为优化这些技能文档——在此过程中,细微的文本变化常常会导致下游任务性能出现非线性的巨大差异 [27, 26, 8, 9, 14]。

为应对这种非线性敏感性,自动化技能优化已从开环式自我反思 [21, 24] 演变为复杂的算法流水线 [14, 28, 11, 4]。在现有文献中,SkillOpt [27] 通过连续优化类比将文本修订形式化,实现了小批量树合并、文本学习率调度以及拒绝编辑缓冲区。然而,尽管取得了经验上的收益,现有框架却呈现出日益增长的架构复杂性趋势。它们融入了经典优化中的复杂机制,却未能解决一个根本性问题:

对于技能优化而言,一个每个组件都经理论或经验必要性验证的最小可行流水线,究竟由什么构成?

在本报告中,我们通过连接零阶优化、统计学习理论与系统工程来探讨这一问题。我们首先将现有的反思范式映射到零阶优化。如表1所示,单次追踪批评[21, 24]对应单点梯度估计器;对比诊断[4]反映中心差分近似;故障隔离编辑[28]模拟沿基向量的坐标下降;而编辑预算[27, 11]与拒绝缓冲区则实例化了信任区域半径和控制变量。然而,我们识别出一个关键的概念分歧:经典零阶优化依赖于对不可观测状态的盲目数值扰动,而智能体展开则产生显式且语义丰富的执行轨迹。技能优化从根本上讲是一种以语言为媒介的程序编译过程,其中轨迹充当可解释的调试反馈。

为了形式化这一编译器范式,我们确立了三条基础设计原则。前两条源于PAC学习理论:

  1. (1)

    跨轨迹共识挖掘:对单次试验异常的过拟合会增大稳定性系数,导致泛化崩溃。优化器不应执行复杂的树形归约,而应充当压缩算子,捕捉跨任务的不变量。

  2. (2)

    独立验证门控:PAC界限表明,保留的验证集可将泛化误差中的项移除。为防止评估偏差,门控必须依赖独立样本,而非对训练失败进行子采样。

受Unix和Claude Code[3]“一切皆文件”哲学的启发,我们设计了一项初步实验:将每条执行轨迹隔离为独立的平面文件,并部署一个自主编码智能体,利用原始文件系统工具对其进行优化。实验发现,这种单批次文件修改在多个基准测试上的表现可能优于经过完整四个epoch优化的完整SkillOpt流程,由此我们推导出第三条经验原则:

  1. (3)

    技能优化的惨痛教训:随着基础大语言模型规模扩大,为减缓更新速度而设计的定制化拓扑结构反而适得其反。赋予智能体原始 shell 工具以直接检查原始日志文件,其表现始终优于经过大量工程设计的基线方案。

综合这些原则,我们提出了 SkillOpt-Lite,一个最小可行流水线,它去除了小批量反射池化、缓慢更新阻尼和拒绝缓冲区。取而代之的是,SkillOpt-Lite 通过一个仅由轨迹探索、共识挖掘和验证门控组成的自主调试循环,直接在磁盘上运行。如图 1 所示,这种精简设计在所有六个基准测试上均比完整配置的 SkillOpt 基线取得了持续改进。在 Spreadsheet 等逻辑密集型任务上,它实现了平均得分 +12.6 分的提升(69.7 对比 57.1)。此外,如图 1b 所追踪,去除反射池化使得轻量级模型能够绕过早期探索平台期;例如,在 ALFWorld 上,SkillOpt-Lite 将 GPT-5.4-nano 提升至 81.3%(比 SkillOpt 高出 9.5 分),同时在旗舰级基座上(例如 Spreadsheet-GPT-5.5)于第一步内即展现出快速收敛。

最后,我们将我们的流水线封装为一个开源的 VS Code Copilot 扩展,允许开发者通过单个斜杠命令触发技能优化[引用: 1]。关键在于,由于我们的框架将所有智能体组件仅视为标准的可编辑代码,在 IDE 环境中解除文件路径限制使得这个最小循环能够自然地泛化到完整的工具链优化——我们将此框架命名为 HarnessOpt。在 SpreadsheetBench 上,HarnessOpt 持续解决了诸如推理循环等模型特定的瓶颈。值得注意的是,该框架使得轻量级 GPT5.4-nano 模型达到了 的准确率,超越了在标准工具链和完整 SkillOpt 流水线()下运行的规模更大的 GPT5.5 模型。总而言之,我们的主要贡献有三点:

  • •

    理论形式化:我们将智能体技能训练映射为零阶优化,识别出其独特的程序-编译器特性,并推导出控制稳定性和验证的核心原则。

  • •

    最小可行流水线:基于以文件为中心的哲学,我们提出了 SkillOpt-Lite,并通过实验证明,用原始文件探索替代复杂的优化模块,能够在多个基线上实现更快的收敛和更优的性能。

  • •

    工具扩展与 IDE 封装:我们展示了该流水线可直接扩展至自动化工具优化(HarnessOpt),使轻量级模型通过环境协同设计超越前沿级模型。我们将整个工作流封装为一个 VSCode 扩展,实现一键式智能体进化。

技能优化分析

技能训练与零阶优化

算法关联

我们将技能优化形式化为期望奖励函数的最大化,其中 表示基于文本的技能构件, 是冻结的骨干大语言模型, 表示从分布 中抽取的任务实例, 表示执行工具。由于 的离散性以及 与 组合的不可微性,梯度在解析上难以处理,因此智能体-环境交互被建模为零阶(ZO)预言机。这一形式化揭示出,现有启发式方法所利用的组件与经典零阶工具箱 [10] 中的组件类似,尽管语义领域缺乏连续、光滑的流形。

形式上,我们在连续零阶操作与离散文本空间编辑之间建立了一种结构类比:文本工件在扰动位置(或沿标准坐标基)进行评估,其中 表示步长类比量, 是随机搜索方向。在此统一框架下,环境反馈(例如执行轨迹、错误日志和验证分数)充当标量预言机评估 。大语言模型驱动的自我反思、补丁生成和技能编辑则充当离散空间中对连续零阶算子的结构类比,例如随机梯度估计器 、坐标下降法、信赖域约束 以及方差缩减控制变量 。因此,从单轨迹启发式方法 [21, 24] 到结构化多点方差缩减方案 [27, 14, 11] 等主流智能体工作流,都可以通过算法化零阶优化的视角进行系统分析,如表 1 所示。

媒体内容 · 前往原文查看
表 1:零阶优化算子与大语言模型/智能体反思范式之间的映射关系
零阶优化概念 公式 / 算子 智能体领域度量 文献实现
零阶预言机 沙箱环境反馈 训练性能的标量指标。
单点估计 单轨迹反思 • Reflexion[21]:基于单条轨迹的直接反思。 • Voyager[24]:单次错误信号触发局部程序覆写。
多点 / 小批量 批量展开共识提取 • Trace2Skill[14]:使用 Map-Reduce 进行补丁合并的零阶随机梯度下降。 • SkillOpt[27]:批量大小为 的迭代式反思小批量方法。 • SkillForge[11]:用于轨迹去噪的第二阶段批量工单聚合。
中心差分 成功-失败对比分析 • SkillCat[4]:在动作分歧点 进行轨迹对比分析的自定义中心差分估计算子。
零阶坐标下降法 故障隔离的原子化修改 • SkillAdapter[28]:坐标下降法,将故障步骤固定为轴,将候选技能固定为基向量。
信赖域半径 结构化编辑约束 • SkillOpt[27]:编辑预算衰减()。 • SkillForge[11]:强制执行最小修改原则。 • SoftSkill[23]:将软前缀长度限制在 个 token 以内。
控制变量 历史记忆拒绝 • SkillOpt[27]:将拒绝的编辑结果传入缓冲区,作为负对照控制变量。

概念分歧

尽管将智能体技能训练映射到零阶优化引入了成熟的方差缩减方法,但这两个范式之间存在一个关键的概念分歧。在经典零阶优化中,决策变量定义在数值空间内。预言机作为一个严格的黑箱,仅返回一个标量奖励值,而详细的运行时轨迹或中间状态转换则保持潜在且不可观测的状态。

相反,技能优化的一个显著特征在于,每一次大语言模型 rollout 都会产生一条显式、结构化且语义丰富的轨迹,其中包含历史试验日志、中间规划推理过程以及运行时错误信息。这些轨迹封装了成功或失败的确切因果链。从这个角度来看,技能优化从黑箱函数查询转变为一个随机编码问题,其中技能库充当用自然语言编写的高级软件程序的存储库。大语言模型不仅扮演评估者的角色,更充当底层的编译器与执行运行时,而生成的 rollout 轨迹则作为中间程序执行跟踪记录。

传统零阶优化由于无法检查底层函数,被迫通过数值变化盲目地近似梯度。相比之下,技能优化利用可读的执行轨迹来执行有针对性的、基于语义的调试。在第 3.2 节中,我们介绍了 SkillOpt-Lite,这是一个专门为利用这种程序-编译器范式而设计的框架,通过将语义执行轨迹转化为可操作的代码补丁来实现。

泛化误差:一种 PAC 学习视角

尽管其形式化表述为一种以语言为中介的编码过程,但技能优化本质上仍是一个受 PAC 学习基本原理解释的统计学习问题。在 PAC 框架下,所学技能库在真实任务分布上的泛化误差,受限于其经验误差加上一项合规性惩罚。这一泛化差距并非依赖于静态假设空间的统一容量度量,而是可以通过期望平均稳定性这一视角得到紧致界定 [20]:

其中, 为训练实例数量, 表示技能优化算法的期望稳定性系数。

设 为训练数据集, 为移除第 个任务实例 后形成的相邻数据集。若一个优化算法在真实数据分布上的性能方差期望满足以下条件,则该算法具有系数为 的期望平均稳定性:

在语义领域中, 衡量算法对偶发性特异样本的统计抗性。如果优化过程过度拟合某个特定样本的异常情况——例如硬编码逐案例的分支操作,或模仿仅出现在单次失败试验中的局部环境变量——稳定性系数就会增大,从而导致泛化崩溃。为最小化 ,优化算法必须摒弃单样本的奇异特征,提取跨异构轨迹的共有属性。这种稳定化压缩迫使演化中的技能捕捉不变的结构逻辑,而非记忆单次试验的轨迹。

实际框架通过多种设计来强制实现跨任务共识:Trace2Skill [14] 和 SkillForge [11] 将轨迹聚合为小批量或批次票池,以提取不变的经验教训;而 SkillOpt [27] 则通过并行化的大语言模型合并,执行层级化树状归约。

在自我演化过程中,为了选择最优模型,采用了基于验证集的模型选择方法。假设评估指标有界于 ,则经验性选出的技能库的泛化误差,在 个验证样本上遵循标准的模型选择界限 [30]:

通过对比这两种泛化边界,我们发现了验证协议所释放出的显著统计红利。在标准训练边界中,泛化差距锚定于算法的单样本敏感性。当智能体在表达密度极高的自然语言空间中搜索时,拟合单个样本特征的倾向会削弱泛化能力。关键在于,一旦引入不相交的验证集,稳定性系数便完全从模型选择上界中移除。然而,这种解耦的统计有效性取决于一条基本规则:验证集必须严格与训练集不相交且独立,才能对泛化差距产生无偏估计。

对近期文献的评估显示,这种验证协议普遍遭到违反:诸如 Reflexion [21] 等研究完全以开环方式绕过了动态验证,而 SkillCat [4]、SkillAdapter [28] 和 Trace2Skill [14] 等框架则通过直接在源训练失败实例的克隆副本或训练子集上执行其门控机制,损害了验证边界。

SkillOpt-Lite

一个激励性示例:使用编码智能体编写技能

如第 2.1.2 节所述,技能优化可建模为程序-编译器范式,其中技能文档充当软件程序,大语言模型则作为底层编译器。为评估这一范式,我们开展了一项模拟 AI 工程师利用商业编码助手优化智能体技能工作流程的试点研究。具体而言,我们收集了由 GPT-5.4-nano 优化循环初始批次生成的原始 rollout 轨迹,并将其存储为本地文本文件。随后,我们部署 GitHub Copilot [6],使其仅通过原始文件系统工具自主探索该目录,并明确指示其诊断跨轨迹的系统性失败模式,直接对基线技能文件应用最小修改补丁。

关键在于,该助手绕过了所有预定义的数学拓扑结构——例如 SkillOpt 中使用的微批次切片或层级树归约算子——并直接提交了这些修改,未执行任何中间验证循环。优化后的技能随后在 Spreadsheet [12]、ALFWorld [22]、LiveMath [7] 和 DocVQA [13] 的下游测试集上进行了评估。

Refer to caption
图 2:单批次编码智能体探索与多轮次技能优化的实证评估。

图 2 所示的实证结果揭示了一个具有启发性的现象。在没有迭代循环的情况下,编码助手的单批次文件系统探索取得了显著的性能提升。值得注意的是,在 LiveMath 和 DocVQA 两个基准上,这种单批次、未经验证的智能体配置,其表现甚至超过了基线 SkillOpt 框架经过四轮完整迭代优化后的结果。这一趋势凸显了大语言模型在直接操作原始执行文件时的能力。相反,在 Spreadsheet 基准上,优化后的技能性能下降至低于其初始基线水平,这证明了形式化优化流程中闭环验证机制的必要性。

SkillOpt-Lite 流程

Refer to caption
(a) 原始 SkillOpt 流程 [27]。
Refer to caption
(b) 提出的 SkillOpt-Lite 流程。该框架将运行轨迹视为独立的文本文件,允许优化器模型探索目录并提取共性的失败模式。与基线 SkillOpt 框架相比,我们精简后的设计去除了微批次反思池、慢更新阻尼和历史拒绝缓冲区。
Refer to caption
(c) 提出的 HarnessOpt 流程。由于 SkillOpt-Lite 将所有产物抽象为平面文件,操作框架自然简化为可编辑的代码文件。因此,通过部署一个编码智能体作为核心优化器,最小化的技能流程原生地泛化成为一个全规模的框架优化框架。
图 3:优化流程的结构对比。

我们提出 SkillOpt-Lite,这是一个精简框架,旨在实现技能优化的最小可行流水线。如图 3 的结构对比所示,我们移除了复杂的批次级合并、基于文本的学习率调度以及历史拒绝编辑缓冲区。此外,我们弃用了轮次级慢更新机制——该机制此前需要在多个轮次间匹配和比较轨迹,以进行元技能反思。

取而代之的是,SkillOpt-Lite 通过自主调试循环直接在本地磁盘上运行。回滚批次被解耦,每条独立轨迹都作为单独文件存储,使系统能够利用原生文件系统工具来导航、读取和优化技能库。SkillOpt-Lite 的工作流程结构如下:

1. 轨迹暂存:

在冻结智能体框架的每次批次回滚之后,原始轨迹——包括规划推理过程、环境状态和任务得分——会直接以文本文件形式转储到磁盘上。如图 33(b) 所示,每条轨迹都作为独立的日志文件存储,而非聚合为结构化的迷你批次。

2. 轨迹探索:

系统并非将整个原始日志语料库加载到模型上下文窗口中,而是利用显式的文件系统工具来导航工作空间,这遵循了洞察 4 中概述的设计原则。在受限的 token 预算下运行,优化器模型执行自主 shell 命令来列出目录、聚类统一的任务失败类型,并选择高杠杆文件进行详细检查。

3. 共识挖掘与最小编辑:

具备文件读取能力后,优化器直接从目录中读取这些轨迹文件,以发现跨任务不变性和共享失败模式,从而实现洞察 2 的目标。一旦识别出这些模式,为了满足有界文本更新的信任区域约束,系统遵循最小更新原则,生成紧凑的代码差异或补丁来修复诊断出的错误。

4. 验证门控:

所提出的补丁被用于构建候选技能库,该库会立即在一个独立的验证集上进行评估,以获得无偏的经验分数,从而实现了洞察 3 的验证机制。如果候选技能相比当前基线分数有所提升,它就会被接受为活跃技能。如果它额外超过了历史最佳分数,它就会永久覆盖磁盘上的生产技能文件,该文件被命名为 best_skill.md。被拒绝的更新则被直接转入历史日志进行归档。

为了展示其实用性,我们将这一流程封装成了一个可用于生产的 VS Code 扩展。开发者可以通过一行斜杠命令,直接在其开发环境中触发完整的优化循环:

这种集成方式消除了多智能体平台常见的配置开销,提供了一个直接嵌入原生 IDE 环境中的交互式、轻量级调试工具。

实验

性能

我们的实验配置遵循 SkillOpt 中建立的评估协议,使用了 SearchQA [5]、Spreadsheet [12]、ALFWorld [22]、LiveMath [7]、DocVQA [13] 和 OfficeQA [18]。我们对 SkillOpt 和 SkillOpt-Lite 使用了相同的优化器模型,并部署了 GitHub Copilot 作为基线编码智能体。在原始数据集划分下,LiveMath 和 OfficeQA 仅包含 10 到 20 个验证实例,导致验证方差较高。为了缓解这种经验上的不稳定性,我们将这两个基准测试的训练-验证-测试划分比例从 调整为 。对于 OfficeQA,由于缺乏活跃的搜索工具 API,我们实现了一种离线评估变体。

媒体内容 · 前往原文查看
表 2:不同模型规模下的主要实验结果。下标表示与初始基线(初始技能)相比的相对性能对齐程度。粗体文本标明了每个模型块内的最佳性能。浅蓝色行突出显示了我们所提出的 SkillOpt-Lite 的性能。SkillOpt 执行(4 个周期,10 个批次),而 SkillOpt-Lite 严格在 10 个批次上进行评估。
模型 技能来源 SearchQA Spreadsheet ALFWorld LiveMath OfficeQA(离线) DocVQA
GPT-4o 初始技能 64.6 44.1 82.3 25.9 21.0 78.3
SkillOpt 70.1+5.5 48.7+4.6 95.3+13.0 31.2+5.3 30.2+9.2 85.2+6.9
SkillOpt-Lite 71.5+6.9 49.8+5.7 97.8+15.5 58.8+32.9 32.4+11.4 86.4+8.1
GPT-5.4-nano 初始技能 50.9 29.9 34.3 26.4 10.8 63.4
SkillOpt 68.8+17.9 51.6+21.7 71.8+37.5 30.3+3.9 18.4+7.6 80.4+17.0
SkillOpt-Lite 66.9+16.0 66.2+36.3 81.3+47.0 55.7+29.3 15.5+4.7 82.1+18.7
GPT-5.4-mini 初始技能 69.6 28.2 82.3 34.9 23.0 85.3
SkillOpt 72.3+2.7 47.5+19.3 100.0+17.7 41.2+6.3 32.1+9.1 90.9+5.6
SkillOpt-Lite 73.1+3.5 73.3+45.1 100.0+17.7 63.2+28.3 30.4+7.4 92.5+7.2
GPT-5.4 初始技能 68.3 39.9 88.1 46.2 29.7 87.7
SkillOpt 77.5+9.2 61.5+21.6 100.0+11.9 54.0+7.8 40.2+10.5 90.3+2.6
SkillOpt-Lite 76.3+8.0 79.4+39.5 100.0+11.9 66.0+19.8 45.3+15.6 91.2+3.5
GPT-5.5 初始技能 72.4 37.4 90.1 36.6 33.2 89.0
SkillOpt 78.8+6.4 76.2+38.8 100.0+9.9 64.8+28.2 72.2+39.0 91.2+2.2
SkillOpt-Lite 79.0+6.6 79.7+42.3 100.0+9.9 73.6+37.0 76.2+43.0 94.2+5.2

推理任务(LiveMath 与 Spreadsheet)上的显著提升——在需要复杂推理和确定性代码执行的任务上,SkillOpt-Lite 展现出实质性的性能提升。例如,在 LiveMath 上,与基线相比,GPT-4o 的绝对准确率从 31.2 提升至 58.8(+27.6 个百分点),GPT-5.5 从 36.6 提升至 73.6(+37.0 个百分点)。在 Spreadsheet 上,精简后的流程同样以明显优势超越了完整的 SkillOpt 框架(例如,在 GPT-5.4 上为 79.4 分对比 61.5 分)。

从机制上讲,这种差异的产生是因为基线框架依赖于小批量反思池化(mini-batch reflection pooling),该操作会对多个不同的文本更新进行平均,从而模糊了离散语言空间内的隐式梯度信号。通过消除这种平均化伪影,SkillOpt-Lite 使优化器模型能够发出局部的、离散的文件系统编辑指令,直接解决技能代码库中的逻辑和算法死锁问题。

语义密集型领域(SearchQA、ALFWorld 和 OfficeQA)的一致性边界——相反,对于以开放式文本检索或物理环境接地为主的任务,两种框架之间的性能差异微乎其微。在 SearchQA、ALFWorld 和 OfficeQA 上,SkillOpt-Lite 要么与基线框架持平,要么略胜一筹,波动幅度通常在一个百分点以内。这种行为源于这些基准测试的本质,它们要求广泛的语义覆盖,而非深度、多步骤的算法执行。

由于底层模型在这些浅层文本-动作领域内迅速饱和了可用的优化空间,两种变体都收敛到统计上相似的局部最优解。然而,关键在于,我们的精简版本在显著降低计算开销的情况下达到了这一上界,这表明对于浅层、语义密集型领域,复杂的优化基础设施在很大程度上是多余的。

收敛速度

为了评估所提出的最小化流水线的优化效率,我们分析了 SkillOpt 和 SkillOpt-Lite 的收敛轨迹。图 4 追踪了在代表性模型规模和基准测试下,10 个连续优化区间内的历史最佳验证分数。

经验轨迹凸显了我们精简框架的两个独特操作优势:

  • •

    加速的优化速度:与完整的 SkillOpt 框架相比,SkillOpt-Lite 展现出更陡峭的初始优化轨迹。例如,在 LiveMath-GPT-5.5 和 LiveMath-GPT-5.4-nano 等复杂领域,SkillOpt-Lite 在最初的 2 到 3 步内就获得了显著的性能提升。相比之下,基线 SkillOpt 框架在早期阶段表现出次优的轨迹,这是由小批量分区和缓慢的更新阻尼机制带来的结构性开销所导致的。

  • •

    卓越性能:移除多智能体拒绝缓冲区和反思池并不会导致策略过早收敛或演化失稳。相反,SkillOpt-Lite 在最终优化步骤中始终能达到持平或更高的性能上限。正如在 Spreadsheet-GPT-5.4-nano 和 DocVQA-GPT-5.4 中所观察到的,自主文件系统探索循环使优化器模型能够直接定位结构性代码缺陷,从而绕过局部次优状态,实现精准改进。

Refer to caption
图 4:SkillOpt(带圆圈的红色曲线)与 SkillOpt-Lite(带方块的蓝色曲线)在不同任务和模型规模下,经过 10 个优化步骤的收敛曲线对比。纵轴表示迄今为止达到的最佳验证性能。

迈向 Harness 优化

HarnessOpt 流水线

扩展我们框架的主要动机出现在智能体技能优化接近经验性性能饱和上限时。一旦声明式文本提示词和启发式规则得到最优调优,进一步的优化收益必须通过修改命令式控制流和工具执行脚手架来实现,这被称为 Harness 优化 [15, 8, 29, 19]。由于 SkillOpt-Lite 的核心哲学基础是将所有智能体工件仅视为标准文件系统实体,因此这一最小化流水线可以原生扩展,以修改运行时代码库脚本。我们将这个完全扩展后的统一框架命名为 HarnessOpt。通过将工作区目录内的文件路径限制从单个技能 markdown 文件提升至更广范围,优化器模型利用相同的三支柱架构直接改进智能体的执行例程。该流水线的示意图如图 3(c) 所示。

第零轮引导启动与人在回路把关——在框架优化中,初始基线框架(即第零轮框架)的结构完整性至关重要。若缺乏稳定的初始接口而盲目修改原始控制逻辑,可能立即引发语法崩溃或工具依赖断裂。为应对这一风险,我们在第零步实施结构化的引导启动阶段。框架首先在种子框架下对所有训练实例执行完整展开,以聚合原始系统执行轨迹与异常日志。随后,一个专门的诊断性子智能体扫描这些日志目录,进行共识挖掘。其目标是隔离跨任务架构缺陷,而非直接编写代码修改,具体识别诸如缺失工具原语或系统性 API 解析不匹配等问题。该子智能体将这些诊断见解整合为结构化的配置提案。该提案通过五个关键维度进行评估——工具清单、提示词上下文、循环策略、代码生成形态与状态记忆——最终就记忆集成、工具增强及控制流形态做出三项明确决策。提案以 VS Code 环境中的交互式提示词形式呈现,在核心代码库进行任何结构性变更前,需获得用户的明确批准。

自动化持续演进与沙盒化把关——第零轮框架获批后,HarnessOpt 进入完全自动化的闭环持续演进阶段,在此阶段绕过用户干预。在后续轮次中,框架放宽文件权限,允许底层模型自主部署标准 shell 工具来检查执行状态,并对框架脚本应用针对性代码补丁。关键在于,由于修改可执行控制流本身存在引入无限循环或回归缺陷的风险,因此通过三个关键的循环不变量实施严格的验证与安全护栏:

  • •

    允许列表约束:修改被严格限定在框架脚手架脚本范围内,而任务特定技能和内部配置则被视为只读的拒绝列表,以防止漂移。

  • •

    冒烟与验证门控:验证门控在隔离的子进程沙箱中严格执行。候选测试框架必须先通过编译检查和早期冒烟测试,然后才能运行完整的验证集,以衡量实际性能提升。

  • •

    带开关的可逆演化:所有代码编辑均可通过 git reset 回滚完全撤销,重大修改则封装在环境变量功能开关之后(在模块导入时初始化),以确保清晰的二分定位和未来的消融控制。

验证门控根据历史最佳配置衡量最终准确率分数。根据样本数量建立一个统计死区,以过滤随机方差。低于此死区的改进补丁,只有在连续次要软指标上展现出非平凡进展时才会被接受;否则,状态将被回滚,以防止代码库因无功能产物而膨胀。

为了将此能力无缝集成到开发者工作流中,我们将测试框架优化管线作为生产级斜杠命令暴露在我们的环境中。开发者可以通过提供目标迭代轮数、训练展开的批次大小、目标基础模型以及参考技能文件来启动持续演化循环。典型的调用格式如下:

测试框架优化的实验评估

在我们的初步实验中,我们观察到,在技能优化基准测试所使用的六个数据集中,对于大多数数据集而言,现有基础设施已经足够,或者工具链优化带来的变化微乎其微。因此,我们将评估重点放在 SpreadsheetBench 上,将其作为一个具有代表性且具有挑战性的案例研究,以分析 HarnessOpt 的有效性。我们针对四种不同能力的大语言模型进行了评估:GPT5.4-nano、GPT5.4-mini、GPT5.4 和 GPT5.5。详细结果如表 3 所示,该表对应 image_0d4db6.png 中的实验数据。

媒体内容 · 前往原文查看
表 3:在不同大语言模型基线上对 SpreadsheetBench 的优化结果。
方法 GPT5.4-nano GPT5.4-mini GPT5.4 GPT5.5
初始技能 0.2989 0.2821 0.3986 0.3737
SkillOpt 0.5160 0.4750 0.6150 0.7620
SkillOpt-Lite 0.6619 0.7331 0.7936 0.7972
不含技能的 HarnessOpt 0.7651 0.8114 0.8363 0.8363
含技能的 HarnessOpt 0.7758 0.8256 0.8505 0.8577

模型行为变化分析——通过应用 HarnessOpt,我们识别出不同模型层级各自存在的操作瓶颈,并通过针对性的工具链修改加以修复:

  • •

    GPT5.4-mini 和 GPT5.4:对于这两个模型,基线性能主要受限于对数据文件的观察不足以及最终答案验证薄弱。HarnessOpt 通过扩大电子表格预览的可视范围,并引入一个专门步骤让智能体反思其最终输出来解决这一问题。这成功减少了解析和格式错误。

  • •

    GPT5.5 和 GPT5.4-nano:相比之下,这两个模型经常遇到这样的情况:当工具执行失败时,它们的推理链会陷入重复循环。为了打破这种僵局,HarnessOpt 自动拦截这些重复状态,并应用一个回退策略(重试推理=低),使模型能够恢复并完成任务。

联合优化的重要性——如表3所示,仅优化框架代码库(HarnessOpt w.o. skill)就能显著提升纯提示词优化(SkillOpt-Lite)的性能,将GPT5.4-nano从提升至,将GPT5.5提升至。值得注意的是,在框架优化下,轻量级GPT5.4-nano达到了(HarnessOpt w. skill),超越了在基础框架下运行并采用完整提示词优化的更大模型GPT5.5(SkillOpt,结果为)。这种能力反转表明,优化环境脚手架可以使较小的模型在次优环境中超越前沿级模型。关键在于,只有当两个组件同时优化时(HarnessOpt w. skill),才能获得最佳整体结果,GPT5.4达到,GPT5.5达到。这表明,技能提供战略指导,而框架确保可靠的执行环境;实际性能依赖于两者的协同设计。

结论与未来工作

结论

在本报告中,我们通过零阶优化和统计学习理论的视角,对智能体技能训练进行了形式化定义。我们证明,随着基础模型规模的扩大,复杂的多智能体池化和文本更新阻尼机制在很大程度上是多余的。受“万物皆文件”理念的启发,我们提出了SkillOpt-Lite,这是一个最小可行管线,它将运行轨迹视为独立的平面文件,并利用自主编码智能体进行有针对性的、语义驱动的调试。实验表明,SkillOpt-Lite加速了优化收敛,并在多个基准测试中持续达到或超越高度工程化的基线方法。最后,我们将这一工作流封装为原生IDE扩展,证明了以文件为中心的技能编辑可以自然地泛化到完整的框架优化HarnessOpt。

未来工作

为实现完全自主的智能体自我进化,我们为未来研究勾勒出四个实际方向:

  • •

    前沿模型知识蒸馏的技能优化:虽然将专有前沿模型蒸馏为开源权重等价物是标准的行业实践,但主动的反蒸馏防御机制和次优生成边界常常阻碍数据质量。利用技能优化来细化教师智能体在细粒度能力上的表现,为生成高质量蒸馏语料库提供了结构化框架。然而,由于这种范式将数据集生成与下游架构的主动优化耦合在一起,设计快速且计算高效的评估协议用于数据选择仍是一项关键挑战。

  • •

    利用模板数据库实现自动化优化:虽然这项工作探索了执行框架的基本程序化修改,但扩展框架优化需要一个稳健的参考框架。开发一个精心策划的最小化框架模板库,对于为编码智能体提供有效的结构先验至关重要。此外,异构框架需要自适应沙箱机制来确保安全交互。虽然当前最先进的智能体(例如 Claude Code [3])为本地软件工程环境提供了有效的安全协议,但将这些隔离机制扩展到互联网增强或多模态执行的领域仍未得到解决。

  • •

    作为持续学习的框架进化:鉴于持续微调基础权重的高计算开销,直接在非参数层上操作——具体来说,将执行框架和领域技能视为进化的参数——为终身学习提供了一种有前景的替代方案 [25]。该框架下的一个主要挑战在于,在长时间跨度内,对独立进化的框架谱系进行结构对齐与融合。这项研究的一个直接延伸方向是开发个性化智能体,其中框架架构持续适应以匹配长期的人类偏好和惯用的开发者工作流程。

  • •

    将优化扩展到基础模型训练:虽然在我们当前的框架中,基础模型保持冻结状态,但这个优化流程可以自然地扩展到模型训练阶段本身。在我们的理念中,由于数据集合作为标准文件进行管理,基础模型代表了这些文件的一种内在编译。通过使用我们相同的三支柱架构,该框架可以建立一个全面的基准来压力测试模型边界,自动编辑网络爬虫控制器或数据蒸馏提示词以收集目标样本,并利用这些数据来训练一个迭代优化的模型。这将优化边界从脚本转移到模型参数,实现了完全的智能体自我进化。有趣的是,我们已经率先尝试了这种方法的半自动化版本,例如在我们内部多模态生成和理解模型的预训练过程中动态缩放图文对,以及在我们开发 LLaVA-OneVision-2 [1] 期间策划特定的视频训练数据(尽管这些结构实现细节在主体论文中未被强调)。完全自动化这种数据-模型-测试框架协同设计循环,无需人工干预,仍然是关键的下一个步骤。

参考文献

  • [1] X. An, Y. Xie, F. Tang, Y. Yan, H. Tan, D. Zhu, C. Chen, X. Zhao, B. Qin, K. Yang, 等. (2026) LLaVA-onevision-2: 迈向下一代感知智能. arXiv 预印本 arXiv:2605.25979. 被引用于:第 4 项。
  • [2] Anthropic (2025) Claude Code: 一个智能体命令行工具. 注:https://docs.anthropic.com/en/docs/agents-and-tools/claude-code/overview 访问日期:2026-06-24 被引用于:§1.
  • [3] Anthropic (2026) Claude Code 源代码. 注:https://github.com/codeaashu/claude-code 被引用于:§1, 第 2 项.
  • [4] K. Chen, Q. Zhong, J. Liu, 和 B. Du (2026) SkillCAT: 用于大语言模型智能体的对比评估与拓扑感知技能自我进化. arXiv 预印本 arXiv:2606.13317. 被引用于:§1, §1, 第 1 项, §2.2.
  • [5] M. Dunn, L. Sagun, M. Higgins, V. U. Guney, V. Cirik, 和 K. Cho (2017) SearchQA: 一个由搜索引擎上下文增强的新问答数据集. arXiv 预印本 arXiv:1704.05179. 被引用于:§4.1.
  • [6] GitHub (2021) GitHub Copilot。注:https://github.com/features/copilot 访问日期:2026 被引用于:§3.1。
  • [7] L. He, Q. Yu, H. Dong, B. Liao, X. Xu, M. Goldblum, J. Bian, and N. Mesgarani (2026) LiveMathematicianBench:一个用于数学家级别推理与证明草稿的实时基准。arXiv 预印本 arXiv:2604.01754。被引用于:§3.1, §4.1。
  • [8] Y. Lee, R. Nair, Q. Zhang, K. Lee, O. Khattab, and C. Finn (2026) Meta-harness:模型 harness 的端到端优化。arXiv 预印本 arXiv:2603.28052。被引用于:§1, §5.1。
  • [9] J. Lin, S. Liu, C. Pan, L. Lin, S. Dou, Z. Xi, X. Huang, H. Yan, Z. Han, T. Gui, et al. (2026) 智能体 harness 工程:基于可观测性的编程智能体 harness 自动演化。arXiv 预印本 arXiv:2604.25850。被引用于:§1。
  • [10] S. Liu, P. Chen, B. Kailkhura, G. Zhang, A. O. Hero III, and P. K. Varshney (2020) 信号处理与机器学习中零阶优化入门:原理、最新进展与应用。IEEE 信号处理杂志 37 (5), 第 43–54 页。被引用于:§2.1.1。
  • [11] X. Liu, X. Luo, L. Li, G. Huang, J. Liu, and H. Qiao (2026) Skillforge:在云技术支持中锻造领域特定、自我演化的智能体技能。arXiv 预印本 arXiv:2604.08618。被引用于:§1, §1, 第 3 项, 第 2 项, §2.1.1, §2.2。
  • [12] Z. Ma, B. Zhang, J. Zhang, J. Yu, X. Zhang, X. Zhang, S. Luo, X. Wang, and J. Tang (2024) Spreadsheetbench:面向具有挑战性的真实世界电子表格操作。神经信息处理系统进展 37, 第 94871–94908 页。被引用于:§3.1, §4.1。
  • [13] M. Mathew, D. Karatzas, and C. Jawahar (2021) Docvqa:一个用于文档图像视觉问答的数据集。载于 IEEE/CVF 冬季计算机视觉应用会议论文集,第 2200–2209 页。被引用于:§3.1, §4.1。
  • [14] J. Ni, Y. Liu, X. Liu, Y. Sun, M. Zhou, P. Cheng, D. Wang, E. Zhao, X. Jiang, and G. Jiang (2026) Trace2skill:将轨迹局部经验提炼为可迁移的智能体技能。arXiv 预印本 arXiv:2603.25158。被引用于:§1, §1, 第 1 项, §2.1.1, §2.2, §2.2。
  • [15] X. Ning, K. Tieu, D. Fu, T. Wei, Z. Li, Y. Bei, J. Zou, M. Ai, Z. Liu, T. Li, et al. (2026) 代码即智能体 harness。arXiv 预印本 arXiv:2605.18747。被引用于:§5.1。
  • [16] Nous Research (2026) Hermes agent。注:https://nousresearch.com/hermes3/ 高级智能体与函数调用基础模型 引用自:§1。
  • [17] OpenClaw 贡献者 (2025) OpenClaw:一个开源智能体命令行助手。注:https://github.com/openclaw/openclaw GitHub 仓库 引用自:§1。
  • [18] K. Opsahl-Ong, A. Singhvi, J. Collins, I. Zhou, C. Wang, A. Baheti, O. Oertell, J. Portes, S. Havens, E. Elsen, 等 (2026) Officeqa pro:面向端到端有据推理的企业级基准。arXiv 预印本 arXiv:2603.08655。引用自:§4.1。
  • [19] H. Self-Evolution (2026) 利用更新不等于能力提升:解耦自进化大语言模型智能体中的进化能力。引用自:§5.1。
  • [20] S. Shalev-Shwartz, O. Shamir, N. Srebro, 和 K. Sridharan (2010) Vapnik-Chervonenkis 意义上的可学习性与稳定性。《统计年鉴》38 (5), 第 2642–2696 页。引用自:§2.2。
  • [21] N. Shinn, F. Cassano, A. Gopinath, K. Narasimhan, 和 S. Yao (2023) Reflexion:具备语言强化学习的语言智能体。《神经信息处理系统进展》36, 第 8634–8652 页。引用自:§1, §1, 第1项, §2.1.1, §2.2。
  • [22] M. Shridhar, X. Yuan, M. Côté, Y. Bisk, A. Trischler, 和 M. Hausknecht (2020) Alfworld:为交互式学习对齐文本与具身环境。arXiv 预印本 arXiv:2010.03768。引用自:§3.1, §4.1。
  • [23] X. Tao, Y. Teng, X. Fu, Z. Liu, K. Chen, Y. Zhao, S. Zhang, R. Liu, 和 L. Kong (2026) SoftSkill:面向情境适应的行为压缩。arXiv 预印本 arXiv:2606.20333。引用自:第3项。
  • [24] G. Wang, Y. Xie, Y. Jiang, A. Mandlekar, C. Xiao, Y. Zhu, L. Fan, 和 A. Anandkumar (2023) Voyager:一个基于大语言模型的开放式具身智能体。arXiv 预印本 arXiv:2305.16291。引用自:§1, §1, 第2项, §2.1.1。
  • [25] J. Weng (2026-05) 超越梯度的学习。注:https://trinkle23897.github.io/learning-beyond-gradients/ 访问日期:2026-06-30 引用自:第3项。
  • [26] J. Yang, C. Jimenez, A. Wettig, K. Lieret, S. Yao, K. Narasimhan, 和 O. Press (2024) Swe-agent:智能体-计算机接口实现自动化软件工程。《神经信息处理系统进展》37,第50528–50652页。引用于:§1。
  • [27] Y. Yang, Z. Gong, W. Huang, Q. Yang, Z. Zhou, Z. Huang, Y. Li, X. Gao, Q. Dai, B. Liu, 等 (2026) Skillopt:面向自演化智能体技能的执行策略。arXiv预印本 arXiv:2605.23904。引用于:§1, §1, §1, 第2项, 第1项, 第1项, §2.1.1, §2.2, 3(a), 3(a)。
  • [28] Z. Yu, X. Xie, W. Yao, C. Wang, L. Liang, X. Qi, 和 S. Deng (2026) SkillAdaptor:面向大语言模型智能体从轨迹中自适应技能的机制。arXiv预印本 arXiv:2606.01311。引用于:§1, §1, 第1项, §2.2。
  • [29] H. Zhang, S. Zhang, K. Li, C. Zhang, Y. Chen, Y. Zhang, L. Bai, 和 S. Hu (2026) Self-harness:能够自我改进的约束机制。arXiv预印本 arXiv:2606.09498。引用于:§5.1。
  • [30] T. Zhang (2023) 机器学习算法的数学分析。剑桥大学出版社。外部链接:文献。引用于:§2.2。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org