跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 2026-08-06精选AI 评分70

Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

Microsoft’s SkillOpt Shows Optimized Agent Skill Artifacts Transfer Across Model Scales and Between Codex and Claude Code Harnesses

AI 导读

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。

推荐理由

跨 harness 迁移实验把 agent 技能从单环境优化推进到可复用文本技能文件,Codex 练出的技能在 Claude Code 上超过域内训练结果,对维持多工具一致行为提供直接实证。

正文 · AI 翻译

SkillOpt 是由来自 Microsoft、上海交通大学、同济大学和复旦大学的研究团队开发的一款文本空间优化器。

SkillOpt 训练单个自然语言技能文档,而目标模型保持冻结。一个优化器模型读取带评分的 rollout,并提出有界的添加/删除/替换编辑。一个留出的选择集仅在分数严格提升时才接受编辑。导出的产物是一个文件,best_skill.md。

迁移表格报告三列。Baseline 是目标模型的无技能得分。Direct 是在该确切目标上进行域内训练的 SkillOpt。Transferred 应用在其他地方训练的技能,且不再进行进一步优化。

有用的比较不是迁移与直接之间的比较,而是域内增益在迁移后有多少得以保留。

跨模型迁移:同族内,保留情况参差不齐

技能在 GPT-5.4 上训练,并部署到更小的变体上。

SpreadsheetBenchGPT-5.4-mini36.147.545.5+9.482%
SpreadsheetBenchGPT-5.4-nano23.542.526.5+3.016%
LiveMathGPT-5.4-mini14.732.819.2+4.525%
LiveMathGPT-5.4-nano23.227.228.8+5.6140%

有两行值得关注。GPT-5.4-mini 上的 SpreadsheetBench 保留了 82% 的域内增益。这几乎相当于免费复用。GPT-5.4-nano 上的 LiveMath 一行则更为奇特:迁移后的技能得分为 28.8,而域内 SkillOpt 结果为 27.2。论文将此解读为某些习得流程与目标模型无关的证据。

GPT-5.4-nano 的 SpreadsheetBench 一行是最弱的,仅为 16%。保留率并不一致,论文也未声称其一致。其所述界限更为狭窄:没有任何一行低于目标的无技能基线。

注意范围。所有四行都保持在同一个 GPT 系列内。跨系列迁移,例如 GPT 到 Qwen,并未测试。

跨 harness 迁移:最强结果

这是对部署最为关键的一节。所有行均使用 GPT-5.5。

基准源 → 目标基线直接迁移后收益域内收益占比
SpreadsheetBenchCodex → Claude Code22.180.481.8+59.7102%
SpreadsheetBenchClaude Code → Codex27.585.071.1+43.676%
LiveMathClaude Code → Codex35.278.448.0+12.830%
LiveMathCodex → Claude Code40.856.542.4+1.610%

第一行是头条结果。一个在 Codex 内部优化过的技能,将 Claude Code 从 22.1 提升到了 81.8。这略微超过了 Claude Code 从零开始训练自身技能所达到的 80.4。

这两个运行框架暴露了不同的工具与文件 API,以及不同的命令接口。一个能在这种切换中存活的技能,并不是在编码命令配方。研究论文将 SpreadsheetBench 的可移植性归因于工作簿级别的流程:结构优先的检查、公式感知的验证,以及静态值物化。无论由哪个 CLI 运行 Python,这些流程都成立。

LiveMath 则讲述了相反的故事。Codex → Claude Code 仅保留了 10% 的域内增益。这种不对称值得深思。程序性技能——如何检查、验证和格式化——似乎属于可移植的那一类。而推理密集型的技能,似乎与其训练环境的绑定更为紧密。

跨基准迁移:真实存在但幅度很小

源 → 目标模型基线迁移后增益
OlympiadBench → Omni-MATHGPT-5.456.660.3+3.7
OlympiadBench → Omni-MATHGPT-5.4-mini34.836.6+1.8
OlympiadBench → Omni-MATHGPT-5.4-nano38.840.1+1.3

这里没有 Direct 列。没有报告在 Omni-MATH 上运行域内 SkillOpt 的结果,因此对比仅针对无技能的情况。三个模型规模上的增益均为正,但幅度很小。研究论文的解读是:在测试实例和答案格式约定都发生变化之后,该技能仍保留了可复用的数学解题流程。

该产物为何仍能迁移

研究论文中明确阐述了其机制。三种执行模式:直接对话、Codex、Claude Code——都消费同一种 best_skill.md 文件格式。正是这一共享契约,才使得跨 harness 实验从一开始就成为可能。

Codex harness 将当前技能渲染为与任务文件并列的每任务 SKILL.md,然后读回一份紧凑的执行轨迹。Claude Code harness 通过 claude CLI 镜像了相同的工作区契约。两个 harness 都没有获得专属的技能格式。

该产物的形态也支持可移植性。最终技能在六个基准上运行消耗 379 到 1,995 个 token,中位数接近 920。它们由 1 到 4 个被接受的编辑组装而成。论文的图 4 为每个基准抽取了一条学到的规则作为示例,所有规则都是流程性的,而非针对具体实例。SpreadsheetBench 的规则原文如下:检查工作簿结构和公式,然后在完整的请求目标范围内写入求值后的静态值,而不是依赖 Excel 重新计算。

这对可移植性意味着什么

训练成本只需支付一次,离线进行,并且是可衡量的。该研究论文报告称,每个绝对测试点需要 0.6M 到 46.4M 个训练 token,具体取决于基准测试。SpreadsheetBench 为每个点 0.6M;DocVQA 为 46.4M。优化器模型仅在训练期间运行,在部署时不增加任何推理时调用。

如果在一个 harness 中训练出的技能在另一个中依然有效,那么这笔一次性成本就会分摊到多个环境中。Codex → Claude Code 的 SpreadsheetBench 结果就是存在性证明。它还意味着你可以在工具链成本最低的地方进行优化,并在产品实际运行的地方进行部署。

审计角度是另一个独立且被低估的方面。部署的产物是一个文本文件,领域从业者可以在几分钟内读完。对其的每一次更改都是可追溯的:每一步都记录一个 edit_apply_report.json,并带有每次编辑的接受和跳过状态。可移植性加上可检查性,是一种与交付微调权重不同的运营姿态。

核心要点

  • 证据覆盖一个 GPT 系列和每个维度两个基准,因此可移植性得到了验证,但尚未推广。
  • 一个经 Codex 训练的 SpreadsheetBench 技能在 Claude Code 中得分 81.8,高于该框架自身在域内的 80.4 结果。
  • 全部 4 行跨模型、4 行跨框架和 3 行跨基准迁移结果均高于目标的无技能基线。
  • 迁移强度与任务类型相关:程序性电子表格技能迁移效果好,数学推理技能迁移效果弱。
  • 可移植单元是一个由 379 到 1,995 个 token 组成的 best_skill.md,由 1 到 4 个被接受的编辑构建而成。

资源: 论文、GitHub、项目页面、文档、PyPI 和 演示视频

参考基线: GEPA、TextGrad、EvoSkill 和 Trace2Skill

参考基准: SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench 和 ALFWorld

来源:MarkTechPost(RSS) · marktechpost.com