微软开源 Orchard 框架:30亿参数小模型在 SWE-bench 达 73%
Orchard: An open framework for scalable agentic AI
微软研究院发布开源框架 Orchard,旨在解决智能体(Agent)研究中的基础设施瓶颈。核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持在 Codex、OpenClaw 等真实部署环境中直接训练和评估智能体。项目发布了针对软件工程、网页导航和个人助手的三个训练配方及数据。其中,仅约 30 亿活跃参数的 Orchard-SWE 模型在 SWE-bench Verified 基准上达到 69.7%(结合价值模型重排序可达 73.0%),性能接近参数量大 10 倍的前沿系统,展示了小模型在复杂现实任务中的潜力。
微软开源了完整的智能体训练与评估基础设施,并证明了小参数模型通过特定训练策略可在高难度代码修复基准上逼近前沿大模型,对降低 Agent 研发门槛有重要参考价值。

概览
- Orchard 是一个开源框架,用于可扩展且高性价比的智能体 AI 研究,围绕 Orchard Env 构建,这是一个可复用的环境服务,用于跨任务领域训练和评估智能体。
- 同一套 Orchard 基础设施支持软件工程、网页导航和个人助理智能体,并可直接在 Codex、OpenClaw 和 ZeroClaw 等真实部署框架内训练它们——让研究人员能够跨任务复用环境、数据管道和评估工作流。
- Orchard-SWE、Orchard-GUI 和 Orchard-Claw 表明,相对较小的开放权重模型也能在复杂的真实世界任务上取得出色结果。例如,Orchard-SWE 在 SWE-bench Verified 上达到 69.7%——使用价值模型重排序后达到 73.0%——仅使用约 30 亿活跃参数,接近使用超过 10 倍规模模型的前沿系统。
除了模型和工作流,该项目还发布了训练数据和评估方法,旨在帮助更广泛的研究社区构建和研究开放智能体系统。 人工智能正迅速超越静态问答,转向能够在复杂、多步骤环境中规划、推理和行动的自主智能体。这些系统可以修复复杂代码库中的错误、代表用户浏览网页,以及管理涉及日历和电子邮件的工作流。
尽管人们对智能体 AI 的能力感到兴奋,但研究社区面临着一个持续存在的瓶颈。构建最先进的智能体系统通常需要专有基础设施,包括定制沙箱、封闭的训练管道和专有数据集,而大多数研究人员和从业者无法访问或复现这些资源。
为弥补这一差距,我们推出了 Orchard(在新标签页中打开),一个用于可扩展智能体建模的开源框架。Orchard 的核心是 Orchard Env,一个轻量级的 Kubernetes 环境,提供可复用的隔离组件,用于大规模运行和构建智能体——从收集训练数据到强化学习 rollout 和评估。
与许多现有框架不同,Orchard Env 的设计无需修改即可支持不同的智能体系统和任务类型。同一服务可以跨领域支持软件工程智能体、网页浏览智能体和私人助理智能体。
为展示这一方法,我们发布了三个领域特定的训练配方——Orchard-SWE、Orchard-GUI 和 Orchard-Claw。(在新标签页中打开)我们还发布了用于构建它们的训练数据和评估方法。
可跨任务类型扩展的环境层
Orchard 背后的核心思想是,运行时环境应当是一个独立、可复用的服务,而不是嵌入在特定训练框架内部的基础设施。Orchard Env 的 Kubernetes 基础使其能够并行创建、管理和移除数千个隔离组件。
该系统旨在跨编码、网页浏览、使用工具等任务工作。它还旨在跨不同的智能体系统,以及训练和评估过程的各个阶段工作,包括数据蒸馏和强化学习 rollout。
这种灵活性使 Orchard 在研究规模上具备实用性。团队可以引入新的基准、智能体系统或训练算法,而无需从头重建底层基础设施。
Orchard 还使得在任何 harness 中训练智能体成为可能。如今最强大的智能体很少以裸模型的形式运行。它们通过复杂的 harness——例如 Claude Code、Codex 和 OpenClaw——来运行,这些 harness 负责管理多轮推理、工具使用以及与外部系统的连接。开放训练工具通常无法处理这些有状态、多进程的 harness,迫使研究人员在简化的替代环境中进行训练,然后再部署到真实环境中,这造成了不匹配。Orchard 弥合了这一差距:一个轻量级代理将 harness 自身的模型调用记录为训练数据,同时每次 rollout 都在各自的容器中运行,因此智能体可以直接在它将部署使用的 harness 中——OpenClaw、Codex、ZeroClaw 或其他——进行端到端训练,并可跨多个 harness 进行训练。
Orchard-SWE:推进开源软件工程智能体
软件工程是自主智能体最具挑战性的场景之一。它需要对真实代码库进行多步推理、使用工具,以及从错误中恢复的能力。Orchard-SWE 是我们针对这一领域的训练工作流。它基于 Mini-SWE-Agent 框架构建,旨在自主解决软件工程任务,并在广泛使用的 SWE-bench Verified 基准上进行评估,该基准测试模型导航、诊断和修复真实世界代码库的能力。
为了训练该系统,我们从两个先进的开源权重模型(MiniMax-M2.5 和 Qwen3.5-397B)中蒸馏了 107,000 条智能体交互,覆盖了广泛的 GitHub Issues。训练过程采用信用分配监督微调:系统不会丢弃智能体未能完全解决问题的尝试,而是从这些部分尝试中有成效的部分进行学习,从而扩大了模型可用的有用训练数据量。
接下来是强化学习,但其反馈是稀疏的——智能体通常只能得知其最终补丁是否通过了隐藏测试。我们首先采用 Balanced Adaptive Rollout,旨在充分利用这些不频繁的成功信号,然后添加两种“密集奖励”技术以提供更丰富的指导:同策略蒸馏,即一个更强的教师模型逐步对智能体的决策进行评分;以及过程奖励模型,即一个 AI 评判者奖励合理的解题过程——编写能复现 bug 的测试、验证修复、检查现有行为是否仍然正常——而不依赖于最终测试是否通过。
最后,我们在过去的 rollout 上训练一个价值模型,用于对候选解决方案进行重排序。强化学习会生成许多通常被丢弃的练习轨迹;相反,来自 20 次先前实验的轨迹训练了一个紧凑的 40 亿参数价值模型,用于识别高质量解决方案,在解题时它对多个候选答案进行评分并选出最佳的一个。这些技术共同将 Orchard-SWE 在 SWE-bench Verified 上的表现从 61.4% 的基线提升至使用 Balanced Adaptive Rollout 的 69.1%,以及使用密集奖励技术的 69.7%——在同等规模(约 30 亿活跃参数)的开源模型中达到了新的最先进水平——在使用价值模型重排序后升至 73%,接近规模大 10 倍以上的前沿系统,如图 1 所示。
Orchard-GUI:面向真实网页任务的轻量级浏览器智能体
网页导航带来了一系列不同的挑战。智能体必须理解视觉布局、与动态界面交互,并完成仅用自然语言描述的开放式任务。
Orchard-GUI 使用相对较少的监督数据,将一个 40 亿参数的视觉语言模型训练为浏览器智能体:400 条蒸馏演示,结合 2,200 个开放式训练任务。尽管训练数据有限,所得模型在多个网页导航基准测试上仍取得了强劲结果:WebVoyager 上 74.1%,Online-Mind2Web 上 67.0%,DeepShop 上 64.0%,平均 68.4%,如图 1 所示。

这些结果使 Orchard-GUI 跻身迄今最强的开源网页智能体之列,同时与更大的专有模型保持竞争力。结果还表明,凭借合适的训练方法和环境,小型开放模型可以在真实网页任务上表现出色。
Orchard-Claw:面向日常生产力的个人助理智能体
许多最具影响力的智能体应用都涉及日常生产力任务,包括阅读和起草电子邮件、管理日历、搜索信息以及跨工具协调。Orchard-Claw 专注于个人助理任务,仅用 200 个合成任务训练智能体。在 Claw-Eval(一个覆盖真实生产力工作流的基准测试)上评估时,它在最多三次尝试内成功完成 59.6% 的任务。当与更强的 ZeroClaw 智能体系统配合时,这一比例提升至 73.9%。
由于 Orchard 可以直接在真实部署框架内训练智能体,Orchard-Claw 在多个框架中进行训练——包括 ReACT、ZeroClaw、OpenClaw 和 Codex——而不是单一的简化循环。在这些真实框架内训练显著提升了智能体的可靠性;例如,在 Codex 框架下,其成功率从未训练模型的 18.6% 提升到经过 Orchard 训练后的 51.5%。

意义与未来方向
Orchard 的结果强化了一个更广泛的观点:环境层至关重要。通过使底层基础设施开放、轻量且可复用,Orchard 降低了智能体 AI 研究的成本。团队不再需要从零构建定制的隔离环境,也不再依赖专有云服务。同一个 Orchard Env 可用于生成训练数据、运行强化学习 rollout 以及评估最终模型,而无需每次都重建系统。
展望未来,我们认为复用训练经验是通向累积式智能体学习的一个有前景的方向。与其在训练运行结束后丢弃轨迹,我们将其视为持久资产——例如,将其蒸馏为可复用的价值模型。这使得智能体经验能够随时间积累,让每一代新的智能体都能继承并扩展前代所获得的知识,而不是从零开始。
Orchard-GUI 所展现的数据效率表明,更大规模的网页智能体可以在无需大量人工创建训练数据的情况下进行训练。 通过发布完整的 Orchard 技术栈,包括环境服务、训练流水线和训练数据集,我们希望帮助更广泛的研究社区更快地构建能力更强的开放智能体。
致谢
我们感谢 Microsoft Research 及合作机构的团队对 Orchard 的贡献,也感谢开源社区,其基准和工具使这项研究成为可能。
在新标签页中打开
文章 Orchard: An open framework for scalable agentic AI 首次发表于 Microsoft Research。
来源:Microsoft Research 博客(RSS) · microsoft.com