Agents-A1:35B MoE 智能体模型通过扩展 horizon 达到万亿参数级性能
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
研究人员提出 Agents-A1,一个 35B 参数的 Mixture-of-Experts 智能体模型,通过扩展智能体 horizon(长轨迹与异构能力两个视角)达到万亿参数模型性能。团队构建了长 horizon 知识-行动基础设施,生成平均 45K token 的智能体轨迹,并采用三阶段训练:全领域监督微调、领域级教师模型训练、多教师领域路由在线蒸馏(含显著词汇对齐)。对比万亿参数模型 Kimi-K2.6 和 DeepSeek-V4-pro,Agents-A1 在 SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和 MolBench-Bind(56.8)上领先,并在 SciCode(44.3)、HLE(47.6)和 BrowseComp(75.5)上保持强竞争力。
用35B模型追平1T参数模型,这条“扩展智能体视野”的路比无脑堆参数务实得多,做Agent和长程推理的团队必须认真读。
[180pt]imgs/logo_lab.png \setrightlogo[180pt]
1 引言
大语言模型的最新进展正迅速将人工智能从被动的语言模型推向能够规划、使用工具、与环境交互并通过反馈不断改进的自主智能体。在软件工程、科学研究以及复杂决策等现实场景中,智能体必须在长周期内运作:它们需要获取信息、分解任务、调用工具、验证中间结果,并持续调整策略。这种长周期场景尤其具有挑战性,因为早期的错误可能会累积,而随着新的外部信息出现,策略往往也需要修正。
现有改进长周期智能体的工作大致遵循两条扩展路线。一条路线扩展参数规模:前沿模型通常依赖扩大模型参数,以内化广泛的推理模式、工具使用行为模式和领域知识。这条路线虽然有效,但在没有同等模型规模、数据和训练资源的情况下,很难复现相同的智能体能力。另一条路线则扩展周期长度而非扩大参数规模,这使得中间决策过程变得显式,将知识获取、动作执行、观察解读和验证转化为可训练的监督信号。然而,这条路线也暴露了两个关键瓶颈。
关键瓶颈在于支持长程轨迹规模化所需的知识基础设施。长程轨迹训练需要构建一个统一环境,将外部知识、智能体动作、观测结果与验证信号相连接,使模型能够从基于真实环境的反馈中学习,而非仅依赖孤立的文本监督。若缺乏这种知识-工具交互基础设施,智能体几乎无法在现实场景中掌握以下能力:规划长程轨迹、恰当调用工具、验证证据、整合反馈信息,以及从失败中恢复。
除基础设施外,扩展轨迹长度还需整合跨领域的异构组合能力。这些能力包括多步信息检索、工具使用、可执行迭代、约束追踪与结果反思。它们往往在不同领域间不均衡涌现,并以复杂方式相互影响。因此,将高度差异化的专业能力有效整合至统一智能体模型极具挑战性。
本研究提出 Agents-A1——一款 35B 参数的 MoE 智能体模型,旨在解决上述关键挑战。为支撑智能体模型训练,我们构建了知识-动作基础设施,该设施连接外部知识、中间动作、观测结果、执行结果与验证信号,可生成平均长度为 45K token 的智能体轨迹。基于此基础设施,我们采用三阶段训练方案训练 Agents-A1:首先进行全领域监督微调,获得具备广泛长程能力的通用智能体模型;其次训练领域级教师模型,实现专业领域的性能提升;最后提出基于领域路由的在线策略蒸馏(OPD)方法,结合显著词汇对齐技术,将六个异构领域的能力统一整合至单个可部署的学生模型中。
本文还旨在为社区提供一条从模型参数规模扩展至智能体任务周期扩展的可扩展技术路径。如图1所示,Agents-A1在SEAL-0、IFBench、HiPhO、FrontierScience-Olympiad和MolBench-Bind等基准测试中超越了1T参数模型(Kimi-K2.6和DeepSeek-V4)。此外,它在SciCode、HLE和BrowseComp上也取得了强劲成绩。我们的贡献包括以下三个方面:
- •
我们提出Agents-A1,这是一个35B参数的MoE模型,旨在跨多个领域扩展异构智能体能力。在面向科学与研究的长期交互式智能体能力方面,Agents-A1能够媲美甚至超越1T参数模型。
- •
我们构建了一个长期知识-行动基础设施,用于在长期任务中与外部知识和工具进行多轮交互。该基础设施提升了智能体获取有用信息、总结关键问题、调用正确工具以及执行并验证任务的能力。
- •
我们提出了一种基于领域路由的在线策略蒸馏与显著词汇对齐方法,以减少在扩展任务周期时,因不同领域推理模式差异而导致的冲突。
2 基于专业教师模型的知识引导通用智能体训练
2.1 概述
如图 2 所示,训练过程遵循三阶段流水线。首先执行全领域有监督微调,以获得一个具备广泛能力的长期任务智能体。随后,通过针对性的 SFT 或 RL 训练领域级教师模型,使每个教师模型在特定能力或交互模式上实现专业化。最后,通过多教师同策略知识蒸馏,将这些教师模型整合为一个可部署的统一学生模型。
在这一三阶段流水线中,进一步扩展任务时长既依赖于多领域数据基础设施,也依赖于专业化智能体能力的整合。对于多领域数据基础设施,我们构建了一个知识-动作图(KAG),用于保留证据、动作、观察结果、失败案例以及验证器输出,从而提供超越最终答案的过程级监督,详见第 2.2 节。对于专业化智能体能力的整合,多教师 OPD 通过路由式教师引导、显著词汇对齐以及领域感知聚合,将各领域教师模型融合为一个统一的学生模型,详见第 2.3 节。
2.2 长期任务知识-动作基础设施
随着大语言模型的规模扩展,训练日益受到高密度、可验证且可演进的监督数据可用性的制约。由于公开网络语料库很少提供来源出处、动作轨迹、工具交互记录、执行日志以及验证器输出,我们构建了一个知识-动作基础设施,将异构语料库转化为组合式、可验证且可自我扩展的监督信号,如图 3 所示。
2.2.1 基于原子能力的知识-动作图构建
我们将长周期智能体能力分解为五种原子能力:信息获取、工具调用、可执行迭代、证据验证和约束追踪。为了恢复对这些能力的监督,我们将证据、动作、观测结果和验证器输出作为领域特定知识-动作图(KAG)中的一等链接对象进行表示。受先前工作[undefu]启发,我们对KAG定义如下。
定义1(知识-动作图)。
给定一个领域(表示该领域),知识-动作图是一个带类型的四元组
| (1) |
其中是领域语料库,包含该领域的证据片段、实体、事实、约束及其他上下文资源;是动作空间,包含工具调用、检索查询、代码编辑与执行、推理步骤以及中可用的其他智能体操作;是观测空间,包含工具返回结果、检索到的证据、执行状态以及在中执行动作所产生的中间产物;是验证器集合,包含对正确性、证据支持、约束满足及目标完成情况的自动检查。该图由链接的第t个动作记录填充,包含、、和。记录之间的边编码了支持、依赖、生成、验证和动作转换关系。
与主要存储实体-关系事实的传统知识图谱不同,KAG通过动作记录保留了答案获取、测试、修订和验证的过程。这种过程级结构同时保留了成功和失败的证据支持轨迹,从而实现了跨步骤的信用分配和可复现的长周期监督。
例如,一项长周期搜索任务(第3.1节)要求智能体通过维基语料库和网络内容中的超链接导航来搜索答案实体,其中包含页面和段落证据,是下一跳选择,是检索到的页面文本,并检查答案及其支持路径是否被恢复。一项机器学习工程任务(第3.2节)要求智能体通过在一棵候选解决方案树上迭代编写、修补和执行代码来优化类似Kaggle的提交,其中包含竞赛规范、数据集和执行环境,是代码编辑、运行或提交操作,是生成的日志、指标或提交产物,并检查评分者的分数和提交有效性。
2.2.2 自博弈图搜索与扩展
在实践中,单次生成的推理数据不一定质量高;它需要多次迭代和验证才能产出。为了优化并提升每个领域中的质量,我们通过一个提议者–求解者–验证者博弈来扩展:采样图区域以提出约束任务,通过检索和工具求解这些任务,并验证答案、证据、执行结果、轨迹以及捷径风险。具体而言,每个生成的任务表示为
| (2) |
其中是指令,是领域标签,是目标答案,是任务所需的支撑证据,是适用于该任务的验证器子集,是生成的轨迹
| (3) |
遵循公式1的动作记录形式,当没有步骤级验证器触发时。一个候选任务仅当满足以下条件时才会被接受:(i) 可针对某个进行验证,(ii) 有效,即得出一个接受的答案,(iii) 过程信息丰富,即执行有意义的中间决策而非退化为一次性查找,(iv) 覆盖证据,即中所需的证据在轨迹中实际被查阅,以及 (v) 明确指定,不存在捷径解法。
通过这种方式,求解器和验证器的反馈被写回为链接的状态、动作、观测结果、证据、产物以及验证器结果。给定一个查询-答案对和一个初始 KAG,该框架会调用领域工具(包括搜索、学术、代码执行、智能体模块和工作流规划器)来增强该知识图谱。增强后的图谱被专门化为多个子 KAG,分别用于编码、智能体推理、指令遵循、MLE 和科学推理。一个评判与验证模块接收合格的子 KAG,用于下游任务管线的构建,并将失败的子 KAG 路由回自我博弈扩展环节。
2.3 基于领域路由的在线策略蒸馏与显著词汇对齐
特定领域的教师模型提供专门的策略,但部署需要一个统一的通用策略模型。现有的采样 token OPD [undefv] 效率较高,因为它只对实际生成的 rollout token 进行评分,但这种单 token 近似方法使得附近高概率的备选 token 不受约束,这是近期分析 [undefw, undefd] 中指出的不稳定或不平衡指导的来源。
因此,我们采用了一个基于领域路由的多教师 OPD 框架,并结合了显著词汇对齐(SVA)。对于每个提示词-领域对,一个冻结的 rollout 学生模型进行采样,而优化后的学生模型则接受路由教师模型的监督。SVA 通过在一个紧凑的、由教师支持的局部词汇表上对齐学生模型和路由教师模型,来替代采样 token 代理。损失仅在可训练生成的 token 上计算,工具输出和用户轮次被屏蔽。为了处理跨领域的异质性,我们使用一个领域归一化的目标函数来聚合 SVA 损失,先在每个活跃领域内取平均,再在所有活跃领域间取平均,这样高频或高损失的领域就不会主导学生模型的更新。
2.3.1 显著词汇对齐
在位置 处,SVA 在相同的、由学生模型生成的前缀 上评估当前的学生模型和路由教师模型。令
并令 为在路由教师模型分布下,排名前 的有效 token 集合。我们在这个由教师选择的支撑集上对两个分布进行重新归一化。
每个样本的 SVA 目标是在这个显著支持集上的截断反向 KL 散度,并在可训练模型生成的位置上取平均。
| (4) |
由于支持集是由教师模型选择的,SVA 不会直接约束学生模型在该支持集之外的分布。因此,我们监控学生侧的覆盖范围。
| (5) |
覆盖范围越高,表明越接近全词汇对齐。
2.3.2 领域路由归一化目标
在多领域场景中,不同领域可能会产生异质梯度,因为它们强调不同的能力,例如回复风格、推理模式、证据获取、工具使用或外部交互。我们采用硬领域路由,即每个样本仅由其对应领域训练的教师模型进行监督。
而不是由多个教师模型进行软混合。这保留了特定领域的教师偏好,并避免了在 token 级别混合不兼容的教师信号。
对于一个 mini-batch,设 为来自领域 的样本子集,并设
为活跃领域集合。由于每个样本的 SVA 损失已经在其自身的可训练回复位置上取平均,较长的轨迹不会仅仅因为贡献更多 token 而占据主导。为了进一步防止高频领域主导更新,我们在每个活跃领域内对损失取平均,然后在活跃领域之间取平均:
| (6) |
这个领域归一化目标使每个活跃领域具有可比的影响力,同时允许每个样本从其对应的领域特定教师模型接收监督。领域标签还用于实例化特定领域的 rollout 协议,例如终结规则、模拟用户轮次或环境特定的工具执行。在生成 rollout 后,所有可训练位置在其路由教师模型下使用相同的 SVA 目标进行优化。
3 多领域数据流水线
3.1 长程搜索
我们在搜索领域实例化了知识-动作图(KAG),方法是在一个大型维基数据库上构建搜索问题数据。这里有一个维基页面和段落级证据的语料库,包含由超链接和受控图游走引发的实体转换,包含检索到的页面文本和连接证据,并检查答案实体及其支持路径是否可以从提供的上下文中恢复。该实例化针对的是第2.2.1节中定义的信息获取和证据验证能力。该流程首先将维基条目转换为一个有向语料图,其中每个条目是一个实体节点,条目间的引用定义了边。对于每个节点,该流程会检索页面文本、段落结构、出站锚点、规范标题,以及可选的入度、出度和文本长度等结构统计信息。非内容的尾部段落和来自列表式段落的锚点会被过滤掉,以减少噪声转换,因此生成的图既能提供搜索空间,也能提供所需的事实来源记录。
关系链生成。关系链通过在语料图和相应的领域KAG上进行受控随机游走来生成。候选下一节点从出站锚点中选择,同时移除已访问实体、近似重复标题变体、消歧页面、无有效文本的页面以及出站链接不足的页面。度和文本长度约束进一步控制节点质量和图多样性。一个大语言模型选择器从剩余候选中选择一个实体,平衡局部路径连贯性与可选的跨领域主题转移。如果游走到达死胡同,则通过一次短辅助游走恢复一个合格的延续节点。每个被接受的转换都存储为类似动作的记录,将当前实体状态、所选超链接动作、观察到的目标页面以及证明该转换合理的段落证据关联起来。
问答对生成。每条完整的链会与其有序的实体列表、节点文本以及相邻实体的段落级证据一起序列化。生成器将最终实体视为答案,将链改写为连贯的自然语言问题,屏蔽专有名词及其他标识信息,并要求求解器恢复被屏蔽的答案实体。随后,验证器会根据序列化链检查答案身份和证据支持。因此,每条链都会生成一个可验证的搜索域训练实例,该实例要求遵循间接的长上下文证据,而非依赖直接的名称匹配,同时保留 KAG 所需的来源、行动路径、观察文本和验证器目标。
轨迹收集与质量控制。搜索轨迹的收集方式是让强模型在真实互联网环境中使用搜索、读取页面和代码工具执行深度研究任务。搜索工具会查询商业搜索引擎,并返回每个查询的顶部结果。读取页面工具会提取网页内容,并使用大语言模型对提取的信息进行摘要,然后再返回给智能体上下文。代码工具允许模型在沙盒环境中编写和执行 Python 代码,支持搜索过程中的中间计算和数据处理。最大上下文窗口设置为 256K 个模型 token,并且单轮内对工具调用次数不设额外限制。在后处理阶段,我们会移除答案错误、交互历史过短或存在明显猜测行为的轨迹。对于达到最大轮次限制的轨迹,我们会回退到上一轮,并使用明确的用户提示词强制模型生成答案。保留的轨迹为搜索行为提供了长程监督,该行为结合了查询构建、页面阅读、证据整合以及在真实网络观察下的答案验证。
3.2 机器学习工程
遵循第2.2节中的知识-行动基础设施,我们将机器学习工程(MLE)实例化为一个基于可执行方案搜索的知识增强图(KAG)。其中包含竞赛规范、数据集和执行环境;捕获方案编辑、实验运行、树导航、节点失效和答案提交;记录日志、指标、工件和生成的提交结果;并提供评分器分数、提交格式检查和指标可靠性检查。由于候选方案是可执行代码,其质量只有在评分后才能知晓,因此每条轨迹都成为验证器引导下的方案图扩展。
任务来源。我们从 MLE-Dojo [undefx] 以及由我们的自动化框架处理的已结束 Kaggle 竞赛中,整理出可评分的竞赛任务。MLE-Dojo 提供了精选的 Kaggle 风格任务,包含隐藏答案和本地评分器,覆盖表格、视觉、自然语言处理、音频和时间序列等场景。对于已结束的竞赛,我们的框架会整理任务描述和排行榜信息,将公开数据重新划分为全新的训练/测试分区,构建私有答案,并合成一个带有提交验证功能的本地评估器。这产生了一个多样化且可刷新的优化任务池,同时减少了对任何静态基准分布的过拟合。
智能体框架。轨迹在一个智能体框架中生成,该框架会构建一棵由可执行方案节点组成的树,遵循 MLEvolve [undefy] 等先前的方案搜索工作流程。编写完整脚本会开启一个新的根节点,修补一个节点会生成一个子节点,执行一个节点则会附加日志、异常、指标、工件和提交有效性等观测信息。这棵树构成了 MLE 领域知识增强图(KAG)的可执行核心:分支编码了不同的尝试路径,验证器结果指导着扩展方向,而失败或失效的节点则为后续决策提供了负面证据。
该工具接口通过一个紧凑的工具界面暴露了这一过程,如表 1 所总结,涵盖代码编写、执行、树形导航、答案管理、持久化记忆以及委托分析。对于长时间运行的任务,一个独立的分析子智能体负责调查数据或结果并返回报告,同时上下文压缩功能会将早期步骤总结为摘要。
轨迹收集与质量控制。我们通过多种随机种子和提示词变体在任务池中收集教师轨迹,使用本地评估器重放这些轨迹,并保留那些能产生有效且具有竞争力提交结果的运行。在修剪掉回归性或退化片段后,我们对剩余运行进行去重,并将其序列化为统一的消息模式,其中包含针对教师生成内容的损失掩码。该序列化过程保留了节点关系、执行观察结果、验证器输出以及已提交答案的历史记录,使得解决方案搜索结构在训练时可恢复。
| 工具 | 功能 |
| 代码编写与执行 | |
| write_full_code | 从头编写完整的训练脚本;打开一个新的根节点(一条新的解决路径)。 |
| patch_code | 对某个节点的代码应用局部编辑;生成一个子节点,保留树形历史记录以进行增量优化。 |
| execute_code | 运行一个节点,捕获标准输出和异常,提取其验证指标,并检查生成的提交结果是否有效。 |
| execute_bash | 运行受保护的 shell 命令,用于环境设置和检查(安装、GPU 检查、文件操作)。 |
| 搜索树导航与答案管理 | |
| list_nodes | 查看解决方案树:选定的答案、最近的答案轨迹、已失效的历史记录,以及按指标排序的列表。 |
| select_node | 在重新访问或从某个节点分支之前,完整查看该节点(代码、计划、输出、指标、父节点链)。 |
| invalidate_node | 将指标不可信(数据泄露、过拟合)的节点从排序和提交中排除。 |
| update_answer | 将节点提交为当前候选答案,写入评分器读取的规范路径。 |
| 获取当前答案 | 报告当前已提交为答案的节点。 |
| 持久化内存 | |
| 写入笔记 / 读取笔记 | 追加/重新读取一个能在上下文压缩中存活的笔记本(包含决策、失败策略及其原因、假设)。 |
| 子智能体 | |
| 分析 | 生成一个独立的分析子智能体,在其自身的上下文窗口中探索数据和结果,并返回一份单一的结构化报告。 |
3.3 科学推理与研究
遵循第 2.2 节中的知识-行动基础设施,我们将科学推理实例化为一个针对科学问题解决过程的领域特定知识-行动图。形式上,给定科学知识-行动图,其中包含科学问题组件,包括问题陈述、主题、关键词和解决方案结构;包含推理行动,如分解、转换、检索和计算;捕获中间推理状态、外部证据和执行输出;包含关于正确性、一致性和科学有效性的验证信号。
问题构建。我们首先收集了一个大规模的科学问题池,涵盖数学、物理学及相关领域等基础学科。基于这个种子问题池,我们构建了一个知识-动作图,其中每个种子问题被表示为相互连接的节点,编码了其问题陈述、关键词和解决方案组件,从而形成一个初始的知识对齐子图。在此图的基础上,我们通过第 2.2 节中介绍的自博弈图搜索与扩展,执行自演化的科学 KAG 增强,对局部子图进行采样和系统性重写,以沿着两个互补方向改进科学问题:(i) 更难推理变体,增加所需的领域知识深度,引入复杂的符号结构,并扩展多步推导过程;以及 (ii) 交互增强变体,注入跨领域知识,融入需要外部检索的概念,并增加计算需求,例如基于代码的数值执行。对于已经展现出强推理能力或强交互需求的问题,我们保留其原始形式不做修改。通过这一图驱动的扩展过程,我们构建了一个包含约 1.5 万个实例的增强型科学问题语料库,其特点是难度更高、交互性更强,从而为长程科学推理提供了数据基础。
轨迹生成。基于增强后的科学问题语料库,我们构建了无工具和工具增强两种推理轨迹,作为长周期科学推理的训练数据。对于无工具推理,我们从强模型中蒸馏出高质量纯推理轨迹,包含多步推导、符号变换和最终答案,并仅保留经验证正确的轨迹以提升纯推理能力。对于工具增强推理,我们构建了一个交互式推理框架,配备四种外部工具:搜索、访问、代码和学术。搜索工具用于检索相关网络信息以获取事实依据;访问工具支持查看特定网页或文档;代码工具支持数值计算、符号计算、方程求解和仿真;学术工具则提供学术文献访问。利用该框架,我们从强模型中蒸馏出工具增强轨迹,记录中间推理步骤、工具调用、观察结果、计算过程和最终答案,并通过最终答案正确性进行筛选,以确保高质量交互数据。总体而言,无工具和工具增强轨迹为强化长周期科学问题解决中的推理与交互能力提供了互补的监督信号。
3.4 指令遵循
遵循第2.2节中的知识-行动基础设施,我们将指令遵循实例化为一个基于约束、长上下文证据和局部引入规则的KAG式监督问题。其中包含用户指令、可验证约束、长文档片段、文档级实体和事实、注入的上下文规则、干扰项和候选答案;包含KAG级别的操作,例如约束解析、证据选择、局部规则应用、干扰项排除和最终答案格式化;包含选定的证据、解析后的约束状态、注入的规则状态和候选答案状态;以及包含用于约束满足、答案匹配、证据依赖性和与注入上下文信息一致性的自动验证器。该实例化针对约束追踪、证据验证和长上下文适应。
任务构建。我们从两个互补来源及其对应的领域KAG构建指令遵循语料库。第一个来源是来自NVIDIA的Nemotron-RL指令遵循数据集中包含13K个多约束指令样本的高质量子集[undefz]。这些示例基于WildChat-1M[undefaa]中的提示词和Open-Instruct代码库中的指令构建,涵盖可自动验证的约束,例如长度、格式、关键词、语言、标点符号和段落结构。在KAG视角下,每个约束都被表示为一个条件节点,该节点与所需的输出行为及其验证器相连,因此生成的数据直接监督模型是否能够解析并满足明确的用户要求。
第二个来源是一个自建的长上下文学习流水线,该流水线生成了 10K 个经过验证的长上下文问答实例。我们首先对长文档进行结构化解析,提取实体、属性、关系、数值以及其他显著事实,以构建与 KAG 表示兼容的文档级证据图。基于这些图,我们综合生成需要跨多个事实节点组合证据的多跳问答任务。接着,我们注入局部的上下文内规则或干扰项,例如覆盖文档规则的临时协议、具有误导性的框架性陈述,或与先验知识相冲突的约束条件。这些注入的信号会与相关的证据节点、规则节点以及验证器检查项相链接。候选任务被转换为统一的单选题问答格式,并通过自动验证进行筛选,以确保正确答案既依赖于长上下文证据链,也依赖于注入的上下文信息。这为定位分散的证据、应用局部规则以及抵制无依据的干扰项提供了可验证的监督信号。
3.5 工具调用
遵循第 2.2 节中的知识-行动基础设施,我们将工具调用实例化为一个基于可执行交互的 KAG。其中包含工具模式、环境状态、可选的模拟用户画像以及任务资源;包含基于模式的调用和澄清行动;包含工具返回结果、状态更新、错误以及用户反馈;并包含可用的模式、状态、依据以及目标完成度检查。每个任务可以衍生出多个候选的长程状态-行动-观察链,这些链中后续的决策依赖于先前的观察结果。
任务构建。任务池与工具接口通过工具提取、工具交互图构建、图组合式任务合成以及可解性评估共同构建。我们从科学、网络、代码仓库、数据库以及本地模拟的工具使用场景中提取候选接口[undefab, undefac]。该图连接工具、资源/状态类型、观测字段和验证器目标,边表示可执行的依赖关系,例如模式兼容性、前置条件-效果关系、共享资源、状态转换或对完成检查的支持。任务合成被形式化为在该依赖图上的约束图搜索:生成器选择以目标状态、答案或验证器条件为锚点的连接工具子图或依赖路径,然后将它们渲染为用户指令。这避免了任意的工具拼接:后续调用必须依赖于先前产生的对象、约束或观测结果。候选任务会经过参数可用性、初始状态可达性、沙箱可执行性以及验证器覆盖率的筛选。未充分指定、仅基于提示词、模式不兼容或无法验证的任务将被修订或丢弃。每个保留的任务存储用户目标、所选工具子图、初始状态、隐藏的支持路径以及完成标准或验证器。
轨迹生成。轨迹生成在工具沙箱中执行,该沙箱会暴露所选工具子图并维护不断变化的环境状态。求解器后端通过选择工具、绑定参数、解读观测结果,并决定是继续执行、请求澄清还是生成最终响应,在多个轮次中探索候选空间。当需要偏好、缺失约束或任务相关的澄清时,模拟用户会参与交互循环。针对相同的用户目标和验证器目标(包括在问答类任务中包含相同的问答对),我们通过不同的工具选择、操作或澄清轮次生成多条候选轨迹。此过程被视为在轨迹空间上进行的验证器引导的图搜索。可用的验证器或评判模块会根据调用格式、模式类型、状态一致性、观测依据、约束满足度和目标完成度对这些候选轨迹进行评分或排序。无效模式、不支持的参数、无法恢复的失败或缺乏依据的响应会被拒绝,或转入修复和重采样流程。被接受的运行结果将保留为符合 KAG 对齐的消息轨迹,其中包含助手轮次、工具调用、观测结果、用户反馈、状态变化和验证器输出。
4 三阶段训练方案
4.1 全领域监督微调
我们从 Qwen3.5-35B-A3B [undefe] 开始,进行监督微调。目标是让模型遵循期望的行为,并提升其遵循指令的能力。监督微调有助于弥合中期训练期间习得的原子能力与根据用户指令提供有用、清晰且具有上下文感知的响应能力之间的差距。
数据构成。我们的监督微调数据集包含多样化的高质量长程轨迹混合数据,涵盖多个领域和任务类别。数据来源包括:
- •
深度研究:需要模型搜索互联网以获取相关信息并综合答案的调查、深度研究主题和谜题。
- •
编码与工程:涵盖多种语言和框架的编程任务,包含逐步推理与代码生成。此类别还包括机器学习工程数据,即模型开发机器学习方法,例如设计模型架构、实现训练流程以及调整超参数。
- •
科学问题求解:针对科学和数学问题的链式推理解决方案,包括使用科学计算工具。
- •
指令遵循:旨在增强模型在严格约束下、于生成式场景中遵循细粒度指令能力的任务。
- •
通用智能体任务:涉及规划、决策和通用工具使用能力的多轮对话。
总体而言,SFT 数据集包含约 K 条轨迹,平均总长度为 K 个 token。表 2 总结了每个领域的平均 token 长度。值得注意的是,我们的大部分 SFT 数据由长程轨迹组成,这增强了模型在不同扩展上下文下的长程思考能力。所有数据均经过严格的质量过滤、去重和人工审核,以确保准确性和一致性。
| 数据源 | 平均 Token 长度 |
| 深度研究 | 44K |
| 编码与工程 | 48K |
| 科学推理与问题求解 | 37K |
| 指令遵循 | 3K |
| 通用智能体任务 | 39K |
| 总体 | 45K |
训练细节。我们基于 Qwen3.5-35B-A3B [undefe] 进行微调,使用标准的交叉熵损失,该损失仅针对响应 token 计算,而指令 token 则从损失计算中屏蔽。这确保了模型学会在给定指令的条件下生成响应,而不会过度拟合提示模式。关键超参数列于表 3。
为了提高训练吞吐量,我们采用了样本打包策略,将多个短样本拼接成一个训练序列,直至达到最大上下文长度。通过应用注意力掩码来防止打包样本之间的交叉污染。这减少了填充开销,并显著提升了 GPU 利用率。
4.2 领域级教师训练
4.2.1 搜索任务上的强化学习
为了构建智能体搜索的教师模型,我们采用了两阶段训练流程。在第一阶段,我们仅使用第 3.1 节收集的搜索轨迹,对基础模型进行监督微调(SFT)。这些轨迹展示了如何将复杂问题分解为子查询、在适当时机调用网页搜索和页面阅读工具,并将检索到的信息综合成连贯的答案。SFT 阶段使模型具备了基本的工具使用能力和多轮智能体搜索模式。在第二阶段,我们在 SFT 模型的基础上应用强化学习(RL),以进一步提升模型利用外部搜索工具进行复杂多跳推理的能力。
强化学习算法。我们采用 GRPO [undefad] 作为我们的强化学习算法。训练目标结合了裁剪策略损失、用于防止策略偏离参考模型过远的 KL 散度惩罚,以及用于鼓励探索的熵正则化项。我们使用 rollout 对数概率进行精确的优势函数计算。
智能体工具。在强化学习训练期间,我们为模型配备了三种工具:
- •
网页搜索:根据查询返回谷歌搜索结果,使模型能够发现相关网页。
- •
阅读页面:给定一个 URL 和一个查询,此工具使用摘要模型从页面中提取并返回与查询相关的信息。
- •
代码:使模型能够在沙盒环境中编写和执行 Python 代码,支持计算和文件处理。
训练数据。训练数据集包含约 2000 道精心挑选的多跳推理问题,这些问题需要具备网络搜索能力。每个样本包含一条用户查询和一个标准答案。为了构建该数据集,我们使用配备了上述工具的 SFT 模型,对每个问题尝试 5 次重试。然后,我们筛选出模型既产生过正确轨迹也产生过错误轨迹的问题,过滤掉那些对模型来说要么太简单(总是正确)要么太难(总是错误)的问题。这种筛选策略确保了强化学习训练信号的信息量最大化。
展开与奖励设计。在每一步展开过程中,模型针对每个提示词生成 8 条展开轨迹。每条响应都是一个多轮智能体轨迹,模型在其中迭代地调用工具并对检索到的信息进行推理。最终的奖励由三个部分组成:
(1)正确性奖励。我们使用一个大语言模型裁判来评估模型的最终答案是否正确。该裁判接受等价的数字格式、语义改写以及将正确信息作为清晰子短语包含在内的答案,同时拒绝矛盾或回避性的回答。
(2)搜索行为惩罚。我们引入两种惩罚机制,以鼓励高效且无冗余的搜索行为。
- •
效率惩罚:我们允许模型在前几轮内自由搜索,不施加任何惩罚。超过这些轮次后,将施加一个随额外轮次数量线性增加的惩罚。这鼓励模型在收集到足够信息后立即停止搜索。
- •
重复惩罚:如果某个 `google_search` 查询或 `read_page` URL 在最近的滑动窗口内已经出现过,则每次重复出现都会受到一个小额惩罚,每条轨迹的惩罚设有上限。这可以防止冗余搜索和重复的页面读取。
(3)格式校准奖励。我们额外奖励模型生成符合预期输出格式的答案,确保最终响应结构良好,并且能够被可靠地解析以进行评估。
训练配置。我们使用强化学习对 SFT 模型进行微调,学习率恒定。在每次生成步骤中,我们采样 32 个问题,并为每个问题生成 8 个候选回答,从而每次梯度更新获得 256 的全局批次大小。GRPO 目标函数使用裁剪范围、KL 散度惩罚系数和熵正则化系数。最大回答长度设为 4,096 个模型 token,最大序列长度设为 131,072。每次生成最多进行 300 次工具调用。生成温度设为 1.0。
4.2.2 科学增强的有监督微调
本部分介绍如何训练一个科学教师模型,使其在科学场景中既能保持深度问题解决能力,又能具备可靠的交互行为。由于前沿科学任务通常涉及长推导、专业知识、数值计算和符号操作,科学教师需要同时具备强大的内在推理能力和外在交互能力。它应当能够推理困难的科学和专业问题,判断何时内在推理不足,在需要事实依据或精确计算时调用外部工具,并将由此获得的证据综合成连贯的答案。因此,我们设计了一个两阶段 SFT 流程。第一阶段侧重于提升推理能力,第二阶段则进一步增强交互能力。具体细节如下。
训练数据。我们从通用领域模型 Qwen3.5-35B-A3B [undefe] 初始化,并使用第 3.3 节构建的科学数据对其进行继续训练。监督语料包含两种互补类型的目标。第一种类型是由强大的非工具推理模型在精选的科学问答问题上生成的高质量推理轨迹。这些轨迹强调内在的科学推理能力,包括问题分解、物理假设识别、中间量的推导、单位一致性以及最终答案验证。第二种类型是配备搜索、访问、代码和学术功能的、经过过滤的工具增强推理轨迹。这些轨迹使模型能够与外部对象进行基于事实的交互,包括检索背景事实、查阅源文档、执行计算、检查中间结果,以及利用观察结果来修正解题路径。
两阶段 SFT。科学教师模型通过两阶段 SFT 流程进行训练。两个阶段均使用标准的响应 token 监督目标。
- •
第一阶段:推理增强型 SFT。我们专注于大幅增强模型的内在推理深度。我们在高质量的非工具科学推理轨迹上对模型进行微调,这鼓励模型在生成最终响应之前形成完整的因果和数学推理链。此阶段提升了教师模型通过自包含推导来解决问题的能力,而非过早地依赖外部工具。
- •
第二阶段:工具增强型 SFT。我们从强推理检查点继续训练,在筛选后的多学科科学推理轨迹上执行工具增强型 SFT。与第一阶段数据相比,这些样本要求模型协调推理与显式工具交互。训练目标鼓励教师模型识别何时需要外部支持、选择合适的工具、制定精确的工具输入、解释返回的观测结果、验证数值或符号中间状态,并将检索或计算得到的证据整合回逻辑连贯的解决方案中。我们延长了本阶段的训练轮次,以使工具使用行为在长时间科学交互中保持稳定,同时保留第一阶段习得的推理风格。
4.2.3 基于强化学习的指令遵循优化
我们假设更强的指令遵循能力可以促进有效的上下文学习(ICL),尤其是在长上下文场景中——模型必须理解任务指令、遵守输出约束,并从冗长输入中识别相关证据。为此,我们采用两阶段强化学习流程来优化我们的 SFT 模型。第一阶段侧重于细粒度指令遵循,第二阶段则进一步提升模型的 ICL 能力。
训练数据。我们使用第 3.4 节构建的指令遵循和长上下文学习数据。第一阶段 RL 使用可验证的指令遵循子集来优化细粒度约束满足,第二阶段则使用长上下文 ICL 推理子集来改进证据锚定和对上下文信息的适应能力。
训练阶段。我们在两个阶段均采用 GRPO [undefad]。对于每个提示词,模型会生成一组候选回复,组内的奖励差异为策略优化提供自对比监督信号。为提高强化学习训练效率,我们在 rollout 阶段应用动态采样。具体而言,对于每个提示词组,我们仅保留奖励非均匀的组,并过滤掉所有采样回复获得相同奖励的组。该策略移除了对当前策略而言过易或过难的提示词,因为此类组别几乎不提供有用的偏好信号。由此,策略更新集中在具有有意义奖励对比的样本上。强化学习训练流程包含两个连续阶段:
- •
阶段一:指令遵循强化学习。我们首先在 Nemotron 指令遵循数据 [undefz] 上训练模型。此阶段旨在提升模型理解并满足细粒度用户约束的能力,例如格式要求、长度限制、关键词包含或排除、语言约束及其他明确指令。我们使用可验证的基于规则的奖励机制。奖励函数会检查生成的回复是否满足提示词中指定的显式约束,包括格式、长度、关键词、语言及其他基于规则的要求。这种设计为指令遵循提供了可靠的监督信号,同时避免依赖外部评判器。
- •
第二阶段:长上下文学习强化学习。从指令遵循强化学习检查点出发,我们继续在长上下文学习数据上训练模型。我们使用基于规则的答案匹配作为结果奖励。当响应的最终答案根据预定义的匹配规则与真实答案一致时,该响应获得奖励。这一阶段鼓励模型将其推理扎根于长输入中与任务相关的具体信息。通过在我们构建的数据上进行训练,模型学会了检索稀疏但决定性的证据、整合跨远距离文档位置的信息、适应新引入的上下文内规则,并拒绝显著但缺乏支持的干扰项。因此,模型减少了对记忆先验或局部模式匹配的依赖,从而展现出更强的长上下文学习行为。
4.2.4 工具调用强化学习
对于智能体工具使用而言,仅靠监督微调是不够的,因为主要的失败模式不仅仅是局部的格式错误。智能体必须学会何时调用工具、调用哪个工具、如何生成有效参数、如何从工具错误中恢复,以及任务何时真正完成。这些决策会产生延迟后果:一个错误的早期工具调用可能要到多个回合之后才会显现,而过早停止可能看起来流畅,却未能完成任务。因此,需要强化学习来优化完整的轨迹,而非孤立的助手回合。
奖励设计与优势增强。为了使模型获得更密集的边际信号并最大化边际收益,我们构建了两种类型的奖励函数。第一种是表示任务完全成功的结果奖励。第二种是衡量在大语言模型评分标准下部分完成度的过程评分:
| (7) |
优势采用非对称设计[undefae]。成功的轨迹已经满足所有评分标准,因此对正样本添加过程奖励会重复计算同一信号。过程奖励的信息性用途在于失败的轨迹,其中不同的失败可以根据其接近成功的程度进行有意义的排序。对于基于群体的强化学习,调整后的优势为:
| (8) |
其中, 在组内有效样本上进行归一化,而 仅在有效负样本上进行归一化。这保留了失败轨迹之间的相对排序,并避免使用正样本扭曲失败侧的过程分布。
训练数据。该数据策略围绕稀疏、有噪声、长周期智能体奖励这一普遍问题而设计。其中一个组成部分是困难任务集,它提供了具有挑战性的提示词,使得 SFT 模型的通过率较低,且许多轨迹接近成功。这对强化学习很有用,因为它能在组内创建具有梯度承载能力的对比。在强化学习后训练中,数据复用是一种有效策略,它反复利用同一批高质量数据,在特定约束下能达到与使用更大批次数据相当的效果。困难数据部分被有意复用,而非作为一次性处理的大型语料库。对于包含 个任务、rollout 批次大小 、每个提示词 个样本、rollout 轮次 的训练集,每个任务预期生成的轨迹数量约为:
| (9) |
训练阶段。我们的训练流程包含两个阶段:工具专用 SFT 和工具增强型 RL。
- •
工具专用 SFT。在 SFT 阶段,我们使用第 3.5 节收集的数据来增强 Qwen3.5-35B-A3B [undefe] 的工具使用能力。该阶段的主要目标是提升模型生成工具使用指令、产生格式正确的工具调用以及执行基本工具调用的能力。同时,我们使用一个评分模型来记录并监控此阶段遇到的困难任务。这些任务将在后续阶段用于基于强化学习的增强。
- •
工具特定强化学习。在强化学习阶段,我们使用评分细则重新评估上述任务的轨迹。这额外的一轮评估进一步筛选数据,并保留质量更高的子集。该子集的一个显著特点是,它由那些接近成功但最终未能获得结果奖励的案例组成。基于这一过程,我们构建了一个仅包含 64 个样本的困难任务集。通过上述数据复用,并应用 PAPO 风格的优势函数来增强 GRPO,我们仅用少量高质量数据,在少量训练步骤内就实现了高效的工具强化学习改进。
4.3 多教师在线知识蒸馏
在全领域监督微调和领域级教师训练之后,我们通过多教师在线知识蒸馏将各个专业教师整合成一个可部署的学生模型。学生在特定领域教师的指导下,基于自身生成的轨迹进行优化,而详细的在线知识蒸馏目标,包括显著词汇对齐和领域归一化聚合,已在第 2.3 节中介绍。本节描述训练流程。
学生模型初始化与教师池。学生模型从第 4.1 节的全领域监督微调检查点初始化。教师池由第 4.2 节中的领域级模型构建,每个教师通过针对性的监督微调或强化学习实现专业化。在在线知识蒸馏过程中,教师模型不在参数层面进行合并。相反,每个提示词会被分配一个领域标签,由对应的教师为学生生成的轨迹提供蒸馏信号。
训练数据与领域路由。1) 数据组织:在线知识蒸馏训练集从先前的任务族重新组织,用于在线学习。每个样本包含用户提示词、领域标签、适用的交互协议以及执行元数据,例如环境配置、结束规则和验证器信息。2) 领域路由:我们对提示词进行去重,并平衡每个领域的唯一提示词数量。在训练期间,每个样本被路由到为其领域训练的教师,从而保留领域特定的偏好,并避免不兼容的教师信号。
在线策略轨迹生成。1) 轨迹构建:对于每个批次,当前学生模型在相应领域协议下生成回复或智能体轨迹。工具输出、用户轮次和环境观测结果作为上下文保留,但被遮蔽不参与损失计算,因此优化仅应用于学生模型生成的 token。2) 轨迹边界限制:为控制轨迹结构的巨大差异,每条轨迹受轮次预算、回复长度预算和上下文长度预算的限制。超出上限的轨迹标记为 TRUNCATED(截断)并保留为有效前缀,而系统中断的轨迹标记为 ABORTED(中止)并重新尝试。
教师引导的策略优化。收集轨迹后,路由教师模型对学生模型生成的前缀进行评分,并提供 token 级别的指导。与离线模仿不同,教师模型不会生成独立的参考轨迹;它直接对学生模型自身的轨迹进行评分,从而使信号符合在线策略。在我们的最终配置中,学生模型使用第 2.3 节中领域路由的 SVA 目标进行训练,其中损失通过领域归一化加权进行聚合,以平衡异构教师模型。通过 OPD,学生模型在保留广泛 SFT 覆盖范围的同时,将教师池中更强的领域特定行为吸收到统一的长期智能体中。
5 实验结果
5.1 评估设置
对于长期搜索评估,我们覆盖了四个公开基准:GAIA、BrowseComp、XBench-DeepResearch 和 SEAL‑0。每个智能体配备三种工具:一个搜索工具,用于检索网页并返回每个查询的前 50 条结果;一个访问工具,用于获取网页内容并通过专用摘要模型进行摘要,以提取任务相关信息;以及一个代码工具,用于在远程沙箱中执行 Python 脚本,以支持复杂计算和逻辑推理。我们将每个任务的上限设为 300 轮次,并报告 pass@1 作为主要指标。对于答案验证,我们严格遵循每个基准的官方评判模型和提示词设置,而非使用统一的评判模型。
对于工程类任务,我们按照各自官方协议评估 SciCode [undeft] 和 MLE-Bench-Lite [undeff]。SciCode 针对研究级别的科学编码任务,其中问题被分解为顺序子问题,只有当解决方案通过所有关联的隐藏单元测试时,才被判定为正确。按照标准设置,我们为每个子问题提供科学家标注的背景信息,并报告测试集中子问题的 pass@1 指标。MLE-Bench-Lite 则衡量 Kaggle 竞赛中的端到端机器学习工程能力:仅给定数据集和任务描述,智能体需自主探索数据、训练模型并提交结果,该结果将对照原始竞赛排行榜进行评分,并映射为 Kaggle 奖牌(铜牌、银牌或金牌)。我们遵循官方 MLE-Bench 评分标准,报告奖牌率,即提交结果至少获得铜牌的竞赛占比,取三个随机种子的平均值。每项任务在专用 H200 GPU 上独立运行,墙钟时间预算为 12 小时。
在科学研究评估方面,我们纳入了四个代表性基准:带工具的 HLE [undefh]、HiPhO [undefr]、FS-O(前沿科学奥林匹克)[undefg] 和 FS-R(前沿科学研究)[undefg]。带工具的 HLE 评估结合外部工具使用的专家级推理能力,是前沿推理领域应用最广泛的公开排行榜之一。对于基线模型,我们尽可能报告官方分数;对于缺少官方结果的 Qwen3.6-35B-A3B,我们采用与自身模型相同的工具增强流水线,包括搜索、访问、代码和学术工具。HiPhO 是首个专用于物理奥林匹克评估的基准,对 2024–2025 年近期竞赛中的多模态物理推理能力进行评测,我们报告所有竞赛的平均分数。FS-O 和 FS-R 分别评估奥林匹克级和研究级的科学推理能力,涵盖物理、化学和生物学等学科。我们遵循官方协议并报告平均准确率。对于 HiPhO、FS-O 和 FS-R,我们报告对比模型的无工具结果,以避免将我们的工具增强评估协议应用于未经过工具使用训练的模型时产生混淆效应——在某些情况下,这反而可能降低模型性能。这种设置也提供了严格的对比,因为它检验了配备工具的智能体模型能否在标准评估配置下超越领先的大规模前沿模型。
在长上下文和指令遵循评估方面,我们使用 LongBench V2 [undefah]、IFBench [undefq] 和 IFEval [undefai],并采用其官方或基准测试提供脚本中实现的评估协议。LongBench V2 通过 503 道多选题评估长上下文理解能力,涵盖单文档问答、多文档问答、长上下文学习、长对话历史理解、代码仓库理解和长结构化数据理解。我们采用链式推理提示词设置,必要时将输入截断至 128K 模型 token,并提取最终的多选题答案,报告完整数据集上的准确率,以及按难度和上下文长度划分的细分结果。IFBench 和 IFEval 衡量细粒度指令遵循能力。模型针对每个提示词生成回复,基于规则的验证器检查是否满足所有指定约束条件。IFBench 包含 294 个测试提示词,IFEval 包含 541 个提示词。对于这两个基准测试,我们遵循基准测试评估脚本,并报告提示词级别和指令级别上的严格指令遵循准确率。
对于通用智能体任务,-Bench [undefab] 和 VitaBench [undefac] 均使用所有领域上的 pass@1 平均值。具体而言,-Bench 涵盖零售、电信和航空领域,而 VitaBench 涵盖跨领域、配送、店内和 OTA 领域。这两个基准测试的官方设置均使用 GPT-4.1 作为用户模拟器;为降低未来模型退役可能带来的可复现性风险,我们在这两个基准测试中均使用开源模型 DeepSeek-V3.2 [undefaj] 作为用户模拟器。对于 VitaBench,我们还使用 DeepSeek-V3.2 作为评判模型,替换原始报告中使用的 Claude-3.7-Sonnet 评判模型(Anthropic 声明 Claude-3.7-Sonnet 已退役且不再可用,详见 https://platform.claude.com/docs/en/about-claude/model-deprecations)。
对于 MolBench [undefs],我们报告了结合亲和力比较(MolBench-bind.)的分数,遵循官方评估设置并对三次重复运行取平均值。对于 MatTools [undefak],我们采用自主代码探索设置:允许模型在完成任务前,通过多轮交互来检查、操作并探索近 10 万行代码的工具代码库。我们报告了 138 个子任务的完成率,并对三次运行取平均值。在推理设置方面,GPT-5.5 使用极高推理努力度,而所有其他模型使用温度参数 0.7,其余参数保持默认值。
5.2 结果与观察
| Qwen3.5-35B-A3B | Agents-A1-SFT | Agents-A1 | |
| 长周期搜索 | |||
| BrowseComp [undefi] | 61.0 | 74.6 | 75.5 |
| XBench-DS-2510 [undefag] | 77.0 | 88.0 | 86.0 |
| Seal-0 [undefp] | 41.4 | 52.3 | 56.4 |
| GAIA [undefaf] | 59.8 | 95.2 | 96.0 |
| 工程任务 | |||
| SciCode [undeft] | 37.1 | 42.3 | 44.3 |
| MLE-Bench-Lite [undeff] | 24.2 | 39.4 | 43.9 |
| 科学研究 | |||
| HLE w/ tools [undefh] | 47.4 | 41.6 | 47.6 |
| HiPhO [undefr] | 37.0 | 42.9 | 46.4 |
| FS-O [undefg] | 64.5 | 75.0 | 79.0 |
| FS-R [undefg] | 2.5 | 31.7 | 40.0 |
| 指令遵循 | |||
| IFbench [undefq] | 70.2 | 68.7 | 80.6 |
| Longbench V2 [undefah] | 59.0 | 58.3 | 60.2 |
| 通用智能体任务 | |||
| -Bench [undefab] | 81.2 (32.5)† | 76.7 | 79.8 |
| VitaBench [undefac] | 26.0 | 37.3 | 38.8 |
| 科学智能体任务 | |||
| MatTools [undefak] | 21.0 | 37.0 | 47.1 |
| MolBench-Bind. [undefs] | 46.0 | 46.0 | 56.8 |
† 对于 -Bench,我们同时报告了官方 Qwen3.5-35B-A3B 的结果(81.2)和我们复现的结果(33.0);讨论请参见第 5.2.1 节。
5.2.1 全领域 SFT 结果
SFT阶段模型的结果如表4所示。从结果可以看出,与Qwen3.5-35B-A3B相比,Agents-A1-SFT在长周期搜索、工程任务、科学研究和智能体任务上均有明显提升。然而,我们也观察到Agents-A1-SFT在通用智能体任务、指令遵循和HLE上出现了明显的性能下降。我们认为这主要是由长思考推理模式与多轮智能体模式之间的差异造成的。全领域SFT难以轻易解决不同推理模式导致的领域冲突。因此,我们选择了多领域在线策略蒸馏(OPD)。在展示OPD的实验结果之前,我们先给出各领域教师模型训练的结果。
5.2.2 领域教师训练结果
搜索任务实验。如表5所示,搜索增强型教师模型在所有四个基准测试上均持续优于Qwen3.5-35B-A3B模型。最显著的提升出现在GAIA上,得分从59.8提升至85.4(+25.6)。在HLE上,搜索增强型教师模型取得了2.9分的中等幅度提升(47.4提升至50.3)。
| 模型 | GAIA | Seal-0 | HLE(带工具) | XBench-DS-2510 |
| Qwen3.5-35B-A3B | 59.8 | 41.4 | 47.4 | 77.0 |
| 搜索增强型教师模型(SFT+RL) | 95.1 | 54.1 | 50.3 | 86.0 |
科学领域实验。从表6可以看出,与基线模型Qwen3.5-35B-A3B相比,科学增强型教师模型展现出全面的优越性,尤其是在FS-R上。这表明,所提出的两阶段SFT能够显著提升科学场景下的内在推理能力和外部工具使用交互能力。
| 模型 | HLE(带工具) | HiPhO | FS-O | FS-R |
| Qwen3.5-35B-A3B | 47.4 | 37.0 | 64.5 | 2.5 |
| 科学增强型教师模型(SFT) | 47.8 | 46.9 | 82.0 | 54.3 |
| 模型 | LongBench V2 | IFBench | IFEval |
| Qwen3.5-35B-A3B | 59.0 | 70.2 | 91.9 |
| 长指令增强强化学习 | 62.4 | 82.0 | 93.4 |
指令遵循与长上下文学习实验
如表 7 所示,经过强化学习增强的教师模型在长上下文和指令遵循评估中均持续优于 Qwen3.5-35B-A3B。在 LongBench v2 上,总体得分从 59.0 提升至 62.4。这表明我们的长上下文强化学习阶段主要增强了模型从更长、更难的上下文中检索和理解相关证据的能力,从而改善了复杂的长上下文学习。在 IFBench 上,严格得分从 70.2 提升至 82.0,表明模型对具有挑战性的可验证指令约束的泛化能力更强。该模型在 IFEval 上也有提升。总体而言,这些结果表明我们的强化学习增强有效改善了长上下文学习和精确指令遵循能力。
工具调用实验。我们进一步评估了工具增强后训练对工具调用基准测试的影响。如表 8 所示,通过在 Qwen3.5-35B-A3B 基础上应用 SFT 和 RL 得到的工具增强模型,在 -Bench 和 VitaBench 上带来了显著提升。在 -Bench 上,平均得分从 32.53 提升至 82.50,在航空、零售和电信领域均有一致提升。特别是,航空领域从 16.00 提升至 72.00,零售领域从 30.70 提升至 82.50,这表明工具增强后训练增强了模型遵循特定领域工具使用约束并完成多轮操作任务的能力。在 VitaBench 上,平均得分从 26.00 提升至 44.16。这些结果表明,工具调用能力显著受益于明确的工具使用监督和强化学习,尤其是在任务需要与外部环境进行结构化交互而非纯粹的语言理解时。
| -bench† | VitaBench | ||||||||
| 模型 | 航空 | 零售 | 电信 | 平均 | 跨域 | 配送 | 店内 | OTA | 平均 |
| Qwen3.5-35B-A3B | 16.00 | 30.70 | 50.90 | 32.53 | 11.51 | 39.25 | 31.50 | 21.75 | 26.00 |
| 工具增强(SFT+RL) | 72.00 | 82.50 | 93.00 | 82.50 | 30.00 | 56.00 | 51.75 | 38.89 | 44.16 |
| † 对于 -Bench,我们报告了复现结果(32.53);讨论见第 5.2.1 节。 | |||||||||
5.2.3 在线策略蒸馏结果
| 35B 参数 | >1T 参数 | |||||||
| Agents-A1 | Qwen3.6-35B-A3B | Nex-N2-mini | Kimi-K2.6 | DSV4-Pro (Max) | GPT-5.5 | |||
| 长时程搜索 | ||||||||
| BrowseComp [undefi] | 75.5 | 67.9 | 74.1 | 83.2 | 83.4 | 84.4 | ||
| XBench-DS-2510 [undefag] | 86.0 | 71.0 | 82.0 | 90.0 | 90.0 | 84.0 | ||
| Seal-0 [undefp] | 56.4 | 38.7 | 49.6 | 50.5 | 55.0 | 42.3 | ||
| GAIA [undefaf] | 96.0 | 78.6 | 82.5 | 80.6 | 98.1 | 87.4 | ||
| 工程任务 | ||||||||
| SciCode [undeft] | 44.3 | 35.8 | 29.9 | 53.5 | 50.0 | 56.1 | ||
| MLE-Bench-Lite [undeff] | 43.9 | 34.9 | 34.9 | 62.1 | 63.6 | 72.7 | ||
| 科学研究 | ||||||||
| HLE w/ tools [undefh] | 47.6 | 36.2 | 32.0 | 54.0 | 48.2 | 52.2 | ||
| HiPhO [undefr] | 46.4 | 37.7 | 38.5 | 41.1 | 38.7 | 43.3 | ||
| FS-O [undefg] | 79.0 | 60.3 | 52.0 | 73.0 | 76.0 | 78.0 | ||
| FS-R [undefg] | 40.0 | 2.9 | 5.0 | 17.9 | 13.3 | 26.7 | ||
| 指令遵循 | ||||||||
| IFbench [undefq] | 80.6 | 64.4 | 54.1 | 71.8 | 73.5 | 75.9 | ||
| Longbench V2 [undefah] | 60.2 | 57.7 | 59.6 | 62.0 | 64.3 | - | ||
| 通用智能体任务 | ||||||||
| -Bench [undefab] | 79.8 | 79.0 | 74.5 | 81.9 | 82.2 | 81.6 | ||
| VitaBench [undefac] | 38.8 | 35.6 | 23.0 | 35.6 | 49.0 | 45.0 | ||
| 科学智能体任务 | ||||||||
| MatTools [undefak] | 47.1 | 15.9 | 34.1 | 63.8 | 47.1 | 68.8 | ||
| MolBench-Bind. [undefs] | 56.8 | 48.7 | 51.4 | 21.6 | 37.8 | 62.2 | ||
基于 Agents-A1-SFT 模型的多域路由在线策略蒸馏结果如表 9 所示。从表 9 可以看出,Agents-A1 是一个强大的 35B 级别模型,能够在许多困难任务上与规模大得多的 1T 级别模型竞争。Agents-A1 在同等规模的 35B 基线模型中表现优异,甚至在多步搜索、科学研究和长指令遵循方面超越了多个 1T 级别模型。我们发现,多步搜索、科学研究和长指令遵循的能力可以相互支撑。例如,在解决复杂科学问题时,提升模型使用外部工具(如搜索工具或代码工具)的能力,有助于模型在开放式任务中选择正确的工具,并更高效地获取外部知识。这进一步提升了其在科学研究任务上的表现。
此外,Agents-A1 在 SciCode 上达到 44.3,在 MLE-Bench-Lite 上达到 43.9,在这两项基准测试中均领先所有同等规模的 35B 基线模型。然而,它仍然明显弱于 1T 级别模型。例如,GPT-5.5 在 MLE-Bench-Lite 上达到了 72.7。我们认为这主要是因为 MLE 优化并非一个静态的问题求解任务,而是要求模型完成完整的工程流程。这对保持稳定的目标、记住过往决策以及避免在大量实验中重复尝试提出了更高的要求。
对于 -Bench,我们复现的 Qwen3.5-35B-A3B 基线模型得分低于 40。其他一些社区工作也报告了类似的问题 222https://github.com/thinking-machines-lab/tinker-cookbook/blob/main/tinker_cookbook/eval。我们认为这种差异可能源于 -Bench 代码库版本和评估环境的不同,这一话题在社区中也已有讨论 333https://github.com/QwenLM/Qwen3/discussions/1809。在 Vita、MatTools 和 MolBench-MS 结合亲和力任务上,我们观察到 Agents-A1 带来了一致的改进。
此外,表4展示了Agents-A1-SFT与Agents-A1(使用OPD训练)之间的性能对比。我们可以观察到,长指令遵循的思维模式与长周期搜索的思维模式截然不同。前者采用单轮长思考模式,而后者则采用多轮工具使用与短思考模式。由不同思维模式导致的全局域SFT阶段性能下降,可以通过多教师多域OPD阶段得到显著缓解。
通过对比表6、表7和表9,我们观察到经过OPD训练的模型并不总是优于对应的领域教师模型。这是符合预期的,因为每位教师都专精于一个领域,而Agents-A1需要在异构任务上维持统一的策略。在我们的实验设置中,OPD主要用于将教师优势迁移到单一模型中,并改善其在全局域SFT上的平衡性,而非在每个教师的专长领域上都持续超越它们。
基于上述实验观察,我们希望Agents-A1能够为社区提供一条清晰的技术路径,以统一更多样化的智能体场景和任务。此外,我们特别关注模型在长周期智能体任务上的表现。因此,我们将在下一节中通过几个长周期案例来分析Agents-A1的优势与局限。
5.3 长周期任务应用
5.3.1 一次12小时的长周期优化运行
为了评估 Agents-A1 在机器学习工程任务上的多步推理能力,我们从 MLE 数据集中选取了右鲸叫声检测任务作为代表性子任务,并要求模型在长时间运行中进行端到端优化。在此案例中,Agents-A1 从一个简单的 CNN 基线出发,通过一系列自主选择的干预措施持续改进流程,包括时序数据分析、音频增强、时序局部化训练、基于梅尔频谱图 CNN 集成的架构优化,以及大规模数据增强。在 12 小时的优化轨迹中,模型将最佳验证 AUC 从 0.58 逐步提升至 0.9935,最终达到了金牌级别的结果。
这个示例表明,Agents-A1 能够执行超越孤立超参数调优的长期模型优化。图 4 反映了多次迭代中一致的改进方向,识别出训练与测试记录之间存在有意义的时域偏移,并应用了有针对性的算法变更,从而显著提升了泛化性能。综合来看,这些结果表明,Agents-A1 能够整合数据集诊断、表征设计、增强策略以及迭代评估,为一项具有挑战性的真实世界机器学习任务生成可解释的多步骤优化方案。
5.3.2 利用 Agents-A1 在地球科学分析中实现闭环
为了评估 Agents-A1 在地球科学任务上的端到端分析能力,我们选取北印度洋上 2008 年严重气旋风暴纳尔吉斯作为代表性案例,要求模型根据真实最佳路径数据重建风暴轨迹、生成诊断可视化图表,并解读其路径和强度演变过程。在此次地球科学尝试中,Agents-A1 自动识别出 IBTrACS 作为数据源,并完成了数据提取、清洗、衍生指标计算、可视化以及结果综合,形成了一个涵盖规划、编码、执行、结果检查、科学分析与报告生成的多阶段闭环流程。
结果显示,Agents-A1 以合理的保真度重构了纳尔吉斯气旋的主要演变过程,包括其在孟加拉湾中部形成、向西北移动、随后转向东北偏东方向,以及最终在缅甸南部登陆。它进一步推导出诸如路径长度、移动速度、方向变化和强度演变等诊断量,同时保留了 WMO/IMD 和 JTWC/USA 的强度估算值,以避免混淆不同的业务惯例。图 5 总结了气旋路径、强度、位置、移动速度和方向变化的关键诊断结果,表明该案例为展示 Agents-A1 在地球科学数据组织、诊断计算和结果整合方面的能力提供了一个有参考价值的实例。
6 局限性与未来工作
在本工作中,我们介绍了一个 35B 参数的 MoE 模型 Agents-A1。我们的目标是探索一条通过扩展智能体交互轮次来构建智能体模型的有前景的技术路径。作为扩展智能体交互轮次的早期尝试,我们的模型所习得的智能体能力主要来源于三个方面:Qwen3.5-35B-A3B 的初始化基线能力、为不同长交互场景构建的统一基础知识-行动基础设施,以及一种能够减少不同领域推理模式之间冲突的领域路由在线策略蒸馏方法。
在我们从基线模型扩展智能体交互轮次的努力中,我们还发现,一些基础的原子能力对于在长交互任务求解过程中保持智能体的目标一致性和效率至关重要。这些能力包括:在推理前进行规划、在行动前进行反思、总结长上下文中的关键信息,以及识别重要的历史信息。在未来的工作中,我们将专注于提升长交互智能体的这些基础原子能力,并以此作为起点,进一步提高 Agents-A1 解决长流程任务的能力。
参考文献
- [undef] undef Kimi “Kimi K2.6: Advancing Open-Source Coding”,https://www.kimi.com/blog/kimi-k2-6,2026
- OpenAI “推出 GPT‑5.5”,https://openai.com/index/introducing-gpt-5-5,2026
- Anthropic “推出 Claude Opus 4.6”,https://www.anthropic.com/news/claude-opus-4-6,2026
- “Gemini 3 Pro - Google DeepMind” 网址:https://deepmind.google/models/gemini/pro/
- DeepSeek-AI “DeepSeek-V4:迈向高效百万级 Token 上下文智能”,2026
- Qwen “Qwen3.5:迈向原生多模态智能体”,https://qwen.ai/blog?id=qwen3.5,2026
- Jun Shern Chan 等人 “MLE-bench:评估机器学习智能体在机器学习工程方面的能力”,载于 arXiv 预印本 arXiv:2410.07095,2024
- OpenAI “FrontierScience:评估 AI 执行专家级科学任务的能力”,https://openai.com/index/frontierscience/,2026
- Long Phan 等人 “人类最后的考试”,载于 arXiv 预印本 arXiv:2501.14249,2025
- Jason Wei 等人 “Browsecomp:一个简单但富有挑战性的浏览智能体基准”,载于 arXiv 预印本 arXiv:2504.12516,2025
- Aohan Zeng 等人 “GLM-5:从氛围编码到智能体工程”,载于 arXiv 预印本 arXiv:2602.15763,2026
- Yifan Du 等人 “迈向长周期智能体多模态搜索”,载于 arXiv 预印本 arXiv:2604.12890,2026
- 智谱 AI “GLM-5.2:为长周期任务而生”,https://z.ai/blog/glm-5.2,2026
- Kimi 团队等人 “Kimi K2.5:视觉智能体智能”,载于 arXiv 预印本 arXiv:2602.02276,2026
- Weiwei Sun 等人 “通过上下文折叠扩展长周期大语言模型智能体”,载于 arXiv 预印本 arXiv:2510.11967,2025
- Jade Copet 等人 “CWM:一个用于世界模型代码生成研究的开放权重大语言模型”,载于 arXiv 预印本 arXiv:2510.02387,2025
- Thinh Pham 等人 “SealQA:提升搜索增强语言模型推理能力的标杆”,载于 arXiv 预印本 arXiv:2506.01062,2025
- Valentina Pyatkin 等人 “泛化可验证指令遵循”,载于《神经信息处理系统进展》第 38 卷,2026
- Fangchen Yu 等人 “HiPhO:(多模态)大语言模型在最新高中物理奥赛基准上与人类差距有多大?”,载于 arXiv 预印本 arXiv:2509.07894,2025
- [undefs] Lisheng Zhang 等人。“MolClaw:一种具有分层技能的自主智能体,用于药物分子评估、筛选与优化”,载于《arXiv 预印本》arXiv:2604.21937,2026 年
- [undeft] Minyang Tian 等人。“SciCode:由科学家策划的研究型编程基准”,载于《神经信息处理系统进展》第 37 卷,Curran Associates, Inc.,2024 年,第 30624–30650 页,DOI: 10.52202/079017-0963
- [undefu] Zongsheng Cao 等人。“Agents-K1:迈向智能体原生的知识编排”,载于《arXiv 预印本》arXiv:2606.13669,2026 年
- [undefv] Kevin Lu 与 Thinking Machines Lab。“在线策略蒸馏”,https://thinkingmachines.ai/blog/on-policy-distillation,载于《Thinking Machines Lab: Connectionism》,2025 年,DOI: 10.64434/tml.20251026
- [undefw] Yuqian Fu 等人。“重新审视在线策略蒸馏:经验性失败模式与简单修复”,载于《arXiv 预印本》arXiv:2603.25562,2026 年
- [undefx] Rushi Qiang 等人。“MLE-Dojo:赋能大语言模型智能体进行机器学习工程的交互式环境”,载于《arXiv 预印本》arXiv:2505.07782,2025 年
- [undefy] Shangheng Du 等人。“MLEvolve:用于自动化机器学习算法发现的自我进化框架”,载于《arXiv 预印本》arXiv:2606.06473,2026 年
- [undefz] undef NVIDIA。“NeMo Gym:用于扩展大语言模型强化学习环境的开源库”,GitHub 仓库,https://github.com/NVIDIA-NeMo/Gym,2025 年
- [undefaa] Wenting Zhao 等人。“WildChat:野外环境下的 100 万条 ChatGPT 交互日志”,载于《第十二届国际学习表征会议》,2024 年,URL: https://openreview.net/forum?id=Bl8u7ZRlbM
- [undefab] Victor Barres 等人。“-Bench:在双控环境中评估对话智能体”,2025 年,arXiv: https://arxiv.org/abs/2506.07982
- [undefac] Wei He 等人。“VitaBench:通过真实应用中的多样化交互任务对 LLM 智能体进行基准测试”,载于《arXiv 预印本》arXiv:2509.26490,2025 年
- [undefad] Zhihong Shao 等人。“Deepseekmath:突破开放语言模型数学推理的极限”,载于《arXiv 预印本》arXiv:2402.03300,2024 年
- [undefae] Zelin Tan 等人。“PAPO:通过解耦优势归一化稳定评分标准集成训练”,2026 年,arXiv: https://arxiv.org/abs/2603.26535
- [undefaf] Grégoire Mialon 等人。“Gaia:通用 AI 助手基准测试”载于《国际学习表征会议 2024》,2024 年,第 9025–9049 页
- [undefag] Kaiyuan Chen 等人。“xbench:通过面向职业的真实世界评估追踪智能体的生产力扩展”载于《arXiv 预印本 arXiv:2506.13651》,2025 年
- [undefah] Yushi Bai 等人。“Longbench v2:迈向对现实长上下文多任务的更深层次理解与推理”载于《第 63 届计算语言学协会年会论文集(第 1 卷:长论文)》,2025 年,第 3639–3664 页
- [undefai] Jeffrey Zhou 等人。“大语言模型的指令遵循评估”载于《arXiv 预印本 arXiv:2311.07911》,2023 年
- [undefaj] Aixin Liu 等人。“Deepseek-v3.2:推动开放大语言模型的前沿”载于《arXiv 预印本 arXiv:2512.02556》,2025 年
- [undefak] Siyu Liu 等人。“MatTools:面向材料科学工具的大语言模型基准测试”,2025 年 arXiv:https://arxiv.org/abs/2505.10852
- [undefal] undef ICML 2013 生物声学机器学习研讨会“挑战赛描述”,2013 年 URL:https://sabiod.lis-lab.fr/icml2013/challenge_description.html
- [undefam] Kenneth R. Knapp 等人。“国际气候管理最佳路径档案(IBTrACS):统一热带气旋最佳路径数据”载于《美国气象学会公报》,2010 年 DOI:10.1175/2009BAMS2755.1
- [undefan] J. Gahtan 等人。“国际气候管理最佳路径档案(IBTrACS)项目”载于《NOAA 国家环境信息中心》,2024 年 DOI:10.25921/82ty-9e16
- [undefao] undef 联合台风警报中心“2008 年年度热带气旋报告”,2008 年 URL:https://www.metoc.navy.mil/jtwc/products/atcr/2008atcr.pdf
- [undefap] undef NOAA 国家环境信息中心“IBTrACS v04r01 列文档”更新于 2025-09-23,2025 年 URL:https://www.ncei.noaa.gov/sites/default/files/2025-09/IBTrACS_v04r01_column_documentation.pdf
附录 A 附录
A.1 贡献与致谢
知识-行动基础设施:Zongsheng Cao222对本项目的关键贡献,Bihao Zhan,Zhijie Zhong
全领域 SFT:Yue Fan22footnotemark: 2,Tianshuo Peng
多教师 OPD:冯诗洋²²脚注标记: 2,谢毅,黄松涛
长周期搜索:彭天烁²²脚注标记: 2,钟志杰,石金鑫,马润民,袁嘉康,胡宇松,范悦
工程任务:严祥超²²脚注标记: 2,杜尚恒,张帅宇,赵俊鹏,石金鑫,吴一鸣,孙博远
科学研究:于方晨²²脚注标记: 2,唐圣基²²脚注标记: 2,刘卓,叶景琦,蒋逸尘,何浩南,林伟豪
指令遵循与上下文学习:何晓涵²²脚注标记: 2,黄松涛,钟志杰,冯诗洋
通用与科学工具调用:张逸群²²脚注标记: 2,张晨²²脚注标记: 2,李浩,杨晨,穆春江,崔志尧,王倩怡,谭泽林
评估与部署:周宇浩²²脚注标记: 2,石洛赫,马润民,彭浩洋,娄文杰,郭子杰
科学主管与顾问:张文龙,凌风华,李鑫,严腾,刘东瑞,张书飞,何亮,王晓松,叶鹏,胡舒悦,林达华,周博文
项目联合负责人:张波,zhangbo@pjlab.org.cn;白磊,bailei@pjlab.org.cn
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org