Thinking Machines Lab 用专家标注微调 Qwen3-235B,在金融判断任务上超越前沿模型
Learning to Replicate Expert Judgment in Financial Tasks
Thinking Machines Lab 与 Bridgewater AIA Labs 发布研究,用专家投资者标注的数据微调 Qwen3-235B,在六项金融信息筛选任务上平均准确率从最佳前沿模型的 78.2% 提升至 84.7%,推理成本降低 13.8 倍。
原文给出了完整的训练配方和消融数据,读者可以看到专家标注加微调如何在特定任务上超过前沿模型并大幅降低成本。
判断信息
跑赢市场很难。当每个投资者都能获取相同的公开信息源时,超额收益必须来自基于品味和判断力的独特洞见。一个优秀投资者的判断力很难被清晰地表达出来,也很难直接传授给他人,无论是人类还是 AI。它来自经验。
即使我们把投资者的工作分解成最简单的组成任务,这些任务对 LLM 来说也出奇地困难。在这篇文章中,我们考虑一个简单的特例:过滤和处理财务文档,以浮现与投资决策相关的信息。
投资者每天都被信息轰炸:新闻文章、研究报告、公司文件、电子邮件、内部报告等等。阅读是容易的部分。真正的工作是在其上进行的那些细小、重复的判断——过滤、解读、切分,并识别有用信号所在之处。这些判断嵌入在投资者日常工作流程的方方面面,并消耗大量时间。
我们想看看能否将信息分诊任务自动化:识别哪些内容相关且值得一读。仅此一项就能大幅提升投资者的生产力,让他们把释放出来的注意力花在更高层次的综合与决策上。
鉴于 LLM 在简单的金融任务上表现不佳,我们提出:是否有可能教会 LLM 金融判断力?我们发现,借助高质量的人工标注,我们可以教会 LLM 以专家级的品味和判断力来解读文本。我们的专有模型在信息准确率和召回率上优于我们测试过的所有前沿模型,而成本仅为它们的一小部分。
我们描述了我们的训练过程,以及在获准公开发布的一部分数据上的结果。基于我们的结果,我们进一步描述了一种差异化智能愿景的雏形,即为特定组织需求量身定制模型。
前沿模型表现
我们在取自投资者日常工作流程的六项信息过滤任务上评估了模型。除了这些任务之外,我们在内部还有许多其他任务,它们呈现出与这六项任务相似的模式:我们测试的前沿模型表现不如我们内部训练的模型。
我们衡量了准确率——即根据我们投资者的判断被正确标注的文档百分比。对于分类任务,我们还计算了 F1 分数。F-score(维基百科)。
01
金融文章相关性
给定一篇金融文章,分类它是否与一位 C-suite 投资专业人士相关。
评估指标
F1 分数、准确率
02
央行文档相关性
给定一份央行文档,分类它是否预示未来利率变化的方向。
评估指标
F1 分数、准确率
03
通用文档相关性
给定一位投资者的问题和一份研究文档,分类该文档是否有助于回答它。
评估指标
F1 分数、准确率
04
临时内容标注
研究文档要么是重复性的(重复的样板内容),要么是混合性的(样板内容加上一次性的、针对特定议题的分析)。分类属于哪一种,并找出针对特定议题内容的最后一页。
评估指标
准确率
05
文档截断
识别文档中样板内容开始的位置。
评估指标
精确匹配准确率
06
电子邮件截断
识别电子邮件中样板内容开始的位置。
评估指标
精确匹配准确率
这些任务对投资者来说微不足道,但当他们阐述自己的决策过程时却会卡壳。请看下面这个将新闻文章归类为与投资专业人士相关的示例:
不相关
特朗普坚称格陵兰岛是他的

© Jeremy Banx
相关
特朗普威胁对中国加征新关税后美股大幅收低

标普500指数创下自4月以来的最大单日跌幅,令持续数周的涨势戛然而止 © AFP/Getty Images
考虑到文章的背景,格陵兰岛的例子不太可能被认真对待,而中国关税的例子则高度相关。然而这两个例子都涉及地缘政治和金融。
与我们测试的投资者相比,前沿模型的表现出奇地差。当给出一段简单陈述六项待执行任务的提示词时,Gemini、Claude 和 GPT 的各个变体平均准确率仅为约50%。
我们首先尝试通过更强的提示词来提升 LLM 的表现。我们的专家根据真实的任务描述撰写了指令,并建议重新表述某些任务。例如,虽然一篇关于小型 IPO 的文章显然具有金融相关性,但它缺乏那种能让 Bridgewater 的宏观经济投资者感兴趣的广泛重要性。当要求 LLM 将新闻故事分为三个标签——相关且有趣、相关但无趣、不相关——时,它们在文章分类任务上的表现有所提升。
这些改动将它们的准确率从抛硬币般的水平提升到了70%多。我们没有从自动提示词优化方法中看到准确率的进一步提升。即便使用我们最好的提示词,所测试的前沿模型准确率仍低于80%——这是投资者期望一个能在日常工作流程中信赖的系统所应达到的门槛。
47.2
77.2
50.1
74.3
47.2
75.8
48.5
78.2
45.6
78.0
我们的结果还表明,较新的模型在这项任务上并没有快速提升,尤其是按每美元花费计算。GPT 5.4 比 5.2 贵43%,但准确率仅略有提高。
显式的提示词只能传达专家能够用语言表达出来的直觉,而最重要的判断往往最难言说。微调则绕开了这一问题:与其将专家的直觉扭曲成一段静态的提示词,训练过程让模型发展出自己的判断力。我们能否训练开放权重模型,使其在这些任务上超越我们所测试的前沿模型?
训练数据集构建
训练自定义模型的第一个挑战是获取一个能体现高质量投资者品味的数据集。尤其是,许多信息只有经过投资专业人士的判断过滤后才有用。
我们最初从提供非专家标注的供应商那里获取了一个数据集。在该数据集上训练的模型表现依然很差。在检查模型的推理轨迹后,我们意识到数据集中的标签往往是错误的。由于专家标注员成本高昂,我们设计了一套验证方案,只将有争议的样本交给专家处理。
该方案的工作方式如下:我们在来自非专家标注者的数据集上训练了一个模型,然后在同一数据上进行评估。模型答案与标注者不一致的样本被发送给我们的专家重新评估——如果模型无法匹配其自身训练集中的某个样本,那么要么该样本确实很难,要么原始标签是错误的。此流程被用于清洗训练集数据;最终评估是在留出的测试集上进行的。
训练配方
我们在 Thinking Machines Lab 的 Tinker 上训练了我们的模型。Tinker。 Tinker 使我们能够快速迭代,而无需担心 GPU 基础设施。
我们选择 Qwen3-235B 作为基础模型,因为其微调性能在学术文献中被广泛研究。
我们从标准的 GRPO 和重要性采样损失开始,作为一个简单、无需 critic 的起点。这种基线方法使模型性能大幅提升,但仍未达到我们期望的 80% 阈值。
| 模型 / 训练 | 平均准确率 | 平均 Pos F1 |
|---|---|---|
| Qwen 基础模型 | 44.8% | 55.24% |
| Qwen + GRPO | 73.48% | 88.95% |
我们对训练配方做了以下修改,以进一步推动性能提升:
1. 交错批处理
对于我们的多任务训练配方,我们比较了三种批处理策略:按顺序训练每个任务、在一个批次内完全混合任务,以及按轮转顺序为每个任务交错一个批次。我们发现交错效果最好,相比完全混合批次将准确率提高了 12.1%。
2. 带非对称裁剪的 CISPO 损失
我们使用带非对称裁剪的 CISPO 损失带非对称裁剪的 CISPO 损失(arXiv)。来替代标准的重要性采样损失。在我们尝试过的损失函数和裁剪方案中,这一方案表现最好,相比重要性采样基线将准确率提高了 10.1%。
3. 使用强教师的同策略蒸馏
我们使用同策略蒸馏On-Policy Distillation,Kevin Lu 与他人合作(Thinking Machines)。(OPD)进行训练,并按如下方式构造优势:
r=reward−β⋅avg(student_lp−teacher_lp) advi=ri−avg(r)
当学生偏离教师的分布时,奖励会受到惩罚,从而在学习任务的同时对策略进行正则化。
每 20 步,我们将当前检查点提升为教师——但仅当验证准确率达到新高时才这样做,因此我们绝不会向更弱的模型蒸馏。相比冻结的基础模型教师,这又带来了 3.1% 的提升。
结果
找到最优训练配方需要多次迭代不同方法。Tinker 的易用性使我们能够快速进行实验并改进我们的方法。
我们训练后的模型将平均准确率从 78.2% 提升到 84.7%,这意味着训练后的模型比我们评估的最佳前沿模型少犯 29.8% 的错误。我们发现这一准确率水平足以满足我们的日常工作。
由于规模更小,我们训练后的模型成本也大幅降低:每个任务的推理成本降低了 13.8 倍。由于我们计划依赖更多为特定任务训练以提供帮助的模型,并在整个组织内扩展 AI,成本是一个重要考虑因素。
我们对训练配方的每个部分进行了消融,以展示每个部分对性能的贡献。
| 训练方法消融 | 平均准确率 | 平均位置 F1 |
|---|---|---|
| Qwen + 最终配方 | 84.66% | 92.99% |
| 交错批处理 | 72.18% | 89.01% |
| CISPO + 非对称裁剪 | 74.56% | 90.64% |
| OPD | 72.39% | 87.93% |
| 使用最佳验证准确率教师的 OPD | 81.55% | 89.41% |
结论
我们测试的前沿模型在相对简单的金融任务上表现吃力,而且模型的进步对性能提升不大。相比之下,我们已经证明,由专家投资者标注并用于微调的高质量专有数据集所产出的定制模型,在我们的任务上超越了前沿模型的性能。我们发现,这一结果远不止适用于本文讨论的六个任务。
除了更高的准确率,定制模型的成本也大幅降低。我们预计未来定制模型训练将带来更多生产力提升,尤其是在像 Tinker 这样支持快速实验的训练基础设施可用的情况下。
我们的结果表明,未来可能出现差异化智能,即为特定组织需求定制的模型将超越前沿模型。
引用
请按如下方式引用本工作:
Su, Sarah; Zhu, Kevin; Xiao, Emily; Alur, Rohan; Kang, Daniel (Bridgewater AIA Labs), "Learning to replicate expert judgment in financial tasks",
Thinking Machines Lab: News, June 2026.或使用 BibTeX 引用:
@article{su2026expertjudgment,
author = {Sarah Su, Kevin Zhu, Emily Xiao, Rohan Alur, Daniel Kang (Bridgewater AIA Labs)},
title = {Learning to replicate expert judgment in financial tasks},
journal = {Thinking Machines Lab: News},
year = {2026},
note = {https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/}
}来源:Thinking Machines Lab:News(网页) · thinkingmachines.ai