@miramurati:Bridgewater利用其独特的金融知识,与我们及@tinkerapi合作,微调了一个模型,帮助……

X AI KOLs Following 模型

摘要

Bridgewater与Tinker API合作,微调了一个大语言模型,以在金融任务中复现专家判断,在信息准确性和召回率上以更低成本超越了前沿模型。

Bridgewater利用其独特的金融知识,与我们及@tinkerapi合作,微调了一个模型,帮助其分析师专注于重要事项。专家改进AI,AI赋能专家。 https://t.co/6RJITMG2BJ
查看原文
查看缓存全文

缓存时间: 2026/06/30 21:53

Bridgewater 利用其独特的金融知识,与我们 @tinkerapi 合作,微调了一个模型,帮助其分析师专注于重要事项。专家赋能 AI,AI 赋能专家。 https://t.co/6RJITMG2BJ


学习在金融任务中复制专家判断

来源:https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/

判断信息

跑赢市场很难。当每个投资者都能获得相同的公开信息来源时,alpha 必须来自建立在品味和判断之上的独特洞察。优秀投资者的判断力难以言传,更无法直接教给他人,无论是人类还是 AI。它源于经验。

即使我们将投资者的工作分解成最简单的构成任务,这些任务对大型语言模型来说也出奇地困难。在这篇文章中,我们考虑一个简单的特例:过滤和处理金融文档,以提取与投资决策相关的信息。

投资者每天都被信息轰炸:新闻文章、研究报告、公司文件、电子邮件、内部报告等等。阅读是容易的部分。真正的工作是贯穿其中的大量重复性判断——过滤、解读、分段、识别有用信号所在。这些判断嵌入在投资者的日常工作流中,消耗了大量时间。

我们想看看能否自动化信息分诊任务:识别什么是相关且值得阅读的。仅此一点就能极大地提升投资者的生产力,让他们将释放出的注意力用于更高层次的综合和决策。

鉴于大型语言模型在简单的金融任务上表现不佳,我们提出一个问题:能否教会大型语言模型金融判断?我们发现,通过高质量的人类标注,我们可以教会大型语言模型以专家水平的品味和判断来解读文本。我们专有的模型在信息准确性和召回率上超越了所有我们测试过的前沿模型,而成本仅为它们的几分之一。

我们描述了在已获准公开发布的数据子集上的训练过程和结果。基于我们的结果,我们进一步描绘了一种差异化智能愿景的雏形,即针对特定组织需求定制的模型。

前沿模型表现

我们根据投资者的日常工作流,在六个信息过滤任务上评估了模型。除了这些任务,我们在内部还有许多其他任务,显示出与这六个任务相似的模式:我们测试的前沿模型表现低于我们内部训练的模型。

我们衡量了准确率——根据我们的投资者判断,正确标记的文档百分比。对于分类任务,我们还计算了 F1 分数。

01

金融文章相关性

给定一篇金融文章,判断其是否与一位 C 级投资专业人士相关。

评估指标

F1 分数,准确率

02

央行文档相关性

给定一份央行文档,判断其是否预示未来利率变化方向。

评估指标

F1 分数,准确率

03

通用文档相关性

给定投资者的一个问题及一份研究文档,判断该文档是否有助于回答该问题。

评估指标

F1 分数,准确率

04

临时内容标注

研究文档要么是重复性的(重复的模板内容),要么是混合性的(模板内容加上一次性的、针对特定议题的分析)。判断属于哪种,并找出议题特定内容的最后一页。

评估指标

准确率

05

文档截断

识别文档中模板内容开始的位置。

评估指标

精确匹配准确率

06

邮件截断

识别邮件中模板内容开始的位置。

评估指标

精确匹配准确率

本博文中评估的六个金融任务,每个都来自投资者的日常工作。这些任务对投资者来说轻而易举,但他们在阐述自己的决策过程时会卡住。考虑下面将新闻文章分类为是否与投资专业人士相关的例子:

不相关

ft.com (https://www.ft.com/content/e021f12b-d2a0-4637-ac0f-4e3dae5a8843)

特朗普坚称格陵兰是他的

一篇关于特朗普和格陵兰的文章的插图。

© Jeremy Banx

相关

ft.com (https://www.ft.com/content/b9ae2417-2e89-4b0a-bad5-d94f4e980ecc?syn-25a6b1a6=1)

特朗普威胁对中国加征新关税后,美国股市大幅收低

交易员在股市大跌时在交易大厅的反应。

标普500指数自4月以来最大单日跌幅,结束了持续数周的涨势 © AFP/Getty Images

判断一篇金融文章与美国市场相关性的示例。来源:金融时报。考虑到文章的背景,格陵兰的例子不太可能被认真对待,而中国关税的例子则高度相关。然而这两个例子都涉及地缘政治和金融。

与我们投资者相比,我们测试的前沿模型表现得出奇地差。Gemini、Claude 和 GPT 的变体在仅给出六个任务的简单提示时,平均准确率仅约 50%。

我们首先尝试通过更强的提示来提升大型语言模型的性能。我们的专家根据实际任务描述编写了指令,并建议重新构思某些任务。例如,虽然一篇关于小型首次公开募股的文章明显具有金融相关性,但它缺乏那种能引起桥水基金宏观投资者兴趣的广泛意义。当要求大型语言模型将新闻故事分为三个标签时,文章分类任务的性能得到了提升:相关且有趣、相关但不有趣、不相关。

这些改动将其准确率从抛硬币的水平提升到了 70% 左右。我们通过自动提示优化方法未能进一步提升准确率。使用我们最好的提示,我们测试的前沿模型在投资者期望的日常工作中可信赖系统应达到的 80% 准确率阈值上仍未达标。

经过手动和自动提示工程后,前沿模型在我们金融任务上的准确率和正类 F1 分数。F1 分数是我们三个分类任务的平均值,准确率是所有六个任务的平均值。我们的结果还表明,较新的模型在这项任务上改进并不快,尤其是考虑到成本支出。GPT 5.4 比 5.2 贵 43%,但准确率仅略有提高。

一个明确的提示只能传达专家能用言语表达的直觉,而最重要的判断往往最难言明。微调绕过了这一点:训练过程让模型发展自己的判断,而不是将专家的直觉扭曲成一个静态提示。我们能否训练开放权重模型,使其在这些任务上超越我们测试的前沿模型?

训练数据集构建

训练自定义模型的第一个挑战是获取一个反映高质量投资者品味的数据集。特别是,许多信息只有通过投资专业人士的判断进行过滤后才有用。

我们最初从提供非专家标注的供应商处获取了一个数据集。在此数据集上训练的模型仍然表现不佳。在检查模型的推理痕迹后,我们意识到数据集中标签通常是错误的。由于专家标注员成本高昂,我们设计了一个验证方案,仅将有争议的样本交由专家处理。

该方案的工作原理如下:我们在非专家标注的数据集上训练一个模型,然后在同一数据上评估它。模型答案与标注员不同的样本被发送给我们的专家进行重新评估——如果模型无法匹配来自其自身训练集的样本,那么要么样本确实困难,要么原始标签是错误的。此过程用于清理训练集数据;最终评估在保留的测试集上进行。

训练配方

我们在 Thinking Machines Lab 的 Tinker 上训练了我们的模型。Tinker 使我们能够快速迭代,而无需担心 GPU 基础设施。

我们选择 Qwen3-235B 作为基础模型,因为其微调性能在学术文献中被广泛研究。

我们从标准的 GRPO 和重要性采样损失开始,作为一个简单的、无批评者的起点。这种基线方法带来了模型性能的巨大提升,但距离我们期望的 80% 阈值仍有差距。

模型/训练平均准确率平均正类 F1分数Qwen 基础44.8%55.24%Qwen + GRPO73.48%88.95%为进一步提升性能,我们对训练配方做了如下修改:

1. 交错批处理

对于我们的多任务训练配方,我们比较了三种批处理策略:依次训练每个任务、任务完全混合在一个批次内、以及以轮询方式交错每个任务的一个批次。我们发现交错训练效果最好,相比完全混合的批次,准确率提高了 12.1%。

2. 带非对称裁剪的 CISPO 损失

我们使用了带非对称裁剪的 CISPO 损失来替代标准的重要性采样损失。在我们尝试的各种损失函数和裁剪方案中,这种方法表现最佳,相比重要性采样基线,准确率提高了 10.1%。

3. 基于策略的蒸馏与强教师

我们使用基于策略的蒸馏进行训练,构造优势如下:

r = \text\{奖励\} - \beta \cdot \operatorname\{avg\}\(\text\{学生\_lp\} - \text\{教师\_lp\}\) \text\{adv\}\_i = r_i - \operatorname\{avg\}\(r\)

当学生偏离教师分布时,奖励会受到惩罚,从而在学习任务的同时对策略进行正则化。

每 20 步,我们将当前检查点提升为教师——但只有当验证准确率达到新高度时才这样做,这样我们永远不会向更弱的模型蒸馏。这比使用冻结的基础模型教师带来了额外的 3.1% 增益。

结果

找到最佳训练配方需要多次尝试不同的方法。Tinker 的可访问性使我们能够快速运行实验并完善方法。

我们训练的模型与前沿模型的准确率与价格对比。我们的模型在两代产品上都在两个维度上优于前沿模型。我们训练的模型将平均准确率从 78.2% 提高到 84.7%,这意味着训练后的模型比我们评估过的最佳前沿模型少犯 29.8% 的错误。我们发现这个准确率水平足以满足我们的日常工作。

由于规模更小,我们训练的模型也便宜得多:每个任务的推理成本降低了 13.8 倍。随着我们计划更多依赖训练来帮助完成特定任务的模型,并在整个组织中扩展 AI,成本是一个重要的考量因素。

我们对训练配方的每个部分进行了消融,以展示各部分对性能的贡献。

训练方法消融平均准确率平均正类 F1分数Qwen + 最终配方84.66%92.99%交错批处理72.18%89.01%CISPO + 非对称裁剪74.56%90.64%基于策略的蒸馏72.39%87.93%基于策略的蒸馏 w/ 最佳验证准确率教师81.55%89.41%每一行显示移除了该单个组件后的最终配方(留一法消融)

结论

我们测试的前沿模型在处理相对简单的金融任务时表现挣扎,而且模型进步对性能提升不大。相比之下,我们证明了高质量专有数据集,由专家投资者标注并用于微调,能够产生在任务上超越前沿性能的自定义模型。我们发现,这一结果远远超出了本文讨论的六个任务。

除了更高的准确率,自定义模型也便宜得多。我们预计未来通过自定义模型训练将获得更多的生产力提升,尤其是有了像 Tinker 这样能够进行快速实验的训练基础设施。

我们的结果展示了一种差异化智能未来的可能性,即针对特定组织需求定制的模型能够超越前沿模型。

引用

请按以下方式引用本文:

Su, Sarah; Zhu, Kevin; Xiao, Emily; Alur, Rohan; Kang, Daniel (Bridgewater AIA Labs), "Learning to replicate expert judgment in financial tasks", Thinking Machines Lab: News, June 2026.

或使用 BibTeX 引用:

@article{su2026expertjudgment, author = {Sarah Su, Kevin Zhu, Emily Xiao, Rohan Alur, Daniel Kang (Bridgewater AIA Labs)}, title = {Learning to replicate expert judgment in financial tasks}, journal = {Thinking Machines Lab: News}, year = {2026}, note = {https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/} }

相似文章