金融新闻自然语言处理中的时间泄漏:基于特定模式的并购信号的多架构审计

arXiv cs.CL 论文

摘要

本文审计了多个模型在金融新闻自然语言处理基准中的时间泄漏,发现随机划分会夸大性能指标,并确定并购事件是在时序评估下具有局部正向信号的一个类别。

arXiv:2608.17223v1 公告类型:新 摘要:金融新闻方向预测已成为一个流行的自然语言处理基准,但报告的收益关键取决于训练-测试划分是时序的还是随机的,即取决于时间泄漏。我们基于一个包含49,799篇文章的语料库,对16种特征-模型组合进行了审计,这些组合涵盖了TF-IDF、MiniLM、FinBERT以及微调的RoBERTa-large / DeBERTa-v3-large,另外还有对Llama-3和Qwen2.5大语言模型的独立零样本/少样本和LoRA探测:随机划分使MCC夸大了$1.1\times$到$6.5\times$,这与模型容量和特征丰富度相关,并且端到端FinBERT微调重新放大而非缩小了差距(大小匹配比率$1.75\times$)。以事件类型为条件,并购(M&A)是唯一一个在时序评估下具有正向固定测试信号的审计类别(TF-IDF MCC $= 0.138$ 仅训练集,$0.068$ 在训练$\cup$验证集重拟合下;10,000次置换 $p < 10^{-3}$);该信号并未转移到FNSPID的2009-2020年美国语料库,将信号本地化到我们2024-2025年偏向欧洲的并购语义中,而非一个通用预测器。三个独立的角色标注者收敛于将收购方标记的文章作为信号位置,这是一种功率有限的定性收敛,而非假设检验的不对称性。时序划分在金融自然语言处理中扮演的角色类似于特征净化在资产定价中的角色:它剥离了新闻中可预测的、过时的部分,留下一个小、事件局部化、词汇浅显的残差。我们倡导将泄漏审计作为金融自然语言处理基准的必要披露。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:53

# 金融新闻NLP中的时间泄露:基于特定市场状态并购信号的多架构审计
来源:https://arxiv.org/html/2608.17223
Raslen Guesmi*  隶属机构:Predictive Labs Ltd
Siwei Feng  隶属机构:Predictive Labs Ltd
Yucheng Gong  隶属机构:Predictive Labs Ltd
  隶属机构:帝国理工学院
Jacob Xavier Sundram  隶属机构:Predictive Labs Ltd
  隶属机构:帝国理工学院
Jordan Pang  隶属机构:Predictive Labs Ltd
  隶属机构:帝国理工学院
Lan Wang  隶属机构:独立研究员
Julian Kaljuvee*  隶属机构:Predictive Labs Ltd

###### 摘要
金融新闻方向预测已成为一个流行的NLP基准测试,然而其报告的性能提升关键取决于训练-测试集的划分是按时间顺序进行还是随机进行,即是否涉及时间泄露。我们在一个包含49,799篇文章的语料库上,针对跨越TF-IDF、MiniLM、FinBERT和微调的RoBERTa-large / DeBERTa-v3-large的16种特征-模型组合,以及Llama-3和Qwen2.5大语言模型的独立零样本/少样本和LoRA探针,审计了这种依赖性。随机划分将马修斯相关系数(MCC)夸大了1.1倍至6.5倍,其程度与模型容量和特征丰富度相关;而端到端的FinBERT微调非但没有缩小差距,反而重新放大了差距(规模匹配的比率为1.75倍)。在考虑事件类型时,只有并购(M&A)这一审计类别在近乎严格的时间顺序评估下,于锁定的测试集上显示出正向信号(TF-IDF MCC=0.138,仅在训练集上训练;在训练集∪验证集上重拟合后为0.068;10,000次置换检验p<10^-3)。该信号无法迁移至FNSPID的2009-2020年美国语料库,表明该发现局限于我们2024-2025年偏向欧洲市场的并购语义,而非一个普适的预测因子。三个独立的角色标注者一致认为,被收购方标签的文章是信号所在区域,这是一种受限于统计功效的定性趋同,而非经假设检验的不对称性。时间顺序划分在金融NLP中扮演的角色,类似于特征清洗在资产定价中的作用:它剥离了新闻中可预测的、陈旧的部分,留下的是微弱的、事件局部化的、词汇层面浅显的残差。我们倡导将泄露审计作为金融NLP基准测试的强制性披露项。

## 1 引言
### 1.1 动机:金融新闻预测作为NLP基准
金融新闻方向预测是NLP与金融交叉领域最具争议的经验基准之一:其文本理解能力是通过与经济基础的结果信号进行检验的。十年来的工作,涵盖了结构化事件嵌入(12 (https://arxiv.org/html/2608.17223#bib.bib1); 13 (https://arxiv.org/html/2608.17223#bib.bib2))、针对推文和价格的循环模型(49 (https://arxiv.org/html/2608.17223#bib.bib3); 23 (https://arxiv.org/html/2608.17223#bib.bib17))、领域自适应语言模型(1 (https://arxiv.org/html/2608.17223#bib.bib4); 53 (https://arxiv.org/html/2608.17223#bib.bib5))以及基于大语言模型的方法(31 (https://arxiv.org/html/2608.17223#bib.bib23); 28 (https://arxiv.org/html/2608.17223#bib.bib12); 45 (https://arxiv.org/html/2608.17223#bib.bib13); 47 (https://arxiv.org/html/2608.17223#bib.bib47)),产生了一种乐观的叙事:每篇论文报告的方向准确率数字在50%多到60%多之间(例如,在StockNet推文上58.2%的二分类准确率(49 (https://arxiv.org/html/2608.17223#bib.bib3));标准普尔500指数方向准确率64.2% (13 (https://arxiv.org/html/2608.17223#bib.bib2)))。这个前提值得认真对待,但证据并非如此。金融NLP存在一个结构性的脆弱性:新闻文章、公司身份、市场状态和回报标签在时间上是联合自相关的,而现代语言模型会利用这种结构。在一年中随机一半的金融新闻上训练的模型,会吸收与其测试集*相同市场周期*的词汇表、实体图谱和回报相关性:这种状态记忆在性质上不同于样本内过拟合。随机划分将来自2024年初AI上涨、2024年底利率转向或2025年欧洲并购浪潮的个别文章留作测试集,会让分类器利用在前瞻性时间顺序测试中不可用的状态上下文线索。这一问题在金融机器学习(30 (https://arxiv.org/html/2608.17223#bib.bib9); 2 (https://arxiv.org/html/2608.17223#bib.bib44); 25 (https://arxiv.org/html/2608.17223#bib.bib10); 22 (https://arxiv.org/html/2608.17223#bib.bib37); 5 (https://arxiv.org/html/2608.17223#bib.bib38))以及NLP评估(17 (https://arxiv.org/html/2608.17223#bib.bib53); 41 (https://arxiv.org/html/2608.17223#bib.bib52); 34 (https://arxiv.org/html/2608.17223#bib.bib54); 7 (https://arxiv.org/html/2608.17223#bib.bib35))中已有详细记录,然而这两个领域的文献尚未在整个NLP架构到特征的流程中大规模地联系起来。本文弥合了这一差距。我们在一个49,799篇文章的语料库(2020-2025年,81%来自2025年)上审计了16种架构-特征条件,涵盖了从TF-IDF到微调的DeBERTa-v3-large,以及针对指令微调的Llama-3和Qwen2.5的独立零样本/少样本和LoRA探针,在成对的随机和时间顺序划分下进行。审计比率从1.1倍到6.5倍不等,并随模型容量增长:文献中最引人注目的结果是被夸大最严重的。然而,本文并非一概否定:并购(M&A)是唯一在时间顺序评估下,于锁定的测试集上显示出近乎正向信号的审计事件类型(TF-IDF MCC=0.138, p<10^-3),并且定性上(尽管尚未在统计上)与三个独立角色标注者标注的收购方侧定位相关(§8 (https://arxiv.org/html/2608.17223#S8))。该信号无法迁移至FNSPID的2009-2020年美国语料库,表明该发现局限于我们2024-2025年偏向欧洲市场的并购语义。时间顺序划分在金融NLP中扮演的角色,类似于特征清洗在资产定价(10 (https://arxiv.org/html/2608.17223#bib.bib11))中的作用:它并非稳健性检查,而是主要的评估方式。

### 1.2 核心研究问题
本文提出四个相互关联的问题:
1. 在现代NLP架构和特征堆栈中,随机划分与时间顺序划分之间的泄露差距有多大?
2. 是否有任何通用的新闻到回报信号能在严格的时间验证下幸存?
3. 在考虑事件类型时,信号是否可恢复,以及是哪些事件类型?
4. 驱动任何幸存信号的机制是什么?

### 1.3 主要发现
1. 泄露真实存在,但在不同架构间不均衡。在16种特征-模型组合中(13种特征×分类器交叉加上3种端到端微调的Transformer),随机划分的MCC大约比时间顺序划分的MCC高出1倍至6.5倍(10次种子平均);对于在丰富特征上的高容量非线性模型,差距最大。
2. 在时间验证下,通用预测近乎随机。最强的时间模型(FinBERT+LR)达到测试集MCC=0.060;端到端微调的FinBERT、RoBERTa-large和DeBERTa-v3-large标题分类器的时间MCC上限为≤0.06。
3. 并购是唯一在时间顺序锁定测试集上显示出正向信号的事件类型。在锁定的测试集(n=786)上,使用来自360个单元格网格的验证集选择超参数,TF-IDF MCC=0.138,10,000次置换检验z=3.81,双尾p<10^-3;每周块自助法95%置信区间=[+0.066, +0.205]。
4. 并购信号定性上偏向收购方文章,但统计功效有限。正则表达式收购方MCC=0.160(n=125,双尾p=0.141);独立的命名实体识别+依存句法分析收购方MCC=0.221(n=84,双尾p=0.083);两者ΔMCC的95%置信区间均跨越零,因此我们将其作为经三角测量的定性证据而非经假设检验的结果进行报告。
5. 在EDT上的定义匹配验证;在FNSPID上为零结果。在EDT(54 (https://arxiv.org/html/2608.17223#bib.bib14))上使用狭窄的并购关键词重现了清晰的信号(MCC=0.097;定义敏感性诊断,与我们事件标签的设计相匹配)。在FNSPID 2009-2020年美国跨语料库探针中,测试集规模n_test=4,235,结果为干净的零结果(附录J.2 (https://arxiv.org/html/2608.17223#A10.SS2)),将结果定位到我们2024-2025年偏向欧洲市场的并购语义。

### 1.4 贡献
- • **方法论:** 一个多架构时间泄露审计框架,量化了泄露程度作为模型容量和特征丰富度函数的膨胀。
- • **实证:** 证据表明,在时间顺序评估下,通用金融新闻预测近乎随机,仅从领域自适应(FinBERT)嵌入中获得微小恢复。
- • **机制:** 识别并购是唯一具有近乎时间顺序锁定测试信号的事件条件子集;涉及交易语义且定性上偏向收购方,但统计功效有限(标注者三角测量,§8 (https://arxiv.org/html/2608.17223#S8));具有市场状态特异性(在FNSPID跨语料库上为零结果,在EDT上定义匹配)。

## 2 相关工作
##### 基于事件的股票预测。 12 (https://arxiv.org/html/2608.17223#bib.bib1); 13 (https://arxiv.org/html/2608.17223#bib.bib2)提出了来自新闻的神经事件嵌入;49 (https://arxiv.org/html/2608.17223#bib.bib3)提出了StockNet,基于推文和价格。后续工作增加了端到端新闻+价格模型(44 (https://arxiv.org/html/2608.17223#bib.bib18))、混合注意力(23 (https://arxiv.org/html/2608.17223#bib.bib17))、图卷积公司间关系(8 (https://arxiv.org/html/2608.17223#bib.bib19); 37 (https://arxiv.org/html/2608.17223#bib.bib16))、用于波动率的层次化Transformer(52 (https://arxiv.org/html/2608.17223#bib.bib42))以及自监督增强(40 (https://arxiv.org/html/2608.17223#bib.bib43))。这些工作通常依赖随机划分或弱控制划分;我们在严格的时间验证和203个事件类型的分类体系下重新审视这一前提。

##### 金融情感、领域语言模型和金融大语言模型。 32 (https://arxiv.org/html/2608.17223#bib.bib6); 33 (https://arxiv.org/html/2608.17223#bib.bib28)引入了Loughran–McDonald词典;早期工作研究了修辞特征和基于词典的预测(21 (https://arxiv.org/html/2608.17223#bib.bib33); 42 (https://arxiv.org/html/2608.17223#bib.bib29); 38 (https://arxiv.org/html/2608.17223#bib.bib34))。FinBERT(1 (https://arxiv.org/html/2608.17223#bib.bib4); 53 (https://arxiv.org/html/2608.17223#bib.bib5))将BERT应用于金融文本;39 (https://arxiv.org/html/2608.17223#bib.bib24)整理了FOMC语料库。领域大语言模型激增:46 (https://arxiv.org/html/2608.17223#bib.bib20), 51 (https://arxiv.org/html/2608.17223#bib.bib21), 48 (https://arxiv.org/html/2608.17223#bib.bib22);31 (https://arxiv.org/html/2608.17223#bib.bib23)表明ChatGPT可以从标题预测次日回报。19 (https://arxiv.org/html/2608.17223#bib.bib25)形式化了DAPT/TAPT(3 (https://arxiv.org/html/2608.17223#bib.bib26); 27 (https://arxiv.org/html/2608.17223#bib.bib27))。我们对FinBERT、RoBERTa-large和DeBERTa-v3-large的GPU微调量化了该范式在短窗口新闻稿上的时间顺序评估差距。

##### 媒体、信息和资产价格。 43 (https://arxiv.org/html/2608.17223#bib.bib7)表明媒体悲观情绪可以预测价格反转;35 (https://arxiv.org/html/2608.17223#bib.bib30)从新闻中为灾难风险定价;26 (https://arxiv.org/html/2608.17223#bib.bib31)构建了一个基于文本的因子;16 (https://arxiv.org/html/2608.17223#bib.bib32)综述了经济学中的文本数据。对于并购,24 (https://arxiv.org/html/2608.17223#bib.bib8)记录了有利于被收购方的财富效应;我们的收购方侧不对称性(§8 (https://arxiv.org/html/2608.17223#S8))在定性上与这种教科书直觉对于从文本预测短期回报方向的情况相悖,尽管统计功效有限。10 (https://arxiv.org/html/2608.17223#bib.bib11)提供了一个统一框架:约10%的新闻内容可从股票特征预测,在“清洗”掉可预测部分后,新闻冲击可预测长达18个月的回报,其中并购是最强的主题之一;时间顺序划分实现了这种清洗逻辑的一个更粗略的版本(表2 (https://arxiv.org/html/2608.17223#S4.T2)中的审计差距ΔMCC衡量了清洗所剥离的、可由时间和特征预测的部分)。

##### 时间泄露与近期的NLP-金融工作。 30 (https://arxiv.org/html/2608.17223#bib.bib9)形式化了净化K折交叉验证;2 (https://arxiv.org/html/2608.17223#bib.bib44)描述了多重检验下的回测过拟合;5 (https://arxiv.org/html/2608.17223#bib.bib38); 22 (https://arxiv.org/html/2608.17223#bib.bib37)整理了时间顺序评估建议;25 (https://arxiv.org/html/2608.17223#bib.bib10)记录了基于机器学习的科学研究中普遍存在的泄露。在统计方面,7 (https://arxiv.org/html/2608.17223#bib.bib35); 6 (https://arxiv.org/html/2608.17223#bib.bib36)强调了统计功效不足的NLP比较以及种子/打乱方差问题;15 (https://arxiv.org/html/2608.17223#bib.bib41)综述了因果推断工具。近期的NLP-金融工作包括28 (https://arxiv.org/html/2608.17223#bib.bib12)(CausalStock)和45 (https://arxiv.org/html/2608.17223#bib.bib13)(LLMFactor);47 (https://arxiv.org/html/2608.17223#bib.bib47)(FinBen)表明即使GPT-4在市场预测上也只能达到约0.54的准确率,这与我们的时间MCC≤0.06的通用新闻发现一致。我们的贡献通过一个多架构审计,将时间验证规范引入金融NLP,该审计附带10次种子随机划分平均值、10K次置换检验和每周块自助法,并将前沿(Claude, GPT)和开源(Llama-3, Qwen2.5)大语言模型与监督学习基线进行基准比较。

## 3 任务、数据与标签构建
### 3.1 数据集
我们的数据集包含来自专有数据提供商的56,409篇金融新闻文章,时间跨度为2020-2025年,其中81%来自2025年。文章涵盖全球64家证券交易所,每篇都标注了时间戳、标题、完整内容、相关证券、交易所以及来自语料库中观察到的203种不同事件类型的事件标签。在移除回报为中性或接近零的文章后,剩余49,799篇文章用于二分类。我们承认,专有数据限制了直接复制;我们发布了聚合统计数据、划分、代码和大语言模型提示。
表1:数据集概览。

### 3.2 预测目标
对文章发布后后续股票回报方向进行二分类(上涨/下跌)。我们报告马修斯相关系数(MCC)作为主要指标,因为它考虑了混淆矩阵的所有四个单元格,并且对轻度类别不平衡具有稳健性。平衡准确率作为补充报告。

### 3.3 市场调整标签
我们定义了一个市场调整标签变体,其中回报是相对于同一时间范围内相应交易所基准指数来衡量的。当异常回报为正时,标签为上涨(UP),否则为下跌(DOWN)。回报时间范围为一个交易日(收盘到收盘,或对于盘后发布的收盘到次日开盘);基准B(i)是上市交易所的主要指数(完整的时区/假期处理见附录A.1 (https://arxiv.org/html/2608.17223#A1.SS1))。原始标签和市场调整标签在85-90%的情况下一致。第7节 (https://arxiv.org/html/2608.17223#S7)报告了两种方案下的并购结果。

### 3.4 时间划分设计
我们采用严格的时间顺序划分:训练集<2025-04-01(21,654篇文章),验证集2025-04至2025-05(10,866篇),测试集≥2025-06-01(17,279篇)。所有超参数调整均在训练集和验证集上进行。

相似文章

LLM回测中的时间泄漏:测量、验证与调整分数

arXiv cs.LG

本文表明,在LLM回测中,标准的前/后训练截止检查对时间泄漏的检测毫无信息量,因为近因效应会模仿泄漏。文章提出了使用已知截止点和匹配的干净对照组的新估计器,以测量泄漏并计算调整分数,并在前沿模型上进行了验证。

利用语言模型进行全球并购套利预测

arXiv cs.CL

本文提出了一种用于并购套利的语言模型预测系统,该系统结合了专家引导的上下文工程和对历史交易的精调,在覆盖42个国家400多笔大型交易中取得了最先进的性能。