领域偏移下的可靠金融命名实体识别

arXiv cs.CL 论文

摘要

本文研究了领域偏移下金融命名实体识别的置信度估计和选择性预测,评估了BERT和LoRA微调的Qwen模型,以提高在不同输入分布(如SEC文件和社交媒体)下的可靠性。

arXiv:2608.19558v1 公告类型:新 摘要:金融人工智能系统通常在一种文本语料上训练信息提取器,并将其部署到文件、新闻和用户生成内容中,而标准F1分数无法指示当输入分布变化时哪些预测仍然可以安全自动化。 我们研究了金融命名实体识别(NER)的置信度估计和选择性预测,采用三级压力测试,涵盖SEC文件、金融新闻和通用主题社交媒体作为极端域外条件。 我们评估了BERT标签器和LoRA微调的Qwen2.5-0.5B/1.5B模型,使用五个推理时置信信号、三个训练种子和自助区间。 置信度排名本身在分布偏移下发生变化:整体输出概率是域内最强的错误检测器,但在域外性能下降,而实体跨度概率和自一致性更加稳健;自一致性在校准后无需后期调整也更好。 弃权将句子错误率从34.3%降低到域内输入中最高置信度40%的低于2%,并且在金融新闻上仍然有用,但在极端社交媒体偏移下无法恢复任何足够大的干净子集。 这些结果激发了一种分阶段部署策略,在应用预测级置信度门控之前,先检测上游的严重分布偏移。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:06

# 领域偏移下的可靠金融命名实体识别:置信度估计与选择性预测
来源:https://arxiv.org/html/2608.19558  
作者:Zihao Zheng<sup>1</sup>, Baichuan Li<sup>2</sup>, Junyi Yao<sup>1</sup>, and Jiayu Long<sup>1</sup>  
单位:<sup>1</sup>华盛顿大学圣路易斯分校,密苏里州圣路易斯,美国;[email protected]; [email protected]; [email protected]  
单位:<sup>2</sup>南卫理公会大学,德克萨斯州达拉斯,美国;[email protected]

###### 摘要

金融人工智能系统通常在一种文本语体上训练信息提取器,并将其应用于监管文件、新闻和用户生成内容。然而,当输入分布发生变化时,标准的F1分数无法指示哪些预测在自动化中仍属安全。本研究在涵盖SEC监管文件、金融新闻以及作为极端域外条件的通用主题社交媒体的三级压力测试上,针对金融命名实体识别开展了置信度估计与选择性预测研究。我们评估了BERT标注模型与采用LoRA微调的Qwen2.5-0.5B/1.5B模型,使用了五种推理时置信信号、三种训练种子和自助法置信区间。研究发现,置信度排名本身在域偏移下会发生变化:全局输出概率是域内最强的错误检测指标,但在域外性能恶化;而实体片段概率和自一致性则更为稳健;自一致性在不进行事后校准的情况下也具有更好的校准性。在域内输入中,基于置信度的拒绝预测可将句子错误率从34.3%降至最高置信度40%的子集下的2%以下,该方法在金融新闻上依然有效,但在极端社交媒体域偏移下无法回收足够大的干净子集。这些结果推动了一种分阶段部署策略:在应用预测级置信度门控之前,先在上游检测严重的分布偏移。

###### 索引术语:

金融命名实体识别、域偏移、置信度估计、选择性预测、不确定性估计、大语言模型

## I 引言

命名实体识别是应用型金融人工智能系统中用于合规、风险和市场情报工作流的核心信息提取组件。一系列新兴工作通过参数高效方法微调小型开放权重语言模型用于金融命名实体识别,并在域内测试划分上报告了稳步上升的F1分数[17, 35, 20]。然而,专门构建的金融大语言模型仍然将片段级NER描述为其最具挑战性的任务之一[34, 36, 37],且部署的系统面临着一个排行榜F1分数未能回答的问题:*当输入分布偏离训练数据时,模型能否告知我们其哪些提取结果值得信任?*

这一点至关重要,因为金融文本并非单一领域:一个在正式监管文件语言(“Apple Inc. reported revenue of $94.9 billion.”)上训练的模型,将会遇到新闻标题和社交媒体评论(“AAPL just destroyed earnings”)。先前研究表明,当输入偏离训练数据时,神经模型恰恰会变得*过度自信*[25, 14];而互补性工作则在不可靠预测到达下游系统之前,从分布层面检测有害的协变量偏移[8]。NER模型尤其依赖于记忆化的实体表面形式而非上下文[18]。在金融场景中,一个虚构的组织或一个拼写错误的人员实体并非无害:此类错误会传播到下游的合规、监控和分析流程中。

因此,我们通过*校准的选择性预测*[1, 5, 7]的视角研究金融命名实体识别:允许模型在低置信度预测上拒绝并交由人工审核,并探究这能以多大的覆盖成本换取多少可靠性提升。我们在SEC监管文件的FIN语料库[27]上微调了BERT编码器标注模型和指令调优的生成模型(采用LoRA的Qwen2.5-0.5B和1.5B-Instruct[26, 11]),并在一个三级压力测试上评估它们:域内监管文件(FIN测试集)、金融新闻(FiNER-ORD[28])以及作为极端域外条件的通用主题社交媒体(TweetNER7[30])。对于生成模型,我们比较了五种无需额外训练的推理时置信信号,涵盖全局输出概率、实体限定概率以及基于采样解码的自一致性投票份额[33, 21]。遵循[14],所有阈值和校准参数均在域内验证数据上选择并在接触任何测试集之前固定;结果包含多种子方差和自助法置信区间。

本研究为中心化部署的金融命名实体识别可靠性评估提供了贡献:它证明了置信度排名对领域敏感(最强的域内信号在语体或主题偏移后可能变差),识别出实体片段概率和自一致性作为互补信号(更强的错误排序能力与更好的校准性),并刻画了置信度门控的操作边界,其在严重偏移下的失败凸显了将领域级筛查作为未来工作的上游必要性。

## II 相关工作

三条研究脉络支撑了我们的研究。

#### 金融命名实体识别

FIN数据集[27]将金融命名实体识别定义为从新闻专线到SEC监管文件的领域适应任务,并一直是标准的监管文件领域基准,被FLUE[29]、BloombergGPT[34]、PIXIU[36]和FinBen[37]所采用;FiNER-ORD[28]提供了人工标注的金融*新闻*数据。近期工作使用LoRA风格的适配器[17, 35]或评估提示方法[20]微调小型大语言模型用于金融命名实体识别,在单一领域划分上报告F1分数,但未进行不确定性分析。我们固定训练方案,转而探究模型置信度能否经受住域偏移的考验。

#### 选择性预测与校准

拒绝预测可追溯至Chow[1];[5, 7]形式化了风险-覆盖权衡,其中最大softmax概率是规范性基线[10]。现代网络是失校准的[9],且校准在数据集偏移下会退化[25, 3];互补性工作在分布层面检测有害协变量偏移,以识别部署条件何时可能使模型泛化失效[8]。最接近我们研究情境的是,Kamath等人[14]研究了域偏移下的选择性*问答*,并表明softmax置信度在域外变得不可靠;[31]警示简单概率基线难以超越,我们的结果在域内证实了这一点,但在偏移下则否定了它。

#### 命名实体识别与生成式提取的不确定性

片段级置信度可追溯至基于CRF的估计[2];后续工作对编码器标注模型的实体级置信度进行了校准[12]。将NER转化为文本生成[32, 39, 4]使得token概率、采样一致性[33, 21]和语义熵[15, 6]可作为置信信号;序列概率需要长度校正[23]。对于小型模型,语言化的置信度系统性偏高[38],因此我们仅限于基于logit和采样的信号。据我们所知,先前的金融命名实体识别工作尚未评估置信度排名和校准是否能在这种偏移下存续;这正是我们针对的空白。在部署方面,学习延迟[22]和基于不确定性的人机-大语言模型任务分配[16]启发了我们的风险-覆盖框架。

## III 数据与评估协议

我们从公开数据集构建了一个三级压力测试,统一为共享的{人名, 组织, 地点}模式(表I)。前两个层级保持在金融领域内但改变语体;第三个层级有意离开金融领域,以探究严重分布偏移下的边界条件。由于语料库在标注过程、主题、时间和实体密度上也存在差异,这些层级既非域偏移的受控因果分解,也非纯粹渐进的语体变化。

#### 域内:FIN(SEC监管文件)

FIN语料库[27]包含来自美国SEC金融协议的句子;其标准训练/验证/测试划分用于训练、校准/阈值拟合和域内测试。删除包含MISC实体的句子(6个测试句子),以便所有三个层级共享相同模式。

#### 近距离偏移:FiNER-ORD(金融新闻)

FiNER-ORD[28]提供了金融新闻文章上人工标注的PER/ORG/LOC实体。从正式监管文件样板到新闻体裁的语体偏移构成了我们的近距离偏移层级。

#### 远距离偏移:TweetNER7(社交媒体)

TweetNER7[30]是一个*通用主题*的Twitter NER数据集,并非专门的金融推文语料库。我们仅将其用作在金融监管文件上训练模型的极端域外压力测试。它标注了七种实体类型,包括corporation, person, location,我们将其映射为ORG/PER/LOC。为了保持黄金标签的清洁,我们的主要远距离偏移集仅保留实体全部落在映射模式内的推文,丢弃其余推文而非静默重新标注。这移除了2021测试集2,807条推文中的2,179条,留下628条合格推文(表VI)——这是一个通过敏感性分析(§VII)量化的、精确优于规模的刻意选择,其*宽松*变体保留每条推文,而是*忽略*模式外的黄金实体,因此匹配的预测既不得分也不扣分。URL占位符和用户提及标记被规范化为纯表面形式。两个域外测试集均通过固定子采样种子限制为300个句子。

表I:协调和过滤后的数据集统计。所有过滤决策记录在机器可读的流水线清单中。

### III-A 评估协议

编码器预测作为精确BIO片段匹配进行评分。生成式预测是生成的文本,因此我们通过*无位置多集合匹配*对它们进行评分:每个预测的(表面形式,类型)对与黄金对的多重集合进行匹配。由于两个模型家族因此在不同的匹配程序下评分,编码器-生成式的F1直接比较应视为指示性而非精确性。表面形式被转换为小写、压缩空白并去除边界标点,因此分词伪影不计为错误;重复预测最多只能匹配存在的黄金实体数量;错误的边界或类型既计为假阳性也计为假阴性。无效JSON使用宽容解析器修复并标记;无法解析的输出将每个黄金实体计为遗漏。没有实体的句子仅在模型预测空集时计为正确,序列概率作为该预测的置信度。幻觉——源句子中不存在的预测表面形式——是假阳性,并额外作为单独的比率进行跟踪。

## IV 置信信号

#### 生成式命名实体识别

生成模型通过指令微调将句子映射到JSON对象`{"entities":[{"text","type"},...]}`并根据§III-A的协议进行评分。

#### 置信信号

令$y_{1:n}$为带有来自贪婪解码的token对数概率$\log p(y_i)$的生成输出。对于每个预测实体$e$,我们比较:*序列概率*(长度归一化)$C_{\text{seq}}=\exp\big(\tfrac{1}{n}\sum_{i}\log p(y_{i})\big)$ [23];*token概率* $C_{\text{tok}}=\tfrac{1}{n}\sum_{i}p(y_{i})$;*片段概率* $C_{\text{span}}(e)=\exp\big(\tfrac{1}{\|T_{e}\|}\sum_{i\in T_{e}}\log p(y_{i})\big)$,其中$T_{e}$是$e$表面形式的token;*类型概率* $C_{\text{type}}(e)$,同样基于$e$类型标签的token定义;以及*自一致性* $C_{\text{sc}}(e)=\tfrac{1}{K}\sum_{k=1}^{K}\mathbf{1}[e\in\hat{E}_{k}]$,即实体$e$在$K$次采样解码$\hat{E}_{k}$中的投票份额。$C_{\text{seq}}$和$C_{\text{tok}}$是句子级信号,由句子中的所有实体共享;其余为实体级信号。自一致性使用温度0.7下的$K=5$个样本[33, 21];当采样解码包含该实体时(相同的归一化表面形式和类型),该实体计为一票。一个在验证集上选择的片段与类型置信度的凸组合选择了纯片段置信度(测试层级效应低于±0.02 AUROC),因此我们直接报告片段置信度(§VII)。

#### 编码器基线置信度

对于BERT标注模型,片段置信度是预测片段内第一个子词的最大softmax概率的平均值[10, 2],可选择进行温度缩放[9],温度$T$基于域内验证集上的token级负对数似然拟合。

#### 选择性预测

我们在两个粒度上评估拒绝预测。*句子级:*

相似文章

通过合成数据蒸馏实现高效的金融语言理解

arXiv cs.CL

介绍了一种利用合成数据进行蒸馏的金融情感分析框架,将知识从大型教师模型迁移到紧凑学生模型,并采用基于聚类的种子选择方法实现高效的低资源领域适应。