Earnings25:面向金融领域、涵盖500小时的综合性语音基准
摘要
Earnings25是一个500小时的基准,用于评估金融财报电话会议中的自动语音识别,提供对齐的转录文本和结构化元数据,支持考虑说话人和行业的评估。
arXiv:2607.23813v1 公告类型:新
摘要:我们推出了Earnings25,这是一个金融领域的基准,用于在真实条件下评估英语财报电话会议中的自动语音识别(ASR)。Earnings25包含两个互补的测试集:(i) testset-full,包含2025年第四季度S&P 500公司英语财报电话会议的498小时完整录音,以及(ii) testset-segmented,从2025年美国英语财报电话会议中采样得到的46小时行业均衡的290个片段。该基准提供对齐的转录文本和结构化元数据,包括说话人角色、行业标签和会议结构,支持超越总词错误率(WER)的说话人和行业感知评估。我们报告了使用标准化评分方法得出的Whisper和Parakeet-TDT的可复现基线。
查看缓存全文
缓存时间: 2026/07/28 06:30
# Earnings25:一个涵盖500小时语音的综合金融标杆基准
来源:https://arxiv.org/html/2607.23813
Jiang Zhou Wadhawan Fahy Ramesh Weisberg Derkachevskiy Sheehan Prasad Franceschini
HaoranAnshulBrendanVinayDavidDmitriyHelenSrivasMicheleBloomberg, 美国
\{djiang108,hzhou245,awadhawan9,bfahy2,vramesh7,dweisberg6, dderkachevsk,hsheehan,sprasad60,mfrancesch10\}@bloomberg\.net (https://arxiv.org/html/2607.23813v1/mailto:%7Bdjiang108,hzhou245,awadhawan9,bfahy2,vramesh7,dweisberg6,%0Adderkachevsk,hsheehan,sprasad60,mfrancesch10%[email protected])
###### 摘要
我们提出Earnings25,一个面向金融领域的基准,用于在现实条件下评估英语财报电话会议的自动语音识别(ASR)性能。Earnings25包含两个互补的测试集:(i) testset-full,包含498小时完整的英语标普500公司2025年第四季度财报电话会议录音;(ii) testset-segmented,一个46小时的行业平衡测试集,包含从2025年美国英语财报电话会议中采样的290个片段。该基准提供对齐的转录文本和结构化元数据,包括说话人角色、行业标签和会议结构,支持超越总词错误率(WER)的、针对说话人和行业的评估。我们使用标准化评分方法,提供了Whisper和Parakeet-TDT的可复现基线结果。
###### 关键词:
自动语音识别,ASR基准,金融语音,财报电话会议,语音数据集,行业感知评估,长语音,领域自适应
## 1 引言
### 1.1 金融语音理解具有挑战性
财报电话会议是企业沟通的关键渠道,给自动语音识别(ASR)带来了独特挑战。它们结合了自发的对话和事先准备好的讲稿,包含大量金融专业术语、公司及产品名称、频繁的数字表达、快速的对话轮换,以及在问答环节中说话人重叠——这些条件暴露了主要基于朗读或一般对话语音训练的ASR系统的局限性。
领域偏移加剧了这些挑战。财报电话会议通常包含接线员的模板化内容、因电话压缩或背景噪音导致的参差不齐的录音质量,以及频繁的说话人切换。在语言层面,该领域包含在一般ASR训练数据中代表性不足的术语和缩写词,以及来自国际高管的口音英语。尽管自监督和弱监督预训练已提升了一般ASR性能(例如,wav2vec 2.0 [baevski2020wav2vec2] 和 Whisper [radford2022whisper]),但领域不匹配仍然是错误的主要来源,这激发了对最新的、特定领域语音资源的需求。
### 1.2 迈向全面的金融ASR基准
尽管对金融语音和自然语言处理的兴趣日益增长,但很少有公开可用的资源是专门为评估财报电话会议上的ASR而构建的。现有数据集通常侧重于训练数据,缺乏标准化的评估协议,或缺少进行详细错误分析所需的元数据。因此,该领域缺乏一个原则性的、可复现的基准来衡量金融ASR的进展。
除了转录准确性,实用的金融语音系统还需要评估说话人归属、说话人日志、角色感知性能(例如,高管 vs. 分析师),以及跨行业和会议结构的错误。因此,一个全面的基准必须将现实的长语音与丰富的元数据配对。
Earnings25设计用于提供对齐的转录文本以及说话人信息、行业背景和结构化元数据,以进行细粒度评估。与先前强调规模或聚合指标的资源不同,它明确构建用于揭示那些被自然分布语料库所掩盖的特定领域和长尾故障模式。通过将长语音与行业平衡的评估相结合,该基准能够系统研究行业感知的ASR鲁棒性和金融语音中的结构化变化。
## 2 相关工作
### 2.1 对话和会议语音基准
财报电话会议在快速轮换、不流畅和说话人重叠等方面与会议和电话语音共享几个对话特性。标准基准如 Switchboard (1992) [godfrey1992switchboard]、CallHome (1997) [canavan1997callhome] 和 AMI (2007) [carletta2007ami] 捕获了这些现象的某些方面,但通常缺乏显著影响ASR在财报电话会议上性能的金融特定术语、密集的数字表达和领域结构。
### 2.2 现有金融语音基准
现有的金融语音数据集作为全面的评估基准,在几个关键维度上存在不足。SPGISpeech 于2021年发布,并在2025年扩展 [spgispeech, spgispeech2],提供了超过5,000小时的专业转录财报电话会议音频。然而,它主要被设计为训练语料库:该数据集包含非常大的训练、开发和测试划分(测试集中约有2,000小时),使得用于受控和可复现的基准评估的计算成本高昂。
Earnings-21 (2021) 和 Earnings-22 (2022) 基准 [delrio21_interspeech, delrio2022earnings22] 侧重于开放评估,提供对齐的转录文本以及口音和国家级别元数据。Earnings-22 提供了大约160小时的全球长财报电话会议,但缺乏行业平衡采样:高频领域主导了评估指标,掩盖了在代表性不足领域的性能。此外,这两个数据集都没有提供执行细粒度错误分析和说话人感知评估所需的结构化元数据——如说话人角色、行业分类或公司标识符。
总体而言,金融语音领域缺乏一个专门设计用于在现实财报电话会议条件下评估ASR系统的、全面的、平衡的和元数据丰富的基准。
## 3 语料库定义
Earnings25 包含两个互补的测试集,旨在支持长语音和片段级别评估,如表1 (https://arxiv.org/html/2607.23813#S3.T1) 所示。testset-full 包含来自2025年第四季度标普500公司完整财报电话会议录音的498小时,保留了完整的对话上下文,典型通话时长约为一小时。testset-segmented 是一个精心策划的46小时评估集,从2025年(第一季度至第四季度)超过2,000场美国财报电话会议中采样,包含290个片段——每个行业一个——以确保平衡的领域覆盖。testset-segmented 中的片段长度为5–10分钟。
两个测试集都包含对齐的转录文本和结构化元数据,并构建为保留真实的对话流程、自然的轮换和跨说话人动态。除了转录,Earnings25 还提供丰富的元数据,包括说话人分割、行业分类和公司标识符,支持超越总词错误率(WER)的细粒度分析,并支持说话人和结构感知的评估。
表1:Earnings25 测试集概述。
## 4 语料库生成
我们对完整的财报电话会议进行采样,应用基于CTC的强制对齐以获得词级时间戳,并将较短的语音片段聚合为5–10分钟的评估单元。本节详细说明行业分层采样、对齐和分割过程。
### 4.1 完整财报电话会议领域的行业分层采样
为了构建一个具有代表性且行业平衡的评估集,我们从涵盖2025年第一季度至第四季度的超过2,100场美国财报电话会议池中采样。采样采用两阶段、可复现的程序进行,旨在确保广泛的行业覆盖,同时防止高频领域的支配。
在第一阶段,我们过滤语料库,仅保留目标日期范围内在美国注册的公司。在第二阶段,我们根据行业分类应用非比例分层采样。电话按行业分组,从每组中抽取固定数量的样本,确保无论各行业在语料库中的基础频率如何,都能得到平等代表。当行业组数量超过目标评估大小时,应用最终随机选择。所有采样步骤均设置种子以确保可复现性。
### 4.2 对齐
我们进行强制对齐以获得词级时间戳,这使得能够从长财报电话会议中提取较短的片段,从而增加行业覆盖。这些时间跨度也用于支持说话人日志和说话人感知分析。
#### 4.2.1 基于CTC的强制对齐
强制对齐使用在 NVIDIA NeMo [kuchaiev2019nemo] 中实现的连接主义时间分类(CTC)模型进行。CTC [graves2006ctc] 定义了一个序列级别目标函数,它对输入声学帧和输出标签序列之间的所有单调对齐进行边际化,产生输出令牌和空白符号的帧级后验概率。这些后验概率用于将参考转录文本与音频对齐,并恢复词级时间信息。
给定一个被分词为子词单元的参考转录文本,我们计算帧级CTC对数概率,并应用维特比解码在CTC格下恢复最可能的对齐路径。然后将令牌级时间戳聚合为词边界。为了减轻由尾部静音或低置信度区域引起的对齐错误,我们施加了0.5秒的最大词持续时间约束。
对齐流程包括:(1) 将音频重采样为16 kHz WAV格式;(2) 计算帧级CTC对数概率;(3) 音频帧与参考令牌之间的维特比对齐;(4) 从对齐的令牌中提取词边界。
### 4.3 从完整通话中提取片段
通过强制对齐获得词级时间戳后,我们将连续的语音片段聚合为不重叠的块,其持续时间限制在预定义范围内(例如,5–10分钟)。块的构建是贪婪的:累积连续片段,直到达到最小持续时间,并在总持续时间保持在最大阈值以下时扩展该块。
#### 4.3.1 质量过滤
我们应用基于内容的过滤,移除其合并转录文本包含不需要的模式(如接线员模板或非语音提示)的块。从剩余的候选块中,每个通话均匀随机采样一个块,以避免单个通话的过度代表。在音频提取之前,在块边界添加固定的0.2秒填充,以减轻对齐抖动。此过程产生一个紧凑且多样的片段集,具有干净的转录文本,跨通话平衡,适合片段级ASR基准测试。
使用说话人标签进一步分割片段,以确保片段边界不会分割说话人发言轮次。此过程产生具有可靠时序的转录文本,适用于片段级ASR评估、说话人感知分析以及下游语音处理任务。
## 5 语料库分析
### 5.1 地理覆盖和口音分布
testset-full 包含所有标普500公司的财报电话会议,地理足迹广泛,涵盖来自12个国家的英语财报电话会议。虽然在美国注册的公司主导了语料库(反映了指数构成),但数据集也包括总部设在欧洲、亚洲和其他地区的公司的电话会议。这种地理多样性引入了英语口音变化和不同的录音条件,反映了现实世界的财报电话会议音频。
相比之下,testset-segmented 将评估限制为在美国注册的公司,以减少口音变异性并提供受控的评估环境。这种设计使得可以在一致的语言条件下评估基线ASR性能,而口音鲁棒性则可以使用完整通话测试集进行研究。
表2:testset-full 的地理分布。
### 5.2 行业分布
行业覆盖是Earnings25的核心设计考虑。testset-full 跨越284个不同的行业类别,反映了标普500的自然领域分布。如表3 (https://arxiv.org/html/2607.23813#S5.T3) 所总结,公用事业和金融服务是最常代表的领域,而大多数行业只出现少量次数,保留了金融数据特有的长尾结构。
表3:testset-full 的行业分布。为了减轻评估中的频率偏差,testset-segmented 通过从2025年(第一季度至第四季度)超过2,000场美国财报电话会议进行行业分层采样构建而成。所有290个片段都专门来自在美国注册的公司,以确保一致的音频质量并减少口音变异性。片段测试集跨越290个独特的行业类别,每个行业恰好一个片段,确保跨多样化金融子领域的领域特定词汇的广泛覆盖——从3D打印机制造商和成人夜总会到风力涡轮机和有线电信设备。这种设计能够在保持受控语言评估环境的同时,对ASR性能进行细粒度的、行业感知的分析。
### 5.3 说话风格变化
财报电话会议在说话风格和交互结构上表现出显著变化。在单个通话中,语音在预先准备好的讲稿和自发的分析师问答之间交替,常常伴有快速的轮换和偶尔的重叠。testset-full 在完整通话中保留了这些动态,而 testset-segmented 在每个5–10分钟的片段内保留了多说话人的会话结构。
说话人归属元数据支持对ASR性能进行角色感知分析,涵盖接线员、高管和分析师。接线员通常提供模板化的公告,高管进行准备好的发言,分析师则贡献即兴的提问。这种变化允许评估ASR在金融语音中常见的说话风格、角色和交互模式上的鲁棒性。
表4:在完整财报电话会议测试集(498小时)和精心策划的片段测试集(46小时)上的基线ASR结果。数值越低越好。
表5:Parakeet-tdt-0.6b-v2 在 testset-full 上按所选行业划分的ASR性能(根据行业标签,每个子行业2–3个通话)。此表仅为说明性,并非全面排名。数值越低越好。
## 6 转录实验
### 6.1 基线模型和评估协议
我们对代表序列到序列和转换器架构的ASR系统进行基准测试:OpenAI Whisper 模型 [radford2022whisper](base, medium, large-v2)和 NVIDIA NeMo 的 Parakeet-TDT-0.6B-v2 [xu2023efficient]。未使用外部语言模型。Whisper 推理:从固定的模型配置加载解码选项。我们设置固定的随机种子并使用确定性解码设置。语言设置为英语。解码过程中未使用可选的关键词提示或增强词。Parakeet-TDT 推理:我们使用预训练检查点 nvidia/parakeet-tdt-0.6b-v2,采用贪婪转换器解码,无外部语言模型。评分和标准化:我们报告四个一致的变体:WER(原始)、WER-N(NeMo标准化)、WER-nc-np(小写、去除标点)和 WER-N-nc-np(NeMo标准化、小写、去除标点)。对于基于标准化的变体,相同的 NeMo 英语文本标准化 [zhang2021nemo] 应用于参考和假设。可复现性:所有采样和分割程序使用固定的随机种子(2025)。实验脚本设置 PYTHONHASHSEED=2025 和 fr相似文章
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
ESCUCHA:面向异质声学条件的西班牙语语音基准
介绍了ESCUCHA,这是首个用于评估大型音频语言模型在异质声学条件和推理能力方面的西班牙语语音理解基准,包含来自多种真实世界来源的1000个精选问题。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
SpeechEQ:在社交感知语音对话模型中评估情商指数的基准
SpeechEQ引入了一个用于评估语音语言模型情商的基准和数据集,涵盖2,265个对话中的15个情商子量表。实验表明,当前模型在处理副语言线索时存在困难,表现出依赖文本的捷径以及其他局限性。
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。