AWARE-FX:一个用于衡量企业外汇套期保值披露的可审计知识引导AI系统

arXiv cs.CL 论文

摘要

本文介绍了AWARE-FX,一个可审计的AI/NLP决策支持系统,可从年度报告中提取并对企业外汇套期保值披露进行评分,并在24,909个香港公司年度样本上进行了FinBERT、ModernBERT和Qwen3-8B的对比评估。

arXiv:2607.27611v1 公告类型:新 摘要:企业年度报告包含关于外汇风险管理、衍生品使用、自然对冲和明确不使用的弱结构化证据。本研究开发了AWARE-FX,一个可审计的AI/NLP决策支持系统,可将报告文本转换为可追踪的公司-年度套期保值披露度量。该系统结合了专业来源词典、否定与会计状态逻辑、特定渠道的金融编码器、精确证据门控、保守聚合以及审计账本。在2008-2025年间24,909个香港公司年度样本中,该系统检索并评分了543,527个片段。可靠性通过消融实验、分层300片段人工审计、三种子FinBERT-ModernBERT比较、严格的2023-2025时间测试、概率校准、选择性预测和固定提示生成模型基准进行评估。FinBERT在八个编码器任务划分比较中的七个中具有较高的平均F1;其时间F1范围从0.702到0.872。对20%最不自信的时间观测进行弃权,使保留样本的F1提高0.050-0.077。确定性Qwen3-8B在商品和否定证据上表现强劲,但在外债和会计上下文标签上表现不佳,表明通用LLM不能统一替代领域约束。严格FX分数与关联的基线和压力期外汇敞口呈负相关,而通用广泛分数则不然。这些关联提供了外部构念效度,而非对冲有效性的因果估计。AWARE-FX贡献了一个经过测试的决策支持架构,其中检索、状态逻辑、分类、不确定性处理、聚合和外部验证均可分别审计。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# AWARE-FX:一种用于衡量企业外汇对冲披露的可审计知识引导AI系统

###### 摘要

企业年度报告包含关于外汇风险管理、衍生品使用、自然对冲和明确不使用对冲的弱结构化证据。本研究开发了AWARE-FX,一个可审计的人工智能/自然语言处理决策支持系统,将报告文本转化为可追溯的公司-年度对冲披露度量。该系统结合了专业来源词典、否定与会计状态逻辑、渠道特定金融编码器、精确证据门、保守聚合和审计日志。在2008年至2025年间的24,909个香港公司-年度中,它检索并评分了543,527个片段。可靠性通过消融研究、分层300片段人工审计、三种子FinBERT–ModernBERT比较、严格的2023–2025时间测试、概率校准、选择性预测和固定提示生成模型基准进行评估。FinBERT在八个编码器任务-分割比较中有七个平均F1更高;其时间F1范围为0.702至0.872。对20%最不自信的时间观测进行弃权,使保留样本F1提高0.050–0.077。确定性Qwen3-8B在商品和否定证据上表现强劲,但在外债和会计上下文标签上表现不佳,表明通用LLM不能统一替代领域约束。严格FX得分与关联的基线和压力期FX暴露呈负相关,而通用广泛得分则不然。这些关联提供了外部构念验证,而非对冲有效性的因果估计。AWARE-FX贡献了一个经过测试的决策支持架构,其中检索、状态逻辑、分类、不确定性处理、聚合和外部验证均可单独审计。

###### 关键词:金融文本分析,外汇风险,对冲披露,FinBERT,决策支持系统,可审计性

††期刊:Expert Systems with Applications  
\affiliation [inst1]organization=University of Nottingham, city=Nottingham, country=United Kingdom

## 1 引言

外汇(FX)风险管理是跨货币经营企业的核心关注点,但评估该风险所需的证据分散在年度报告附注、资金政策描述、衍生品表格、套期会计披露和风险因素叙述中。传统结构化指标仅捕捉了部分证据。一份年度报告可能说明公司使用外汇远期、将交叉货币互换指定为现金流量套期、以匹配货币债务为境外经营融资,或者不使用对冲工具。这些陈述具有不同的经济和会计含义,但难以大规模地转化为一致的公司-年度度量。这一难题并非通过搜索“对冲”一词就能解决。一个关键词命中可能描述已执行的衍生品、一般会计政策、未对冲的风险敞口,或者经济对冲不符合套期会计条件的事实。因此,同一术语可能支持正面、负面或仅上下文解释。

端到端的文档分类产生了另一个问题:即使预测良好,用户可能不知道哪个段落支持该得分,或者是否忽略了不使用条款。在金融决策支持中,这种来源可追溯性很重要,因为测量误差可能传播到筛选、监控和实证分析中。

本文开发了AWARE-FX,一个可审计的人工智能/自然语言处理决策支持系统,用于从年度报告中衡量企业外汇对冲披露。该系统包含五个组成部分。首先,专业来源词典使用来自财务报告准则、套期会计指南和衍生品实践的术语检索候选证据。其次,基于规则的审计层记录匹配渠道,并区分肯定、仅上下文、会计不指定、混合和明确不使用语言。第三,渠道特定的FinBERT分类器对检索到的片段进行排序。第四,精确渠道门和保守的top-k聚合并产生公司-年度得分,而不允许通用对冲语言污染每个专门渠道。第五,每个得分都保留一条回到报告、页面、片段、匹配规则、候选状态和模型概率的路径。

评估刻意多层进行。语料库包含2008年至2025年间的24,909个香港上市公司-年度,产生543,527个候选片段。留出实验比较四个渠道的epochs 15、20、25和30。第二个稳健性矩阵将FinBERT与当代ModernBERT编码器在三个随机种子、一个分组随机设计和一个严格时间设计(训练至2021年,验证2022年,测试2023–2025年报告)下进行比较。分层300片段人工审计评估困难的正面、仅上下文、不使用、混合和会计不指定案例。基线包括朴素关键词匹配、带和不带否定的专业词典、TF–IDF逻辑回归、带和不带严格渠道门的FinBERT、托管零样本比较器以及确定性开放权重Qwen3-8B。校准和选择性预测测试不确定案例是否可以路由到人工审查。最后,关联的公司-年度和货币标签敞口估计测试严格FX得分是否在通用广泛得分和标准公司控制变量之外提供外部筛选信息。

这一设计填补了三个空白。首先,许多金融NLP研究优化了一个预测目标,但对进入度量的构念层面控制有限。最近的金融LLM基准同样强调,一般性能并不能保证在专门金融任务上的可靠性(Liu et al.,2025 (https://arxiv.org/html/2607.27611#bib.bib36); Klimaszewski et al.,2025 (https://arxiv.org/html/2607.27611#bib.bib33); Tang and Yang,2025 (https://arxiv.org/html/2607.27611#bib.bib54))。AWARE-FX在模型拟合前使构念明确,并保持领域规则可供检查。其次,披露度量需要表示缺失和模糊性,而不仅仅是存在。因此,系统将明确不使用和会计不指定作为一等证据状态。第三,一个高性能片段分类器本身并不能建立一个有用的公司-年度度量。本文评估了从检索到聚合的完整链条,然后将所得得分与外部金融风险构念相关联。

本文做出四项贡献。首先,它贡献了一个基于领域的公司对冲披露检索和证据分类法。与临时词典不同,每条检索规则都有渠道、信号类别、极性、强度和专业来源基础。其次,它贡献了一个混合决策支持架构,其中规则和学习模型具有不同角色:规则建立可追溯的候选覆盖和语义门,而分类器在这些门内对证据进行排名。消融研究显示了这种分离为何重要。第三,它贡献了一个面向可靠性的审计协议,结合了现代编码器比较、多种子稳定性、时间分布外测试、概率校准、选择性弃权、固定提示LLM评估、人工错误分析、检查点溯源和得分级覆盖。该协议既评估预测性能,也评估系统应何时推迟到审查。第四,它提供了外部构念验证。严格FX得分(而非通用广泛得分)在控制变量后与基线和压力期FX暴露相关。这些是筛选关联,而非对冲有效性的因果估计。

因此,该研究定位为智能金融文本系统,而非传统金融回归论文。其主要产物是一个可复现的测量管道;暴露分析评估该产物是否产生具有经济判别力的信息。这一定位与设计科学评估(Hevner et al.,2004 (https://arxiv.org/html/2607.27611#bib.bib26); Gregor and Hevner,2013 (https://arxiv.org/html/2607.27611#bib.bib21))、文本即数据测量(Gentzkow et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib18); Grimmer and Stewart,2013 (https://arxiv.org/html/2607.27611#bib.bib22))、金融文本分析(Loughran and McDonald,2011 (https://arxiv.org/html/2607.27611#bib.bib38); Hassan et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib24))和企业风险管理研究(Smith and Stulz,1985 (https://arxiv.org/html/2607.27611#bib.bib53); Allayannis and Ofek,2001 (https://arxiv.org/html/2607.27611#bib.bib2); Bartram et al.,2010 (https://arxiv.org/html/2607.27611#bib.bib6))一致。

本文的其余部分组织如下。第2节 (https://arxiv.org/html/2607.27611#S2)回顾相关研究并说明系统相对于近期金融LLM工作的定位。第3节 (https://arxiv.org/html/2607.27611#S3)描述架构和审计追踪。第4节 (https://arxiv.org/html/2607.27611#S4)介绍专业词典和提取层。第5节 (https://arxiv.org/html/2607.27611#S5)描述模型训练、检查点选择、聚合和验证。第6节 (https://arxiv.org/html/2607.27611#S6)介绍外部验证设计。第7节 (https://arxiv.org/html/2607.27611#S7)报告提取、分类、消融、得分发布和暴露结果。第8节 (https://arxiv.org/html/2607.27611#S8)讨论启示、局限和部署边界。

## 2 相关工作与系统定位

### 2.1 金融文本作为测量

文本即数据研究表明,当目标构念明确且测量假设得到验证时,非结构化的公司、新闻和政策文本可以转化为定量测量(Gentzkow et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib18); Grimmer and Stewart,2013 (https://arxiv.org/html/2607.27611#bib.bib22))。在金融和会计领域,文本测量已被用于研究语气、不确定性、前瞻性陈述、风险因素、产品市场结构、公司政治风险和政策不确定性(Tetlock,2007 (https://arxiv.org/html/2607.27611#bib.bib55); Tetlock et al.,2008 (https://arxiv.org/html/2607.27611#bib.bib56); Li,2010 (https://arxiv.org/html/2607.27611#bib.bib35); Loughran and McDonald,2011 (https://arxiv.org/html/2607.27611#bib.bib38); Campbell et al.,2014 (https://arxiv.org/html/2607.27611#bib.bib8); Hoberg and Phillips,2016 (https://arxiv.org/html/2607.27611#bib.bib27); Baker et al.,2016 (https://arxiv.org/html/2607.27611#bib.bib4); Hassan et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib24); Manela and Moreira,2017 (https://arxiv.org/html/2607.27611#bib.bib42))。该文献还警告说,通用语言资源在金融领域可能表现不佳,因为常用词会获得领域特定含义(Loughran and McDonald,2011 (https://arxiv.org/html/2607.27611#bib.bib38),2016 (https://arxiv.org/html/2607.27611#bib.bib39); Kearney and Liu,2014 (https://arxiv.org/html/2607.27611#bib.bib32))。

企业对冲披露是一个尤其要求高的测量问题。年度报告既包含交易证据,也包含样板政策语言。衍生品表格可以在不使用叙述性对冲动词的情况下披露头寸;风险说明可以提及货币波动而不披露对冲;不使用声明可能包含与肯定声明相同的所有关键词。因此,测量目标不是一般情绪或主题流行度。它是要确定一个可追溯的段落是否支持一个已定义的风险管理证据渠道,然后在不抹去其状态的情况下聚合该证据。

### 2.2 金融Transformer与大型语言模型

上下文语言模型建立在Transformer架构之上(Vaswani et al.,2017 (https://arxiv.org/html/2607.27611#bib.bib58))。BERT、RoBERTa、DistilBERT和DeBERTa展示了上下文预训练如何改善下游分类(Devlin et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib12); Liu et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib37); Sanh et al.,2019 (https://arxiv.org/html/2607.27611#bib.bib51); He et al.,2021 (https://arxiv.org/html/2607.27611#bib.bib25))。领域适应在金融中很重要。FinBERT风格模型将上下文表示适应于金融文本,而金融特定词典表明领域词汇可以优于通用情感资源(Malo et al.,2014 (https://arxiv.org/html/2607.27611#bib.bib41); Araci,2019 (https://arxiv.org/html/2607.27611#bib.bib3); Yang et al.,2020 (https://arxiv.org/html/2607.27611#bib.bib61))。前沿已转向生成式LLM、长上下文系统和代理工作流

相似文章