FrameBench:基于框架语义的语言理解基准
摘要
FrameBench 是一个新的基准,用于评估大型语言模型是否能区分动词在上下文中的依赖框架语义的解释,针对英语和日语构建,使用 FrameNet 资源,并随代码发布。
arXiv:2609.03370v1 公告类型:新
摘要:在框架语义中,句子理解被假定通过将词汇意义与称为语义框架的背景知识相关联来进行,从而使读者能够隐式地用未陈述的信息丰富文本。最近的大型语言模型(LLMs)在一系列下游任务中表现出色。然而,它们是否能重现人类在理解过程中自然进行的隐式丰富尚不清楚。为了解决这个问题,我们引入了 FrameBench,一个基于框架语义的基准。FrameBench 由多项选择题组成,测试模型是否能区分相同动词在不同上下文中引发的框架。我们使用 FrameNet 风格的资源和带有母语者判断的生成-验证管道构建了英语和日语的基准。我们对多样化模型集的实验显示小模型面临挑战,而几个大模型超过了人类参考分数。我们在 https://github.com/SasanoLab/FrameBench 发布了构建的 FrameBench 数据集和用于数据集构建及评估的代码。
查看缓存全文
缓存时间: 2026/09/04 05:58
# FrameBench:基于框架语义学的语言理解基准测试
来源:https://arxiv.org/html/2609.03370 \\setCJKmainfont HaranoAjiMincho\-Regular\.otf\[ BoldFont = HaranoAjiMincho\-Bold\.otf \]
**良平 笹野**
所属:名古屋大学 情报学研究科
邮箱:[yano\.chihiro\.j3@s\.mail\.nagoya\-u\.ac\.jp](mailto:)sasano@i\.nagoya\-u\.ac\.jp
###### 摘要
在框架语义学中,句子理解被认为通过将词汇意义与称为语义框架的背景知识相关联来实现,从而使读者能够隐性地用未明说的信息丰富文本。近期的大型语言模型(LLM)在广泛的下游任务中表现出色。然而,它们能否复现人类在理解过程中自然进行的这种隐性语义补充仍不明确。为回答这一问题,我们提出了FrameBench——一个基于框架语义学的基准测试。FrameBench包含多项选择题,用于测试模型能否区分相同动词在不同上下文中唤起的不同框架。我们利用FrameNet风格的资源以及带有母语者判断的“生成-验证流程”,为英语和日语构建了该基准测试。
我们在多种模型上进行的实验揭示了小型模型面临的挑战,而几个大型模型的分数超过了人类参考值。我们已在https://github.com/SasanoLab/FrameBench上发布构建好的FrameBench数据集,以及用于数据集构建和评估的代码。
## 1 引言
同一动词可根据上下文唤起不同的场景。考虑以下例句:
1. 1\.他与朋友交谈后**离开**了银行。
2. 2\.他在六十岁时**离开**了银行。
尽管两个句子包含相同的动词“离开”,但它们唤起了不同的场景。在句子1中,“离开”描述的是从银行这个地点发生的物理离开。而在句子2中,它唤起的是“离职”的解释而非物理离开。在此解释下,读者推断出一种未明确说明的雇佣关系。这种依赖上下文的语义补充是框架语义学的核心(Fillmore \(1982\))。
图1:FrameBench中的一个示例。
尽管近期的大型语言模型在广泛的下游任务中表现强劲,但它们能否可靠地执行这种隐性的、依赖上下文的语义补充仍不清楚。大多数现有评估仍然依赖于从多样下游任务构建的广泛基准套件,这并未直接测试这种能力(Wang et al\. \(2018\);Wang et al\. \(2024\))。
为填补这一空白,我们引入FrameBench,这是一个多项选择基准测试,用于评估LLM能否区分由同一动词唤起的依赖上下文的框架语义解释。FrameBench并非要求显式的框架标签预测,而是通过关于每个句子隐含场景的自然语言问题来间接探测这些区分。
在本工作中,我们使用各自的FrameNet资源(Ruppenhofer et al\. \(2016\);Ohara et al\. \(2004\)),为英语和日语这两种类型学上距离遥远的语言构建了FrameBench。FrameBench的构建基于LLM的生成和母语者验证。重要的是,生成过程基于人类编写的资源,而不仅仅依赖LLM的隐性知识。
我们还在生成的基准测试上评估了一系列LLM,以分析它们能否区分同一动词在不同上下文中唤起的背景知识。图1展示了FrameBench中的一个示例项目。动词“离开”出现在两个句子中,提示要求模型选择所有描述诺亚辞职的句子。正确答案是“句子A”,因为只有句子A表达了离职的含义,而句子B描述的是物理离开。仅凭匹配谓词无法解决该项目,它需要上下文敏感的框架语义解释。
我们的贡献如下:
- •我们介绍了FrameBench,这是一个基于FrameNet的多选基准测试,用于评估LLM能否区分由同一动词唤起的依赖上下文的框架语义解释。
- •我们通过基于LLM的生成和母语者验证,构建了英语和日语版本的FrameBench。我们发布了英语和日语的FrameBench数据集,以及构建和评估代码。
- •我们对广泛的LLM进行了基准测试,表明FrameBench的性能受模型规模、推理模式和语言的强烈影响。通过行为分析和案例研究,我们识别了错误模式,以及仍能对高性能模型构成挑战的细粒度框架语义区分。
## 2 相关工作
### 2\.1 语言模型评估
近年来,评估LLM已引起广泛关注。由于LLM能力是多方面的,评估通常依赖于捆绑多样下游任务而非单一任务的基准测试(Wang et al\. \(2018\);Hendrycks et al\. \(2021\);Wang et al\. \(2024\);Srivastava et al\. \(2023\))。
一些基准测试更直接地测试模型能否根据上下文区分意义。例如,词义消歧(WSD)任务和WiC数据集(Pilehvar and Camacho\-Collados \(2019\))询问同一个词在两个不同上下文中是否具有相同含义。其他方法专注于句子级的意义表示,如AMR(Knight et al\. \(2017\)),通过评估模型将句子解析为图结构语义的能力。然而,我们的目标是测试模型能否区分由同一动词唤起的依赖上下文的事件解释。与标准的、专注于字典义项的WSD不同,我们的评估基于框架语义学,捕捉更广泛的概念场景,这与这些现有资源的目标不同。
### 2\.2 框架语义资源与数据集
FrameNet是一个基于框架语义学的词汇知识库(Fillmore \(1982\)),通过对语料库句子进行人工标注,标注其唤起的框架和参与者角色而构建(Baker et al\. \(1998\))。它被广泛用于框架语义解析及相关任务,如语义角色标注,并提供结构化语义信息,包括框架之间的关系。除英语外,许多语言也开发了FrameNet风格的资源(Ohara et al\. \(2004\);Hahm et al\. \(2020\);You and Liu \(2005\);Djemaa et al\. \(2016\);Lyngfelt et al\. \(2018\))。
最近,有数据集提出为多模态数据标注框架和语义角色(Belcavello et al\. \(2024\);Viridiano et al\. \(2024\))。请参阅标题
图2:基准测试构建概览。编号步骤对应于第3\.2节(https://arxiv.org/html/2609.03370#S3.SS2)中描述的步骤。
(a\)条目示例
(b\)评估格式
图3:FrameBench任务概览。
### 2\.3 框架语义学与LLM
越来越多的研究探索使用LLM进行框架语义分析(Chundru et al\. \(2025\);Devasier et al\. \(2025\);Garat et al\. \(2025\);Yano et al\. \(2025\);Rai et al\. \(2025\))。其他研究尝试用LLM扩展或辅助FrameNet标注(Belcavello et al\. \(2026\);Han et al\. \(2024\))。总体而言,这些结果表明LLM可能在一定程度上能够利用上下文中的框架相关信息。此外,已有框架提出直接评估LLM在获取基于框架语义学的概念结构方面的效果。Guo et al\. \(2024\)提出了NutFrame,评估LLM能否从FrameNet中归纳出显式的框架语义结构,并报告这种归纳仍然具有挑战性。
此外,评估生成或解析任务经常面临LLM输出中格式不一致的问题。相比之下,FrameBench将由同一动词唤起的依赖上下文的事件解释的区分作为多选任务进行评估。通过避免需要显式预测框架标签或角色清单的任务,FrameBench更直接地评估模型能否区分由同一动词唤起的依赖上下文的事件解释。
## 3 FrameBench:任务设计与数据集构建
FrameBench是一个四项选择的基准测试,用于评估模型能否正确区分由同一动词唤起的不同语义框架。本节首先定义FrameBench任务及其评估协议,然后描述构建流程及其在英语和日语上的应用。
### 3\.1 任务定义
如图3(a)所示,每个FrameBench条目由一个问题Q和四个候选句子(SA, SB, SA′, SB′)组成,这些句子由一个多义动词和一对语义框架(FrameA, FrameB)构建。问题Q针对FrameA:SA和SA′旨在唤起FrameA,而SB和SB′旨在唤起对比框架FrameB。
在数据集构建过程中,我们使用了人工编写的框架语义资源,这些资源指定了每个框架的名称、定义、核心框架元素和例句。因此,FrameBench中的语义区分基于外部框架语义资源,而非仅依赖LLM的内部知识。由于这些资源在评估时不提供,仅使用模型的内部知识来解决任务并非易事。
每个条目还包括关于可接受性和正确性的人工评估分数。
评估时,四个句子被分成两个预定义的配对,每个配对恰好包含一个唤起目标框架的句子:基础配对(SA, SB)被设计为表面相似,因此更具挑战性;以及扩展配对(SA′, SB′),如图3(b)所示。
给定问题Q和一个评估配对,模型选择四个标签之一:句子A、句子B、两个句子或两个都不是。尽管每个配对中恰好有一个句子是正确的,但我们包含这两个虚拟选项是为了减少强制二元选择带来的噪音。
### 3\.2 构建流程
图2提供了基准测试构建流程的概览,包括以下三个步骤:
#### 步骤1:构建问题和基础句子配对
我们从目标语言的框架语义资源中提取多义动词及其唤起的框架配对。对于每个动词V和框架配对(FrameA, FrameB),我们使用LLM生成基础句子配对(SA, SB)和一个问题Q,其中只有SA是正确答案。生成过程以两个框架的名称、定义、核心元素和例句用法为条件。为了增加任务难度,我们指示LLM在保持不同框架分配的同时,使SA和SB在词汇上尽可能相似。
#### 步骤2:扩展目标句子配对
为了使评估集多样化,我们生成额外的句子以形成扩展配对(SA′, SB′)。与基础配对不同,扩展配对不要求表面相似。对于每个框架x(x∈{A, B}),我们使用框架x的信息、问题Q和原始句子Sx作为输入,生成一个额外的句子Sx′。Sx′被约束为唤起与Sx相同的框架。因此,Sx′相对于Q保留了与Sx相同的真值标签。例如,SA′是Q的正确答案,与SA的标签匹配。
#### 步骤3:人工验证与过滤
为确保基准测试质量,目标语言的母语者手动评估了构建的项目。评估包括两个部分:作为多选任务的正确性判断,以及对描述的可接受性判断。
模型评估仅使用单正确配对,而人工评估还包含辅助的双正确配对(SA, SA′)和双错误配对(SB, SB′),以减少标注者偏向选择单个句子的倾向。这些辅助配对仅用于验证,不包括在条目级评分中。正确性和可接受性分数通过取每个配对在每个维度上的最小值来计算。
### 3\.3 英语和日语版本
我们构建了英语和日语版本的FrameBench。
#### 资源与生成设置
作为框架知识的来源,我们为英语使用了FrameNet(Ruppenhofer et al\. \(2016\)),为日语使用了FrameNet日语版(Ohara et al\. \(2004\))。在两种语言中,GPT\-5(模型版本:2025\-08\-07)(OpenAI \(2025\))被用于步骤1和步骤2的生成。表1总结了资源和数据集统计信息。
由于资源规模的差异,我们为英语随机采样了800个框架配对,而为日语使用了所有335个符合条件的框架配对。对于日语,我们为每个框架配对生成了两个条目(k=2)以确保足够的数据集大小。在构建过程中,我们移除了无效的生成,最终得到731个英语项目和549个日语项目。
| 指标 | 英语 | 日语 | 来源 | FrameNet\# 框架配对 \(P\) | 800 | 335 | \# 独特LU | 430 | 139 | \# 每个配对的条目 \(k\) | 1 | 2 | FrameBench\# 候选项 \(P×k\) | 800 | 670 | \# 最终项目 | 731 | 549 | \# 独特LU | 407 | 128 |
| :------------------- | :--- | :--- | :------------------ | :------------------------ | :-- | :-- | :-------- | :-- | :-- | :---------------------- | :- | :- | :-------------------------- | :-- | :-- | :---------- | :-- | :-- | :-------- | :-- | :-- |
| 表1:FrameBench数据集统计信息 | | | | | | | | | | | | | | | | | | | | | |
| (a)英语 | | | | | | | | | | | | | | | | | | | | | |
| \#Accpt\. | 0 | 1 | 2 | 3 | Tota| | | | | | | | | | | | | | | | |相似文章
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
EvalDetectBench:用于测量前沿语言模型评估意识的基准
本文介绍了EvalDetectBench,这是一个用于测量前沿语言模型评估意识的开放基准和流水线,旨在解决现有方法中的偏差,以提升AI安全评估。
JOR-Bench:面向大型语言模型的日语运筹学基准测试
JOR-Bench 是一个包含五个日语基准测试的集合,用于评估大型语言模型在运筹学问题建模方面的能力,这些基准测试从现有的英语基准翻译而来。评估结果显示整体性能与语言无关,仅有轻微的跨语言差异。
BrainBench:面向全面脑电图理解的大型语言模型基准测试
BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。
ClosureBench:一种用于组合图推理的建构性基准
ClosureBench 是一个用于评估语言模型在组合图推理任务上表现的建构性基准,揭示了前沿模型随着复杂度增加而性能下降,而通过程序合成微调的模型能保持性能。