词汇语义学的场景抽象:情境意义的结构化表示
摘要
本文提出了场景抽象(Scene Abstraction)框架,该框架利用大语言模型的少样本提示,构建单词在上下文中引发的解释性场景的结构化表示。作者引入了COCA-Scenes数据集,包含520个使用实例,并提供了实证证据表明场景是可可靠识别的,且比替代方案更符合人类解释。
arXiv:2605.22542v1 公告类型:新
摘要:咖啡和茶有许多共同属性,但它们却引发截然不同的情境、氛围和情感联想。这些词语意义的情境维度是真实且系统的,但在大多数词汇意义的计算表示中仍然隐含。我们提出了场景抽象(Scene Abstraction)框架,用于构建单词在不同使用语境中所参与的解释性场景的结构化表示。每个场景由一个情境场景(事件、实体、背景)和一个以表达为中心的表达档案(参与事件、可概括属性、引发的情感)组成,通过大语言模型的少样本提示实现。我们的贡献有三方面:(1)一个用于情境词汇意义的结构化表示框架;(2)COCA-Scenes数据集,包含26个关键词的520个使用实例,用于区分场景识别;(3)来自两项实验的实证证据表明,场景在不同人类观察者之间是可可靠识别的(准确率82.4%,比纯文本嵌入高11.8个百分点),并且我们的场景档案比基于ATOMIC的替代方案更符合人类对语境中词语的解释(在三个语义维度上偏好率为86.4%)。
查看缓存全文
缓存时间: 2026/05/22 08:48
# 情境化意义的结构化表征
来源:https://arxiv.org/html/2605.22542
## 词汇语义的场景抽象:情境化意义的结构化表征
Katrin Erk 马萨诸塞大学阿默斯特分校 语言学系 kerk@umass\.edu
###### 摘要
咖啡和茶共享许多属性,但它们唤起截然不同的情境、氛围和情感联想。这些词汇意义的情境维度真实且系统,但在大多数词汇意义的计算表征中仍是隐性的。我们提出**场景抽象**(Scene Abstraction),一个用于构建词汇在各类使用语境中所参与的解释性场景的结构化表征框架。每个场景由一个**语境场景**(事件、实体、背景)和一个以表达式为中心的**表达轮廓**(参与事件、可泛化属性、唤起的情感)组成,通过大语言模型的小样本提示来实现。我们的贡献有三:(1)一个用于情境化词汇意义的结构化表征框架;(2)COCA-Scenes数据集,包含26个关键词的520个使用实例,用于区分不同场景识别;(3)来自两个实验的经验证据:场景在人类观察者中具有可靠的识别性(准确率82.4%,比纯文本嵌入高11.8个百分点),并且我们的场景轮廓在人类对上下文中词汇的解释上比基于ATOMIC的替代方案更一致(在三个语义维度上偏好率达86.4%)。
词汇语义的场景抽象:情境化意义的结构化表征
Yejin Cho 德克萨斯大学奥斯汀分校 语言学系 ycho@utexas\.edu
Katrin Erk 马萨诸塞大学阿默斯特分校 语言学系 kerk@umass\.edu
语境场景 \(\mathcal{C}\)
表达轮廓 \(\mathcal{E}\)
(咖啡)
输入文本:“她喝掉了早上第三杯**咖啡**,继续打字。”
场景抽象(gpt-4o-mini)
事件:PersonX 喝 饮料;PersonX 持续打字
实体:PersonX(她):高效、警觉;ObjectY(咖啡):提神、含咖啡因
背景:时间:早晨;地点:未指定;氛围:专注、精力充沛
参与事件:– PersonX 喝它 – 支持PersonX的工作
可泛化属性:– 提升生产力 – 工作提神仪式
唤起情感:– 动力(喝咖啡的行为暗示继续工作的动力。)
\(\mathcal{S}(u,x) = \langle \mathcal{C}, \mathcal{E} \rangle\)
图1:场景抽象框架。给定使用语境 \(u\) 和其中的目标表达式 \(x\)(咖啡),大语言模型生成 \(\mathcal{S}(u,x)\),包括一个**语境场景** \(\mathcal{C}\)(事件、实体、背景)——捕捉 \(u\) 所描述的整体情境,以及一个**表达轮廓** \(\mathcal{E}\)(参与事件、可泛化属性、唤起的情感)——刻画 \(x\) 在场景中的根基意义。
## 1 引言
**crow**(乌鸦)是什么意思?字典的答案——一种黑色大鸟——几乎无法捕捉这个单词在实际语境中发挥的作用。实际上,crow 参与的是关于寂静、孤立、不祥氛围、冬日风景和死亡象征的场景;这些反复出现的情境模式是理解这个词的一部分,但字典定义中却没有明确编码。同样,whiskey、rain 或 rose 等词唤起的反复出现的体验和情感情境远超指称内容之外。这些意义的情境维度并非偶然;它们反映了结构化的解释性规律,塑造了词汇在语境中的理解方式。
然而,在计算上捕捉这种情境化、解释性的意义特征仍然是一个开放的挑战。框架语义学(Fillmore, 1976 (https://arxiv.org/html/2605.22542#bib.bib6), 1982 (https://arxiv.org/html/2605.22542#bib.bib7))提出,词义根植于丰富的背景知识,包括情境、情感和文化维度。然而,这一传统的主要大规模实现——FrameNet(Baker et al., 1998 (https://arxiv.org/html/2605.22542#bib.bib8))——侧重于描述谓词-论元结构的一小套语义框架。它不易扩展到开放式、上下文可变的情境意义维度,例如 crow 在一个场景中是不祥的,在另一个场景中是社交或聪明的。分布模型(Harris, 1954 (https://arxiv.org/html/2605.22542#bib.bib1); Landauer and Dumais, 1997 (https://arxiv.org/html/2605.22542#bib.bib2))及其上下文后续模型(Peters et al., 2018 (https://arxiv.org/html/2605.22542#bib.bib3); Devlin et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib4))捕捉了丰富的基于使用的模式并能扩展到大型语料库,但语义结构——事件、参与者角色、氛围、情感联想——被隐含地编码在密集向量中,难以直接检查、比较或解释。指令微调的大语言模型展示了强大的上下文理解能力,并能产生上下文中词汇的细致解释,但其默认输出是自由形式的散文——非结构化,随提示条件变化,且跨使用实例难以系统比较或聚合。我们提出的框架借鉴了这三种传统,将框架语义学所强调的意义的情境、情感和文化维度进行操作化,同时兼具分布方法的可扩展性和大语言模型的生成能力。
我们提出**场景抽象**(Scene Abstraction)框架,将词汇意义视为结构化分布在解释性场景 \(\mathcal{S}(u,x)\) 上的模式,其中 \(u\) 是使用语境,\(x\) 是目标表达式。核心表征思想是:上下文中词义的某些方面可以通过其所实例化的结构化场景比仅通过其表层文本环境更有效地捕捉。该框架试图通过词汇使用实例中场景的特征模式来理解词汇意义的某些方面。如图1所示,每个场景包含两个互补组件:一个**语境场景** \(\mathcal{C}\) 捕捉更广泛的情境解释——事件、实体和背景——以及,关键的是,一个以目标表达式为中心的**表达轮廓** \(\mathcal{E}\),具体捕捉 \(x\) 在场景中的根基意义:它参与的事件、它在场景中承载的属性以及它唤起的情感联想。同一句子中的不同词汇将具有不同的表达轮廓:正是表达轮廓使得每个表达的意义实现变得明确和可检查。场景不是预定义的本体论类别,而是为每个使用实例动态构建的开放式解释性表征。
我们通过两个实验评估该框架,针对不同的验证目标。首先,一个**异常场景识别**任务评估构念效度:场景层面的区别是否构成人类之间可靠共享的判别性结构?自动生成的基于场景的表征是否在捕捉这些区别方面优于原始文本嵌入?其次,一项**人类偏好研究**评估输出质量:大语言模型生成的场景抽象是否与人类对上下文中词汇的解释一致?具体地,我们将它们与基于ATOMIC的常识轮廓(Sap et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib16); Hwang et al., 2021 (https://arxiv.org/html/2605.22542#bib.bib18))进行比较,后者是现有最接近的结构化情境推理替代方案。
本文做出以下贡献:
- • 我们引入**场景抽象**,一个双层框架,包括一个语境场景 \(\mathcal{C}\)(事件、实体、背景)和一个以目标表达式为中心的表达轮廓 \(\mathcal{E}\),通过大语言模型的小样本提示实现操作化。
- • 我们构建**COCA-Scenes**数据集,包含26个关键词的520个使用实例,旨在支持场景层面的评估。
- • 我们提供经验证据:基于场景的表征在与人类对齐的情境区分上优于纯文本嵌入(69.3% vs. 57.5% 准确率),并且大语言模型生成的场景抽象与人类对上下文中词汇的解释比基于ATOMIC的替代方案更一致(偏好率86.4%)。
## 2 相关工作
现有的词汇意义表征方法、情境特征描述以及常识知识的计算框架为当前工作提供了重要的见解。
##### 框架语义学。
框架语义学(Fillmore, 1976 (https://arxiv.org/html/2605.22542#bib.bib6), 1982 (https://arxiv.org/html/2605.22542#bib.bib7))提出,理解一个词需要访问关于它唤起的情境、参与者和关系的丰富背景知识。构式语法同样论证意义与结构化的情境知识不可分离(Goldberg, 1995 (https://arxiv.org/html/2605.22542#bib.bib9))。场景抽象建立在这一基础见解上,通过利用大语言模型为任何表达式和语境构建开放的、基于使用的场景表征,将其计算扩展。这一传统的主要大规模实现——FrameNet(Baker et al., 1998 (https://arxiv.org/html/2605.22542#bib.bib8))——关注框架语义学的一个特定方面:描述核心意义和谓词-论元结构的语义框架。相比之下,场景抽象不需要预定义的解释库,使其能够灵活地捕捉同一个词如何根据语境产生不同的意义,例如 crow 在一个场景中是不祥的,在另一个场景中是聪明或社交的。
##### 情境模型、脚本和场景。
关于话语理解的研究已经确定,语言理解涉及构建超越表面语言形式的丰富心理表征(Van Dijk et al., 1983 (https://arxiv.org/html/2605.22542#bib.bib10); Zwaan et al., 1995 (https://arxiv.org/html/2605.22542#bib.bib12); Zwaan and Radvansky, 1998 (https://arxiv.org/html/2605.22542#bib.bib11))。基于脚本的方法进一步强调在组织情境知识中刻板事件序列的作用(Schank and Abelson, 1977 (https://arxiv.org/html/2605.22542#bib.bib13)),并且这种结构已从大规模文本语料库中归纳出来(Chambers and Jurafsky, 2008 (https://arxiv.org/html/2605.22542#bib.bib14); Pichotta and Mooney, 2016 (https://arxiv.org/html/2605.22542#bib.bib15))。场景抽象借鉴了这一传统,但在两个方面有所不同。与情境模型不同,后者仍是隐式的认知表征,场景抽象将这些表征**外在化**为显式、结构化且计算可访问的形式。与脚本不同,后者围绕时间事件序列组织,场景更接近于**情境快照**:在给定时刻形成的结构化解释,其中事件、参与者、氛围和情感在一个实例内共同组织。场景抽象方法优先考虑这种**时刻内的**解释变异性,而非脚本编码的序列结构。
##### 分布与上下文语义学。
分布和上下文嵌入模型(Harris, 1954 (https://arxiv.org/html/2605.22542#bib.bib1); Lee and Goldwasser, 2018 (https://arxiv.org/html/2605.22542#bib.bib29); Peters et al., 2018 (https://arxiv.org/html/2605.22542#bib.bib3); Devlin et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib4); Wiedemann et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib24); Schlechtweg et al., 2020 (https://arxiv.org/html/2605.22542#bib.bib23))提供了强大的可计算性,但将语义结构隐含地编码在密集向量中,不直接暴露对情境词汇解释重要的事件结构、参与者关系、氛围或情感维度。Hoyle et al. (2023 (https://arxiv.org/html/2605.22542#bib.bib30)) 展示了通过大语言模型生成的命题外部化隐式交际内容,可以在下游任务中产生更好的文本表征。场景抽象受到类似观察的启发,但针对词汇意义的特定情境维度——事件、参与者、氛围和表达式特定的轮廓——组织成固定、可重用的模式,用于跨实例比较。由于每个场景组件可以独立编码为文本嵌入,产生的分布既可解释又可计算。
##### 常识与事件知识表征。
大规模常识知识图谱(Sap et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib16); Bosselut et al., 2019 (https://arxiv.org/html/2605.22542#bib.bib17); Hwang et al., 2021 (https://arxiv.org/html/2605.22542#bib.bib18))和基于叙述的因果知识资源(Mostafazadeh et al., 2020 (https://arxiv.org/html/2605.22542#bib.bib33))显著推进了隐式世界知识的表征——因果关系、社会动态和事件结构。然而,这些资源主要设计用于支持通用常识推理和叙述理解,而不是专门用于词汇意义的表征。它们的关系模式描述了日常情境中通常成立的内容,并不直接解决特定词汇的意义如何由其出现的具体语境塑造。场景抽象共享使隐式情境知识显式化的目标,但具体关注一个目标表达式在给定使用实例中做什么、暗示什么、唤起什么——这是常识知识资源设计上无法回答的问题。这一区别直接在实验2中测试,其中基于ATOMIC的轮廓一致地产生与人类对目标词情境化解释比对场景轮廓更少对齐的输出。
##### 大语言模型用于结构化语义生成。
大语言模型在生成结构化语义表征方面表现出强大能力(Brown et al., 2020 (https://arxiv.org/html/2605.22542#bib.bib5); Wei et al., 2022 (https://arxiv.org/html/2605.22542#bib.bib20); West et al., 2022 (https://arxiv.org/html/2605.22542#bib.bib19); Gilardi et al., 2023 (https://arxiv.org/html/2605.22542#bib.bib21); Wang et al., 2024 (https://arxiv.org/html/2605.22542#bib.bib22))。与我们的工作密切相关,Gu et al. (2022 (https://arxiv.org/html/2605.22542#bib.bib31)) 显示在回答问题之前显式阐述情境语境可以提高下游QA性能,提供了结构化情境阐述是语言理解中富有成效的中间步骤的证据。场景抽象在这些能力的基础上,通过提供一个固定的表征模式,将大语言模型的解释能力引导到更结构化和显式的场景表征中。
场景抽象从框架语义学继承了核心思想:词义根植于丰富的背景知识,包括情境、情感和文化维度。它进一步借鉴了话语理解研究的情境基础以及分布方法的可扩展性。它所贡献的是一种计算方法,用于在单个使用实例层面操作化这种背景知识:基于手动设计的场景模式,我们使用大语言模型为任何语境中的任何词构建结构化、易于解释的场景表征,具有很大的灵活性。
## 3 场景抽象框架
### 3.1 动机
我们框架的一个核心观察是,上下文中词汇的意义不仅仅是局部词汇共现的函数。当读者相似文章
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
S3Mem:面向长周期交互式问答的结构化时空场景事件记忆
S3Mem 提出了一种用于长周期交互式问答的结构化时空场景事件记忆框架,采用锚点敏感检索和令牌预算感知的证据接口,在多个环境中优于标准 RAG。
Lucida:组合式真实到模拟场景建模的解析、生成与放置
Lucida提出了一种用于组合式室内场景重建的方法,该方法通过解析、生成和放置分配需求,利用VLM策略从杂乱的捕获中创建高保真、可编辑的副本。
在语义约束下学习使用不熟悉部件组装新型结构
该论文提出了一种神经符号架构,通过整合自然语言和视觉演示中的语义约束,学习组装新型结构,实现了更高效的数据自适应在线学习。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。