构建视角的空间结构

arXiv cs.CL 论文

摘要

本文回顾了NLP中“视角”的概念,提出了沿特定性轴排列的视角相关概念层级,并展示了该层级如何帮助研究者选择恰当的操作化定义。

arXiv:2608.12113v1 公告类型:新 摘要:同一事件可能因作者或说话者的经历、背景和信念而以不同视角被报道。NLP的多个领域都涉及视角,范围从文本分析到算法优化。已有多种操作概念(如立场、情感、框架和论点)被用于捕捉文本中的视角,然而这些概念之间的确切关系仍不明确。可以说,对这些概念更深入的理论理解将有助于更有效地开展视角研究。在本文中,我们通过回顾NLP中视角的空间并定义一组有助于区分视角相关概念的属性来弥补这一空白。我们的分析使我们提出了一个层级结构,将这些概念沿单一轴线线性排列。最后,我们展示了这一原则性的概念层级如何帮助研究者导航该领域,并选择与其具体研究目标相一致的视角操作化定义。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:29

# 视角空间的结构化 来源:https://arxiv.org/html/2608.12113 ###### 摘要 同一事件可能因作者或说话者的经历、背景和信仰的不同而以不同的视角被报道。NLP的多个领域都涉及视角,从文本分析到算法优化。一系列广泛的操作性概念(如立场、情感、框架和论点)已被用于捕捉文本中的视角,然而这些概念之间的精确关系仍不清楚。可以说,对这些概念更深层次的理论理解将有助于更有效地进行视角研究。在本文中,我们通过回顾NLP中的视角空间,并定义一组有助于区分视角相关概念的属性,来弥合这一差距。我们的分析使我们提出一个层级结构,将这些概念沿单一轴线性组织。最后,我们展示了这一有原则的概念层级如何帮助研究者导航该领域,并选择与其特定研究目标相一致的视角操作化定义。 ## 1 引言 图1:一个包含与视角相关的关键概念的视角模型。该方案将它们排列在一条特异性轴上,范围从意识形态概念到具体语言装置,如§4.3(https://arxiv.org/html/2608.12113#S4.SS3)所述。文本外因素显示在单独的框中。每天我们通过不同的文本类型接触到各种各样的信息,从产品评论和社交媒体帖子等个人相关内容,到政治辩论和新闻文章等官方制作。虽然有些文本明确表达个人观点,但其他文本旨在报道事实信息。然而,它们都将某种视角投射到世界上。事实上,视角采择是人类沟通的先决条件(Graumann and Kallmeyer 2008 (https://arxiv.org/html/2608.12113#bib.bib76))。NLP社区长期以来一直在研究视角,但近年来兴趣日益增长。这一趋势已在许多(子)社区中并以各种标签展开(参见图1(https://arxiv.org/html/2608.12113#S1.F1))。概念和框架的多样性使得阐明不同研究之间的联系、识别现有研究中的空白,以及揭示个别研究背后的理论背景和假设变得具有挑战性。例如,想象一位研究者旨在构建一个多视角新闻推荐系统,或使语言模型生成文本中的观点多样化:他们应该了解哪些概念和哪些研究?正如Reuver et al. 2021a(https://arxiv.org/html/2608.12113#bib.bib165)所指出的,弥合自然语言处理(NLP)领域的视角框架对于推进信息消费和传播中的民主价值观至关重要。 ##### 术语“视角” 一个视角通常指示对现实的一种看法。历史上,该术语在研究领域中被以多种方式使用。在叙事理论中,它仅指话语中特定角色或叙述者内部视角的定位(Sanders and Redeker 1993 (https://arxiv.org/html/2608.12113#bib.bib178))。从认知的角度来看,现实本身已被证明是视角的集合(Basile et al. 2022 (https://arxiv.org/html/2608.12113#bib.bib20))。在话语研究和语言学中,语义和句法选择如何触发视角化(或 vantage point taking)已被广泛研究,通过以行动者角色及其视角来表征事态;例如,谋杀的实施者是否被呈现为负责任的主体(Graumann and Kallmeyer 2008 (https://arxiv.org/html/2608.12113#bib.bib76))。近年来,视角主义的研究纲领采用该术语来指代注释和建模中社会人口、文化和个体特征的整体(Frenda et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib68))。在本文中,我们处理直接嵌入文本中的视角,并将文本外特征作为附加因素进行讨论(参见图1(https://arxiv.org/html/2608.12113#S1.F1))。基于其在NLP文献中的通用用法,我们采用“视角”作为总称,以有待进一步阐明的方式包含相关概念。 ##### 在NLP中的相关性 识别文本中视角的兴趣主要有两个目标:i)视角识别;ii)视角生成。关于第一个目标,视角传统上表示政治取向(Pang et al. 2008 (https://arxiv.org/html/2608.12113#bib.bib152);Küçük and Can 2020 (https://arxiv.org/html/2608.12113#bib.bib103));例如,自由派与保守派。然而,其含义通常被扩展以表示其他相关概念,如观点(Morante et al. 2020 (https://arxiv.org/html/2608.12113#bib.bib138))、立场(Klebanov et al. 2010 (https://arxiv.org/html/2608.12113#bib.bib102);Roy and Goldwasser 2023 (https://arxiv.org/html/2608.12113#bib.bib173))、框架(Liu et al. 2019 (https://arxiv.org/html/2608.12113#bib.bib117);Alashri et al. 2015 (https://arxiv.org/html/2608.12113#bib.bib7))、情感(Yu and Hatzivassiloglou 2003 (https://arxiv.org/html/2608.12113#bib.bib226);Greene and Resnik 2009 (https://arxiv.org/html/2608.12113#bib.bib77))以及主张(Chen et al. 2019 (https://arxiv.org/html/2608.12113#bib.bib44))。关于第二个目标,LLM的兴起引入了关于视角的新研究问题:训练使用了什么类型的数据和注释?它们是否偏向特定观点(Lin et al. 2025 (https://arxiv.org/html/2608.12113#bib.bib110);Ceron et al. 2025 (https://arxiv.org/html/2608.12113#bib.bib39))?这些模型能否在摘要中保留多种和少数视角(Van Der Meer 2024 (https://arxiv.org/html/2608.12113#bib.bib202)),并在生成中再现不同意见(Hu et al. 2025 (https://arxiv.org/html/2608.12113#bib.bib86))?在AI应用中生成多样视角是可取的,以促进与民主价值观的一致性,并确保某些观点不被低估(Sorensen et al. 2024b (https://arxiv.org/html/2608.12113#bib.bib191))。 ##### 先前工作 许多综述聚焦于视角相关的概念和任务。这有助于进行详细调查,但限制了连接和组织它们的可能性——这是我们本文要解决的差距。其中,Pang et al. 2008 (https://arxiv.org/html/2608.12113#bib.bib152)提供了关于意见挖掘和情感分析的概述,Munezero et al. 2014 (https://arxiv.org/html/2608.12113#bib.bib141)关于主观性相关术语;Küçük and Can 2020 (https://arxiv.org/html/2608.12113#bib.bib103)关于立场检测,Doan and Gulla 2022 (https://arxiv.org/html/2608.12113#bib.bib56)关于政治视角检测,Otmakhova et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib150)关于媒体框架,以及Rodrigo-Ginés et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib170)关于媒体偏见(参见附录A.2(https://arxiv.org/html/2608.12113#A1.SS2)以获取更多参考文献)。所有这些概念都与观点如何在语言中表达有关,因此具有一些共同的语言特征。语言学中的一系列工作(Hunston and Thompson 2000 (https://arxiv.org/html/2608.12113#bib.bib89);Benamara et al. 2017 (https://arxiv.org/html/2608.12113#bib.bib22))使用术语“评价”来指代“说话者或作者对其所谈论的实体或命题的态度或立场、观点或感受”(Hunston and Thompson 2000 (https://arxiv.org/html/2608.12113#bib.bib89),第5页)。这阐明了视角的语言表层,并将讨论扎根于评价领域,而非事实知识。 ##### 贡献与结构 本文旨在通过提出两个研究问题来改进视角相关研究的现状:- •RQ1:用于识别文本中视角的概念有哪些?- •RQ2:这些概念之间如何关联?为了回答这些问题,我们首先基于文献介绍并刻画视角相关概念的空间(§3(https://arxiv.org/html/2608.12113#S3))。然后我们通过属性标注、聚类分析和主成分分析(PCA)(§4(https://arxiv.org/html/2608.12113#S4))来组织和结构化概念空间。分析的输出是图1(https://arxiv.org/html/2608.12113#S1.F1)所示的视角模型:我们发现视角相关概念的簇沿着概念和语言特异性的线性尺度形成层级。为了使这一洞见具有可操作性,我们提出了一个决策树(图5(https://arxiv.org/html/2608.12113#S5.F5)),以帮助研究者在所讨论的概念中做出与其特定研究目标相匹配的明智选择(§5(https://arxiv.org/html/2608.12113#S5))。 ## 2 论文收集 我们的论文不是完整的综述,而是一种概念组织,辅以综合的文献综述,旨在捕捉视角相关概念的空间及其定义和特征属性。为了理解NLP中与视角相关的概念,我们首先在ACL Anthology书目上进行了基于正则表达式的搜索,并选择了60篇论文(详见附录A.1(https://arxiv.org/html/2608.12113#A1.SS1))。由于该搜索未捕捉到一些为NLP中视角概念化做出贡献的基础性工作,也未涵盖邻近领域(例如传播学)的文献,我们继续在Google Scholar上手动收集论文,通过参考文献和相关工作中的引文追踪。论文被纳入分析如果它们:i)提供视角的定义;ii)以概念性方式使用视角,将其与类似工作区分开;iii)为某一术语建立概念基础。经过几次迭代,我们以自下而上的方式组织所有论文,最终形成一组相关概念。最终收集的论文数为227篇(完整列表见附录A.2(https://arxiv.org/html/2608.12113#A1.SS2))。 ## 3 视角相关概念 基于我们对现有文献的分析,我们收集了与视角相关的共15个概念。对于每个概念,我们对其进行刻画,并简要讨论相关的文本特征和计算建模中使用的方法(“视角信号”)。每个概念的区分性属性以粗体标记;语言层面以斜体表示。第3.9节(https://arxiv.org/html/2608.12113#S3.SS9)讨论这些概念如何相互关联,并提供两个统一示例。进一步的定义和额外示例可在附录B.2(https://arxiv.org/html/2608.12113#A2.SS2)中找到。 ### 3.1 道德与价值观 我们纳入道德与价值观,因为它们作为视角的基础,鉴于其与意识形态立场的接近性,在NLP中日益被研究(Graham et al. 2009 (https://arxiv.org/html/2608.12113#bib.bib75))。价值观通过影响所采取的立场和为其提供的理由来激发论点(Kiesel et al. 2022 (https://arxiv.org/html/2608.12113#bib.bib97);Atkinson and Bench-Capon 2021 (https://arxiv.org/html/2608.12113#bib.bib13);Van Der Meer 2024 (https://arxiv.org/html/2608.12113#bib.bib202))。它们构成了“所有评价过程的基础”(Van Dijk 1998 (https://arxiv.org/html/2608.12113#bib.bib205)),是“个体追求或珍视的内在善或理想”(Sorensen et al. 2024a (https://arxiv.org/html/2608.12113#bib.bib190)),例如自由和平等。道德在NLP文献中常与伦理一同研究,但它们源于不同的框架(Dönmez and Faleńska 2026 (https://arxiv.org/html/2608.12113#bib.bib60));它们是社会性的,编码了关于何为对或错的共享判断(Vida et al. 2023 (https://arxiv.org/html/2608.12113#bib.bib210);Graham et al. 2009 (https://arxiv.org/html/2608.12113#bib.bib75);Entman 1993 (https://arxiv.org/html/2608.12113#bib.bib63)),例如,造成伤害是错误这一道德原则被跨文化接受。 ##### 视角信号 价值观植根于心理学框架(例如,Schwartz 1992 (https://arxiv.org/html/2608.12113#bib.bib181)),并通常通过社会调查进行操作化,如世界价值观调查(Inglehart et al. 2000 (https://arxiv.org/html/2608.12113#bib.bib90))。虽然价值观难以在文本中发现,因为它们是高层构念,但一些评价标记可以被识别,例如对目标或(未)成就的提及(Hunston and Thompson 2000 (https://arxiv.org/html/2608.12113#bib.bib89))。道德研究通常参考道德基础理论(MFT)(Graham et al. 2009 (https://arxiv.org/html/2608.12113#bib.bib75)),该理论识别出五个美德/恶习维度:关爱/伤害、公平/欺骗、忠诚/背叛、权威/颠覆以及纯洁/堕落。道德基础词典(Graham et al. 2009 (https://arxiv.org/html/2608.12113#bib.bib75))将词汇项映射到这些维度。道德与价值观也被操作化为框架——某些价值观,如安全,与媒体框架标签重叠;在语义层面上,道德框架将MFT维度与行动者和对象相关联(Roy et al. 2021 (https://arxiv.org/html/2608.12113#bib.bib174))。最近关于NLP中道德与价值观的工作主要集中在生成多元价值观(Sorensen et al. 2024a (https://arxiv.org/html/2608.12113#bib.bib190))以及评估LLM的意识形态(Ceron et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib38);Benkler et al. 2023 (https://arxiv.org/html/2608.12113#bib.bib23))和道德(Abdulhai et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib1))对齐,或通过强化学习进行诱导。 ### 3.2 意识形态 虽然道德与价值观提供了指导决策的总体信念,意识形态是将其组织成一群人共享的稳定观念集的一致系统。意识形态是稳定的,因为它锚定在一个共享的核心价值系统中,该系统作为跨主题和情境的评估标准;就像语言的语法一样,是其规则的参照点(Van Dijk 1998 (https://arxiv.org/html/2608.12113#bib.bib205),第56页)。由于它锚定在群体层面的承诺上,意识形态在比立场或情感更高层次的抽象上运作(它们是粒度的和可变的),并且可以被解释为对齐意见的簇(Van Dijk 1998 (https://arxiv.org/html/2608.12113#bib.bib205);Doan and Gulla 2022 (https://arxiv.org/html/2608.12113#bib.bib56))。在NLP中,意识形态被用于政治领域(Pang et al. 2008 (https://arxiv.org/html/2608.12113#bib.bib152))。它表现为(i)辩论中的立场(如亲以色列与亲巴勒斯坦),(ii)光谱上的政治倾向(如左翼与右翼),或(iii)政党归属(如民主党与共和党)。意识形态偏见检测任务将文本分类为有偏见或无偏见(或在两者之间的尺度上),衡量意识形态倾斜的程度(Rodrigo-Ginés et al. 2024 (https://arxiv.org/html/2608.12113#bib.bib170)),这可以说假设了中性、事实性文本的存在(Vargas et al. 2023 (https://arxiv.org/html/2608.12113#bib.bib209))。注意,虽然偏见检测识别文本是否在意识形态上倾斜而不指定取向,意识形态检测则将其归属为...

相似文章

通过潜在视角评估LLMs中的多元性

arXiv cs.CL

本文介绍了一个领域无关的多层框架,用于无监督提取视角,以评估LLM生成文本中的多元性,发现稀有视角被不成比例地低估。

换种视角:在计算创造力中用四世界框架建模解释性视角

arXiv cs.AI

本文提出了一个四世界框架,用于在计算创造力中对解释性视角进行建模。研究以GPT-4.1作为基于角色的评估器,对SemArt数据集中的1,069件艺术品进行评估。结果显示,形式主义、社会历史与图像志三种视角之间存在系统性分歧;CLIP探针揭示了每种视角对应的不同方向向量。

基于身体的人工代理视角形成与意动调适

arXiv cs.AI

本文提出了一种用于人工代理的基于身体的视角形成的最小架构,通过引入内感受生存能力信号和意动对齐机制来扩展先前工作,从而从现象学角度将机器主体性操作化。

关注视角:为心理理论进行递归推理

arXiv cs.AI

介绍RecToM,一种推理时框架,通过递归视角构建来建模嵌套信念,用于大语言模型的心理理论推理,在多个基准上取得了最先进的性能。