SAGE:基于本体论解释维度的分层大语言模型文学评估
摘要
本文介绍了 SAGE,这是一个基于分层大语言模型的框架,通过基于本体的解释维度来评估文学质量。它在评估叙事的文化、情感和哲学方面表现出高可靠性和评分者间一致性,凸显了人类创作作品与大语言模型生成作品之间的差距。
arXiv:2605.07102v1 公告类型:新论文
摘要:评估文学质量需要对文化表现、情感深度和哲学深度等解释维度进行评估,而这些维度难以通过直接的计算方式进行测量。我们提出了 SAGE,这是一种分层评估框架,将文学质量分解为基于本体的解释维度,并通过具有多轮迭代反思和独立验证的结构化大语言模型进行评估。我们在三个分析层面(文化、情感-心理、存在主义-哲学)使用双模式评估方法,对 100 篇短篇小说(50 篇经典作品、30 篇通俗小说、20 篇大语言模型生成叙事)进行了验证。在 600 次评估中,该框架实现了 98.8% 的评分收敛性和超过 94% 的评分者间一致性,基于内容的评估与基于元数据的评估之间具有近乎完美的模式不变性。统计分析显示了一致的类型层次结构(经典 > 通俗 > 大语言模型,所有 p<0.001),并具有特定层面的区分度:文化批判和哲学深度的效应值非常大(Cohen's d>2.4),而情感表现的差距较小(d=1.68),这表明情感模式比批判立场或哲学深度更容易从训练数据中学习。跨层面相关性(r=0.649-0.683)确认这三个维度捕捉到了经验上可区分的品质侧面。这些发现表明,理论驱动的大语言模型评估可以达到测量级的可靠性,并支持系统性地识别当前生成模型在人类文学创作中不足之处,对开放式文本生成的可扩展自动化评估具有直接意义。
查看缓存全文
缓存时间: 2026/05/11 06:46
# 基于本体 grounding 的解释维度的分层 LLM 文学评估 **来源**: https://arxiv.org/html/2605.07102 **Tianyu Wang** https://orcid.org/0000-0002-9244-8798 [email protected] Mercy University, Math & Computer Science Department Dobbs Ferry, NY, USA & **Nianjun Zhou** https://orcid.org/0000-0002-3473-6097 [email protected] IBM T.J. Watson Research Center Yorktown Heights, NY, USA ###### 摘要 评估文学质量需要考察那些难以通过直接计算测量的解释性维度,如文化代表性、情感深度和哲学复杂性。我们引入了 SAGE,这是一个分层评估框架,将文学质量分解为基于本体的解释性维度,并通过具有多轮迭代反思和独立验证的结构化大型语言模型(LLM)进行评估。我们在三个分析层(文化、情感-心理、存在-哲学)上使用双模态评估,对该框架在 100 篇短篇小说(50 篇经典作品、30 篇通俗小说、20 篇 LLM 生成的叙事)上进行了验证。在 600 次评估中,该框架实现了 98.8% 的分数收敛性和超过 94% 的评分者间一致性,基于内容和基于元数据的评估之间具有近乎完美的模式不变性。统计分析揭示了一致的体裁层级(经典 >> 通俗 >> LLM,所有 $p < 0.001$),并具有层特异性区分度:文化批评和哲学深度表现出非常大的效应量(Cohen's $d > 2.4$),而情感表现显示出较小的差距($d = 1.68$),这表明与批判立场或哲学深度相比,情感模式更容易从训练数据中学习。跨层相关性($r = 0.649–0.683$)证实这三个维度捕获了经验上可区分的 quality 方面。这些发现表明,理论驱动的 LLM 评估可以达到测量级可靠性,并支持系统性地识别当前生成模型在哪些方面落后于人类文学创作,这对开放式文本生成的可扩展自动化评估具有直接影响。 ## 引言 大型语言模型(LLM)的近期进展使机器能够生成越来越复杂的叙事文本,包括短篇小说、剧本甚至长篇小说。这些发展为人工智能和人文学科提出了一个根本性问题:机器生成的叙事能否实现传统上与人类创作作品相关的文学品质?虽然大量研究集中在提高语言模型的生成能力上,但相比之下,对其产生的叙事的文学质量评估问题关注的较少。 为了说明文学评估的挑战,考虑弗朗茨·卡夫卡《变形记》的开篇句(?): > “一天早晨,格里高尔·萨姆沙从不安的梦中醒来,发现自己躺在床上变成了一只巨大的甲虫。” 这句话建立了几个通常与重要文学作品相关的元素:独特的叙事声音、引人注目的象征性前提,以及一种邀请心理和哲学解释的氛围。在故事过程中,格里高尔·萨姆沙的变形被解释为代表异化、存在焦虑以及个人与社会之间脆弱的关系。这些意义不仅仅来自句子表层结构,而是来自叙事背景、主题发展和读者解释之间的更深层次互动。 然而,自然语言处理中使用的大多数自动评估指标将无法捕捉这些方面。BLEU、ROUGE 和 BERTScore 等度量(?;?;?)主要是为机器翻译或摘要等任务设计的,依赖于与参考文本的词法或嵌入相似性。虽然在这些上下文中很有用,但此类指标在开放式生成任务中与人类判断的相关性较弱,并且特别适合评估叙事小说(?;?)。 文学作品并不完全由与现有文本的表层相似性定义;相反,它们的特征在于叙事结构、主题意义、情感共鸣、文化背景和哲学解释之间的复杂互动。虽然计算方法可以可靠地评估卡夫卡的语言精度、句法结构和主题组织——对应于较低分析层(L1–L3)的属性——但它们无法评估定义故事经典意义的象征、心理和存在维度。 这一挑战反映了一个更深的概念性问题。文学评估并不对应于一个可以简化为标量分数的单一、理论中立的 quality 概念。相反,文学批评传统上在多个解释维度上检查作品。评估的一些方面涉及可通过语言和叙事方法分析的可见文本和结构属性,如语法流利度、话语连贯性和主题组织。这些方面在计算语言学和计算叙事学中得到了广泛研究。先前的研究已经开发了分析文本内聚性和连贯性(?)、建模话语结构和基于实体的连贯性(?),以及在文本中识别叙事模式(?;?)的方法。这种方法表明,较低层次的叙事属性通常可以使用自动方法以合理的可靠性进行分析。 相比之下,文学评估的其他方面涉及从文本、读者和文化背景的交互中出现的解释性构造。这些包括文化代表性、情感-心理体验和哲学反思。这些文学解释维度传统上是人类读者和评论家的领域,很难使用传统的文本相似性指标或表层语言分析来捕捉。 大型语言模型的最近进展表明,此类模型可能能够对高层叙事意义进行推理,使其成为结构化文学评估的有前景工具。在这项工作中,我们提出了 **SAGE**(Systematic Assessment of Generative Excellence,生成卓越的系统评估),这是一个围绕**本体分解**组织的分层评估框架:即认识到评估维度在认识论种类上不同,因此需要不同的评估方法。在整个论文中,**本体**指的是按认识论类型对评估维度进行的结构化分类,而不是形式知识表示或语义网本体。较低层关注可使用既定 NLP 技术分析的可观察文本和叙事属性,而较高层则捕捉文学的解释维度,包括文化代表性、情感-心理体验以及存在或哲学参与。通过在這些层上结构化评估,该框架提供了评估叙事文本的多维方法,而不是将文学质量简化为单个数值分数。 在实践中,我们的主要焦点是较高层(L4–L6),因为较低层(L1–L3)可以通过现有的基于规则和统计方法有效处理,而 L4–L6 中的解释维度需要只有最近通过现代大型语言模型才可用的推理和上下文理解能力。 该框架的目的不是提高 AI 编写的叙事的生成,而是检查机器生成的故事是否能够满足传统上应用于人类创作作品的相同文学评估维度。特别地,我们调查由大型语言模型产生的叙事是否表现出对应于多层文学解释的属性。通过关注较高的解释层(L4–L6),我们解决了计算文学研究中的一个根本问题:自动化系统能否参与传统上需要人类批判判断的文化、情感和哲学维度? 为了实证探索这些问题,我们检查了来自三个广泛类别的叙事:经典文学作品、商业类型小说和由大型语言模型生成的故事。这些类别不被视为文学质量的绝对指标;相反,它们代表了文学评估历史上发生不同背景。我们引入了两个互补的评估设置。在**内容限制评估**中,评估直接基于叙事作品的文本内容。在**标题限制评估**中,评估依赖于与作品标题或声誉相关联的外部批评知识,近似于在更广泛的文学话语中发生的评估形式。比较这两种设置允许我们调查不同信息来源如何影响文学判断。 我们的研究由以下研究问题指导: * **RQ1 (可靠性)**: 基于 LLM 的文学评估能否在多个评估层上产生稳定和可复制的评估? * **RQ2 (区分能力)**: 评估是否能在来自不同背景的叙事之间进行有意义的区分,包括经典文学、类型小说和 LLM 生成的文本? * **RQ3 (评估鲁棒性)**: 在不同的信息条件下,例如直接文本分析与基于声誉的上下文知识,评估结果如何变化? * **RQ4 (维度独立性)**: 所提出的评估维度在两个层面上是否非冗余:在每个层内(例如,第 5 层中的情感复杂性和心理内省是否捕获了情感表现的不同属性?)以及跨层(文化、情感-心理和存在-哲学表现是否构成真正独立的质量维度?),从而支持文学质量本质上是多维的观点? ##### 贡献 这项工作有三项贡献。首先,我们引入了 **SAGE**(生成卓越的系统评估),这是一个分层框架,将文学质量分解为六个分析上不同的层,将基于规则的可见文本属性评估(L1–L3)与基于 LLM 的解释维度评估(L4–L6)分开。每个解释维度都通过来自文学经典的示例对比进行 grounding,证明这 12 个维度是非冗余的:经典作品在理论动机的轴线上占据不同的位置(例如,海明威具有高情感复杂性和近乎零的心理内省,而伍尔夫则两者都高),独立于实验结果建立了构念效度。其次,我们设计了一个双轨评估架构,包括五轮迭代自我反思和独立交叉验证,具有层特定的偏差缓解策略,能够大规模可靠、可复制地评估解释性构造。第三,我们呈现了一项受控实证研究,比较经典文学、商业类型小说和 LLM 生成的叙事在三个解释层上的表现,揭示了一种能力剖面,区分了模式可复制的文学技能与需要立场的技能,并确定了当前生成模型在哪些方面系统地落后于人类的文学成就。代码、评估提示、数据集和结果可在 https://github.com/tisage/sage-eval 公开获取。 ## 相关工作 标准的 NLG 指标包括 BLEU(针对参考翻译的 n-gram 精确度(?))、ROUGE(面向摘要设计的召回导向重叠(?))和困惑度,它们衡量与参考文本的表层相似性,与人类对叙事质量的判断相关性较差(?;?)。基于嵌入的方法如 BERTScore(?)通过上下文表示提高了语义覆盖范围,但仍然难以处理跨越扩展叙事的话语级属性。应用于卡夫卡的《变形记》,此类指标可能会捕捉词汇模式或句子级连贯性,但会错过作为异化的转变的象征重量、格里高尔内省的心理复杂性或对现代生活的存在主义批评,正是这些解释维度定义了文学意义。 特定于叙事的框架已将评估扩展到文本和结构质量维度。HANNA 基准(?)提供了 1,056 个人工标注的故事,在包括连贯性、同理心和参与度在内的六个标准下进行评估,系统比较显示现有指标以有限的一致性捕获质量的不同方面。NarraBench(?)提出了一个理论信息的叙事理解任务分类法,调查了 78 个现有基准以系统化评估方法。Yang 和 Jin(?)将准确性、完整性、适当性、洞察力和一致性确定为经常评估的质量维度,同时指出缺乏同时捕获这些维度的统一框架。SCORE 框架(?)通过动态状态跟踪评估角色一致性、情感连贯性和情节跟踪。互补的方法通过实体分布模式(?)、情感轨迹分析(?)和分形情感结构(?)检查话语连贯性。总的来说,这些方法捕获了叙事文本的表层和结构属性,但没有解决区分经典文学与胜任但不引人注目的散文的解释维度。 文化代表性、情感-心理复杂性和哲学参与——文学批评核心的解释维度——在计算评估框架中受到的关注有限,尽管在相关但不同的问题上进行了大量工作。 **文化代表性**。NLP 研究 extensively 研究了语言模型中的偏见检测和公平性(?;?),检查文本如何编码刻板印象、权力不对称和文化假设。然而,这项工作主要集中于识别有害表示,而不是评估文化参与的复杂性。文学评估需要评估文本是否表现出对文化系统、权力结构和社会关系的细致理解,这些问题受文化理论(布迪厄的文化资本、赛义德的东方主义、斯皮瓦克的属下研究)的启发,而不是公平性指标。没有任何现有框架系统地评估文化代表性作为文学质量的维度。 **情感-心理深度**。情感分析和情绪识别系统沿效价维度或基本情绪类别对文本进行分类(?)。虽然有助于理解情感模式,但这些方法并未捕捉到文学中复杂情感表现的复杂性、模糊性和粒度。文学评估需要评估情感复杂性(矛盾情绪、模糊性)、心理内省(访问角色的内心世界)和情感粒度(感觉状态的精确区分),这些维度植根于情感理论和叙事心理学,而不是情感分类。现有的计算方法并不将情感-心理复杂性作为文学质量进行评估。 **哲学参与**。主题建模(?)和主题
相似文章
什么是好?从LLM推理轨迹中提取并测试文学质量的隐含理论
本文通过分析具备推理能力的LLM在评价从诺贝尔文学到论坛帖子的文本时的推理轨迹,提取这些模型关于文学质量的隐含理论,并通过系统性地降低文学段落质量来测试这些理论。模型对结构和语体的敏感度高于词汇。
SAGE:用于 LLM 知识评估的可扩展自动化鲁棒性增强
本文介绍了 SAGE,这是一个用于 LLM 知识评估基准测试的可扩展自动化鲁棒性增强框架。该框架使用经过强化学习微调的小模型,以低于现有方法的成本生成和验证问题变体。
清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性
本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
LLMs在学术工作流中的应用:对短上下文窗口与长上下文窗口LLMs生成文献综述的评估
本文评估了使用短上下文窗口和长上下文窗口的大语言模型生成的文献综述,发现较长的上下文能提高信息整合能力,但加剧了重复和描述性过强等问题,因此需要人工监督以确保学术标准。