能够灵活生成意义与表达替代方案的语用推理计算模型

arXiv cs.CL 论文

摘要

提出SAGE,一种结合语言模型与认知模型的神经符号框架,用于语用推理,并通过包括指称表达生成和含意在内的三个案例研究进行验证。

arXiv:2607.18443v1 公告类型:新论文 摘要:语用语言使用需要对替代方案进行推理:说话者可能选择的其他表达方式,或听话者可能拥有的其他解读。因此,形式化与计算语用学模型必须指定对话者所推理的替代方案集合,而这通常通过手动指定完成。本文提出一个框架——ScAffolded Generative models for Explanation (SAGE),它结合了认知模型的解释透明性与语言模型(LM)的生成灵活性。SAGE将语用过程分解为三类模块:提议器(利用LM生成一个开放的候选替代方案空间)、评估器(评估这些替代方案的语义、复杂性或典型性等)以及选择器(实现基于规则的认知驱动任务分析计算步骤)。我们通过三个案例研究评估SAGE,涵盖语用生成与解释——指称表达生成、方式(M-)含意以及格赖斯会话含意。使用计算认知建模中的既定方法对SAGE模型进行严格评估,包括消融实验、基线比较以及与人类数据的定量拟合。在各项研究中,SAGE模型均实现了高准确率,且通常优于基线模型,但组件级分析揭示了一种不对称性:LM提议器能可靠地生成适合语用建模的替代方案,而LM评估器更擅长提供直觉判断,而非理论或形式化度量判断。本文还讨论了神经符号模型作为人类语用语言使用的候选解释性理论的潜力与局限性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# 基于意义与表达候选项灵活生成的语用推理计算模型
来源:https://arxiv.org/html/2607.18443 \\noautomath Polina Tsvilodub1\*\*1\*\*通讯作者:polina\.tsvilodub@uni\-tuebingen\.de, Fausto Carcassi2, Michael Franke1 1蒂宾根大学,2阿姆斯特丹大学

###### 摘要
语用语言使用需要推理候选项:说话人可能选择的其他表达,或听话人可能考虑的其他解释。因此,形式化和计算语用学模型必须指定对话者所推理的候选项集合,这通常通过手动指定完成。本文提出一个框架,即**解释的支架式生成模型**(SAGE),它将认知模型的解释透明度与语言模型(LM)的生成灵活性相结合。SAGE将语用过程分解为三类模块:*提议器*(使用LM生成开放式的候选候选项空间)、*评估器*(评估这些候选项,例如其语义、复杂性或典型性)以及*选择器*(实现认知动机任务分析的基于规则的计算步骤)。我们通过三个案例研究评估SAGE,涵盖语用生成与解释——指称表达生成、方式(M-)含义和格莱斯会话含义。SAGE模型使用计算认知建模的既定方法进行批判性评估,包括消融实验、基线比较以及与人类数据的定量拟合。在各项研究中,SAGE模型实现了高准确率,且通常优于基线,但组件层分析揭示了一种不对称性:LM提议器可靠地生成非常适合语用建模的候选项,而LM评估器在提供直觉判断方面优于提供理论或形式度量判断。我们讨论了神经符号模型作为人类语用语言使用候选解释性说明的前景与局限性。

**关键词:** 语用学,计算建模,灵活候选项生成,语言模型

## 1 引言
人类能够在各种语境中轻松地生成信息丰富、相关且高效的 utterances,并理解它们。这种语用语言使用传统上通过识别合作沟通的一般原则来解释[[例如,]grice1975logic,atlas1981clefts,Ho rnDivisionofLabor1984,SperberWilson1995:Relevance:\-Comm,levinson2000presumptive]。如果假设说话人遵循这些原则,听话人可以从字面意义之外推导出丰富的语境意义。许多后续工作试图用形式化或计算认知模型来阐明这些语用推理模式,其中说话人选择情境适当的表达,而听话人则推理说话人行为的语境可能解释。突出的例子包括最优性理论[[例如,]BlutnerZeevat2004:Optimality\-Theo,Rooijvan\-RooijFranke2015:Optimality\-Theo],决策或博弈论[[例如,]Parikh1988:Language\-and\-st,BenzJager2006:Game\-Theory\-and]以及贝叶斯概率建模[[例如,]frank2012predicting,degen2023rational]。尤其是后者最近在解释各种语用现象方面相当成功,如非字面语言使用[[例如,]kao2014nonliteral,kao2014formalizing],模糊性[[例如,]LassiterGoodman2015:Adjectival\-vagu]或各种形式的含义[[例如,]BergenLevy2012:Thats\-what\-she\-]。

人们广泛认识到,语用语言使用涉及对候选项的推理:无论是说话人考虑的其他表达,还是听话人设想中的其他解释[[例如,]FoxKatzir2011:On\-the\-Characte,BuccolaKriz2021:Conceptual\-alte,ReppSpalek2021:The\-Role\-of\-Alt,GotznerRomoli2022:Meaning\-and\-Alt]。因此,形式化或计算模型必须指定对话者推理的其他表达和其他意义。虽然存在关于候选项生成的原则性理论[[例如,]Katzir2007:Structurally\-De]和候选项意义[[例如,]Franke2011:Quantity\-Implic],但它们尚未导致能够处理开放式语言(而非受限示例集)的计算模型。\^2\^2在离散状态推理模型中,决策选项、世界状态或其他离散实体需要被加权或审议,候选项指定的问题更为普遍[[例如,]RutarWolff2022:Structure\-Learn,wong2025modeling]。

一个关键的困难在于,在开放式语境中,候选项依赖于相关**世界知识**[例如,lake2017building],这可能包括其他表达和意义、语言的语法能力、关于事件、物体及其特征的常识知识、社会习俗知识等等。建模实践提供了三种主要策略来提供这些候选项并在特定实验语境中评估它们。首先,研究人员可以手动指定一个小的相关候选项空间和评估输出。这种指定可以基于理论考虑、研究人员的直觉,或为了优化模型预测而构建。手动指定很常用,但限制了模型对新异且可能是开放式语境的适用性和灵活泛化能力。其次,世界知识可以通过辅助实验从人类参与者那里引出。这通常在概率推理模型中用于提供关于直觉先验的信息[[例如,]kao2014nonliteral,franke2016does]。然而,这种方法昂贵且繁琐,并且迄今为止尚未广泛应用于引出关于解释和话语候选项的信息。最后,世界知识可以由AI模型(特别是语言模型(LM))生成和评估,LM是经过统计训练的工具,可以通过“特设辅助引出实验”轻松查询推理候选项和评估。在本文中,我们通过详细且全面的案例研究来探讨这第三种方法。

最近最先进的LM是丰富认知建模中提供和评估候选项工具集的自然选择,因为它们补充了离散状态推理模型。虽然缺乏程序透明度并且可以说缺乏解释潜力[[例如,]Deemter2023:Dimensions\-of\-E],但LM能生成自然流畅的语言,很好地扩展到不同语境、领域,甚至在不同非语言任务上表现令人印象深刻[[例如,]devlin\-etal\-2019\-bert,srivastava2023\-BIGbench,PerezRinger2023:Discovering\-Lan,openai2023gpt4,touvron2023llama]。LM可以用作知识库[[例如,]petroni2019language]甚至作为人类直觉常识知识的近似[[例如,]petroni2019language,ParkOBrien2023:Generative\-Agen],这导致了最近一条将LM整合到更大计算程序中的研究路线[[例如,]yao2023tree,liu\-etal\-2022\-generated],或与各种计算工具结合用于数学问题求解[[例如,]he2023solving]、复杂推理[[例如,]creswell2022selection,he2023solving,paranjape2023art,poesia2023certified]或编程任务[[例如,]gao2022pal]。

在本文中,我们概述了一个新框架,旨在结合认知模型和LM的优势,生成透明且原则上具有解释性的计算模型,用于人类语用语言使用,这些模型可以应用于语境化的语言解释和生成,超越预先指定的候选项集合。我们称此框架为**解释的支架式生成模型**(SAGE![[未加标题的图像]](https://arxiv.org/html/2607.18443v1/figs/icon_SAGE.png))。图1(https://arxiv.org/html/2607.18443#S1.F1)(A)提供了SAGE框架的示意图。该框架将认知过程的显式任务分析实现为模块之间的信息流。我们区分三类模块。第一,**提议器**生成推理或选择的候选项。在我们的案例研究中,提议器模块由语言模型实例化,因此整体模型是开放式的,不完全依赖手动指定候选项集合。第二,**评估器**处理提议器模块中生成的潜在不受限制的候选项。这可能包括,例如,判断候选项意义的可能性,或者特定表达在给定情境中是否为真。评估器将基于规则的组件与LM生成的候选项连接起来。来自提议器和生成器的信息通过**选择器**模块加以利用,这些模块实例化了假定任务分析的计算步骤,超出了候选项的生成和评估。正如我们在本文中演示的,由此产生的计算模型可以通过在目标测试项数据集上重复模拟来评估,并可以直接与人类实验的经验数据进行比较。

参见图注
图 1:(A) 我们框架 SAGE 的概述(在此用符号表示,见图注),用于更开放式的对人类语用语言使用的认知建模。该框架识别了三类**模块**,它们由认知动机的**解释性任务分析**提供支架:提议器、评估器和选择器。我们使用语言模型实例化神经模块(见图注),这些模块提出并灵活评估计算模型通常需要的更开放式的推理候选项空间,这些推理在显式选择器模块(见图注)中加以利用。模型以文本数据集为输入,并可能设计生成文本或数值预测,以解释语用语言理解或生成。
(B) 通过计算认知建模中的常用方法和测量,仔细评估计算模型的解释充分性以及神经组件的性能。具体来说,我们对两个新模块(提议器和评估器)进行压力测试,并在语用语言生成和理解案例研究中评估 SAGE。案例研究和评估的关键结果总结在表中。

SAGE模型是一种简单的神经符号模型,它将神经生成和评估(使用LM)与符号化或算法化的任务分解相结合,从而利用这些方法各自优势,同时弥补各自的局限性[[例如,]romero2023synergistic,bhuyan2024neuro]。SAGE方法也与近期关于LM智能体的工作有明显的相似之处,在这些工作中,LM为解释性离散状态推理模型提供信息[[例如,]liu2023agentbench,sumers2023cognitive,shinn2023reflexion,wang2024survey]。然而,LM智能体主要用于实际应用和提高特定任务的性能,较少强调**解释**人类推理或语言使用[[例如,但见]nye2021improving,romero2023synergistic,wong2023word,frank2025cognitive]。与其他试图弥合语言模型与认知模型之间差距的尝试一致[[例如,]bourgin2019cognitive,nye2021improving,binz2023turning,frank2023large,wong2023word,BinzAkata2024:Centaur:\-a\-foun,FrankeTsvilodub2024:Bayesian\-Statis,frank2025cognitive,sucholutsky2025using],在本文中,我们探索神经符号模型作为**认知模型**来解释人类语言使用的潜力[[例如,类似于]tsvilodub2025integrating,tsvilodub2025non,spinoso2025rsa]。由于对可信的经验解释的要求非常高,我们专注于探索SAGE方法在选定任务上的解释潜力,使用计算认知科学的既定工具,例如在任务性能、对解释项的预测准确性以及与人类数据的定量拟合方面对模型进行系统比较(参见图1(https://arxiv.org/html/2607.18443#S1.F1)(B)的示意图)。我们将在第5节(https://arxiv.org/html/2607.18443#S5)中返回关于SAGE模型是否(曾经)可能成为研究人类认知的解释性模型的批判性讨论。

在下文中,我们报告三个案例研究,这些研究被选出来涵盖语用语言生成和解释的不同方面,涉及不同任务和不同解释目标(参见表1(https://arxiv.org/html/2607.18443#S1.T1)的概述)。第一个案例研究(第2节,https://arxiv.org/html/2607.18443#S2)聚焦于指称表达的生成[[例如,]krahmer2012computational],该任务传统上作为计算语用建模和计算语言学的测试床。这建立在我们先前的工作基础上[[例如,]tsvilodub2024cognitive],该工作建立在指称表达生成的经典算法任务分析之上,将其视为一个迭代过程[[例如,参见]newell1972human,Ferreira2019:A\-Mechanistic\-F],例如,在**增量算法**中实例化[[例如,]dale1995computational]。这个过程关键依赖于一组适当的候选项表达,语用说话人将从中构建一个用于识别目标的语用表达。SAGE模型使用基于LM的提议器来生成候选项。为了评估候选表达的适当性,LM评估器模块评估自由生成候选项的语义。我们通过任务性能(即唯一识别目标指称对象的能力)的视角来评估这个SAGE模型。接下来,第3节(https://arxiv.org/html/2607.18443#S3)聚焦于对所谓的M-含义这一特例进行语用语言解释建模[[例如,]levinson2000presumptive,Rett2020:Manner\-implicat],这是一种现象,其中语用听者推断一个非典型的、有语言标记的表达标志着一个非典型的世界状态。根据[[例如,]Jager2002:Some\-Notes\-on\-t]为**双向最优性理论**[[例如,]BlutnerBOTJoS2000]提出的一个突出的算法解释程序,M-含义的计算依赖于评估表达、状态和候选项的典型性。因此,这个案例研究测试了LM提议器能否自动生成那些自然编码典型性的候选项表达(即,用于更典型情境的候选项表达比用于非典型情境的更典型)。此外,我们调查了LM评估器是否可用于提供关于世界状态和表达典型性的显式评估。我们基于该模型预测理论上预期的M-含义(即解释项)的能力(针对一组可变测试项)来评估此结果模型。在第三个案例研究中(第4节,https://arxiv.org/html/2607.18443#S4),我们调查一个单一的语用解释模型如何处理更大种类的含义。任务支架将**溯因推理**形式化,该推理根植于通过关于**格莱斯会话准则**的推理来合理化说话人行为[[例如,]grice1975logic]。这个案例研究相比前两个案例研究有所创新,它使用LM提议器来生成情境适当的解释。这些解释是使用LM评估器生成的,这些评估器识别出有助于推理的会话准则方面。

相似文章

STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

arXiv cs.CL

This paper introduces STRIVE, an LLM-based framework for jointly generating and evaluating controlled event sets for psycholinguistic plausibility judgments. Experiments show that adding a global reasoning scratchpad and evaluator-guided refinement substantially improves generation quality, though near-boundary events remain challenging.