大型语言模型中不确定条件下的偏好推理
摘要
本文形式化了大型语言模型中不确定条件下的偏好推理,并评估了最先进的模型,揭示了在区分确定与不确定实例时存在的系统性失败。
arXiv:2608.18631v1 Announce Type: new
摘要:随着大型语言模型演变为决策代理,偏好推理的能力成为对齐、协调和集体智能的基础。然而,与标准基准不同,现实世界的偏好推理本质上是不确定的:信息可能不完整,有效解决方案可能不存在。我们认为,不确定性,而非仅仅正确性,是AI推理的核心挑战。我们沿着两个轴形式化这一挑战:(i) 认识论不确定性,源于不完整、部分或表达性偏好;(ii) 结构不确定性,源于标准社会选择概念下解决方案的不存在。通过一系列任务,我们表明最先进的语言模型系统性地无法区分确定与不确定实例,即使在验证环境中也表现出校准错误的推理。
查看缓存全文
缓存时间: 2026/08/20 10:17
# 大语言模型中不确定性下的偏好推理 来源:https://arxiv.org/html/2608.18631 作者:Samarth Khanna<sup>111</sup>(通讯作者。所属机构:美国宾夕法尼亚州立大学,邮箱:[email protected]) Xiyuan Wang(所属机构:美国宾夕法尼亚州立大学,邮箱:[email protected]) ###### 摘要 随着大语言模型(LLM)发展为决策智能体,对偏好进行推理的能力成为实现对齐、协调和集体智能的基础。然而,与标准基准测试不同,现实世界中的偏好推理本质上具有不确定性:信息可能不完整,且有效解决方案可能不存在。我们认为,不确定性(而不仅仅是正确性)是AI推理面临的核心挑战。我们从两个维度形式化这一挑战:(i)认知不确定性,源于不完整、部分或表达受限的偏好信息;(ii)结构性不确定性,源于在标准社会选择概念下解的不存在性。通过一系列任务层次的评估,我们发现最先进的语言模型系统性地无法区分确定性与非确定性实例,即使在验证环境中也表现出校准不当的推理能力。 ## 1 引言 大语言模型已从统计语言生成器演进为能够执行日益复杂推理任务的系统,包括逻辑推理和算法问题求解。这一演进标志着模型从纯粹语言模式转向基于结构化表示的操作,从而能够进行偏好推理。偏好推理是现代AI系统的基础组件,涉及对齐、微调和推荐系统。在智能体环境中,大语言模型被赋予代表用户行动的任务,这要求在与其他环境和智能体交互时,对可能冲突的偏好进行隐式或显式的推理、比较与聚合。在大规模应用中,这些机制扩展到集体决策领域,模型被用于引出和聚合偏好以形成社会判断[26(https://arxiv.org/html/2608.18631#bib.bib5),19(https://arxiv.org/html/2608.18631#bib.bib61)],例如Pol.is、Remesh等平台,以及哈贝马斯机器[75(https://arxiv.org/html/2608.18631#bib.bib7)]等 deliberative框架。 尽管取得了这些进展,当前的大语言模型推理评估范式主要(且通常完全)依赖于闭卷基准测试,其中通常假设存在一个标准答案。然而,现实世界的决策本质上更为复杂,常常表现为不确定性场景:偏好信息不完整,或结构约束导致在特定目标下(即解概念)不存在有效解。这促使评估重点转向模型能否区分确定性(由公理蕴含或作为解存在)与不确定性(不蕴含或不存在)。以此视角,评估的核心维度超越了正确性,延伸到模型能否识别确定性与不确定性之间的边界:先进的推理模型能否识别偏好查询是否无法回答,或在给定规范下解是否不可行? 我们研究两种不同形式的不确定性下的偏好推理:(i)认知不确定性,源于不完整的偏好信息;(ii)结构性不确定性,源于偏好结构(如平局)与解概念的相互作用,即使偏好被完全指定也可能导致目标不可行。<sup>111</sup>我们避免使用“可判定/不可判定”一词,因为“可判定性”通常隐含计算可处理性。本文关注的是存在高效算法时的认识论确定性问题。 这一观点形式上与开放世界假设(OWA)和多值语义框架(如克莱尼三值逻辑K3)一致,其中命题可以具有明确的“未知”或“不确定”真值[48(https://arxiv.org/html/2608.18631#bib.bib1)]。 我们基于经典的基于排序偏好的经济学问题来构建评估框架,这些问题为约束下的推理提供了有原则的测试平台。这些场景要求模型解释不完整偏好和平局,解决智能体间的冲突,并满足由公理化解概念(如稳定性和福利)定义的全局目标。关键在于,这些概念区分了可行与不可行的结果,使得该领域成为评估推理准确性和不确定性的理想环境。因此,我们将不确定性转化为大语言模型可观察、可测量的失败模式。 #### 图1:我们评估大语言模型不确定性推理能力的分类体系概览。 ### 1.1 主要结果 我们研究大语言模型中基于偏好的推理,并引入一个形式化的分类体系,区分在复杂度递增层级下的确定性推理与非确定性推理:(i)原子查询,需要从单一偏好中检索信息(例如,选项'a'的排名是什么?);(ii)比较查询,需要推断或反驳关系(例如,'a'是否优于'b'?);(iii)聚合查询,需要跨多个偏好进行聚合(例如,有多少智能体偏好'a'胜过'b'?);以及(iv)结构(算法)查询,需要构建满足社会选择解概念的结果(例如,在核心中寻找匹配解)。 我们利用偏好表达能力(例如,偏序、平局和不完整列表)与社会选择解概念之间的微妙交互,在不确定性公理框架内生成了一系列复杂的推理任务。关键是,所有任务——包括查询解析和可行性判定——都可以使用成熟的组合算法在多项式时间内计算,这使得推理能力(而非计算难度)成为大语言模型面临的主要挑战。 主要发现如下: 1. **认知不确定性**:由于在输入信息不完整时做出的系统性假设(例如,对偏好进行字典序排序),大语言模型在非确定性问题上的表现显著差于确定性问题。提供明确的“不确定”选项有助于在部分任务上改进表现,但模型仍持续表现出系统性推理错误。 2. **结构性不确定性**:大语言模型在需要算法推理的任务上的表现随着市场规模增长而急剧下降——即使在解被保证存在的场景中也是如此——并且在存在结构性不可行性时进一步恶化,模型既无法正确识别不可行实例,也无法在解存在时生成有效解。提供“不确定”选项(即“不可行时返回null”)提高了不可行性检测能力,但引入了系统性偏差,导致模型在可行实例上错误地宣称解不存在。 3. **解概念的验证**:即使在仅需验证(而非生成)的选择任务中,即使有效解存在,大语言模型仍会持续选择错误选项。尽管“无合适选项”(NOTA)提高了平均准确率,但模型很少使用此选项,即使在不存在有效选项时也极少弃权,这反映出模型在区分可行与不可行情况时校准不佳。此外,大语言模型在偏好推理中表现出系统性的意图-行动不对齐:即使它们似乎针对特定解概念,其选择的结果也常常不满足该概念,包括在仅需验证的选择任务中。 4. **辅助推理**:我们考虑了两种设置下的辅助推理:(i)通过反馈进行精炼,即向模型提供目标属性的违反情况,让其尝试迭代修复无效解;(ii)通过代码执行进行推理,即模型生成并执行程序来解决问题实例。虽然这两种设置都提高了性能,但改进主要依赖于小规模市场的暴力枚举和大规模实例的启发式搜索,这两种方法都无法扩展到与部署相关的市场规模。 ### 1.2 相关工作 **大语言模型的推理与弃权**:越来越多的工作将大语言模型作为过程推理者进行评估。最近的基准测试显示,随着实例规模增长,大语言模型无法可靠地执行经典算法[31(https://arxiv.org/html/2608.18631#bib.bib14),70(https://arxiv.org/html/2608.18631#bib.bib58)]。一个独立但相关的研究方向探讨模型是否知道何时弃权:前沿模型系统性地错误计算其不确定性[46(https://arxiv.org/html/2608.18631#bib.bib28),83(https://arxiv.org/html/2608.18631#bib.bib25)],即使在能正确回答的问题上也自信地产生幻觉[71(https://arxiv.org/html/2608.18631#bib.bib29),1(https://arxiv.org/html/2608.18631#bib.bib27)],并且在许多场景中完全不弃权[47(https://arxiv.org/html/2608.18631#bib.bib36)]。我们的发现位于这些研究脉络的交汇点,将偏好推理中的过程性失败与弃权失败联系起来。 除了这些基准测试用自然语言提问且不考虑结构化偏好之外,有两个关键区别:首先,由于在我们的设定中解决未确定查询的方法是可枚举的,我们能够识别模型为缺失信息所做的具体假设(例如,按最高排名项目对组合进行排序),而不仅仅是它是否未能弃权。其次,更重要的是,我们的基准测试包含了所请求的解根本不存在的问题,这在弃权场景中没有对应情况。 **经济情境中的大语言模型**:相关文献将大语言模型作为经济和社会选择情境中的智能体进行评估。在策略性决策方面,最近的推理模型比早期模型更接近均衡策略[43(https://arxiv.org/html/2608.18631#bib.bib71),79(https://arxiv.org/html/2608.18631#bib.bib32)],但仍然容易受到锚定效应[61(https://arxiv.org/html/2608.18631#bib.bib21),58(https://arxiv.org/html/2608.18631#bib.bib33)]和贝叶斯不一致性[81(https://arxiv.org/html/2608.18631#bib.bib24),37(https://arxiv.org/html/2608.18631#bib.bib22)]的影响。 计算社会选择是一个被广泛研究的领域,我们在其基础上开展工作[53(https://arxiv.org/html/2608.18631#bib.bib40),4(https://arxiv.org/html/2608.18631#bib.bib44),23(https://arxiv.org/html/2608.18631#bib.bib47)],该领域已开始将大语言模型应用于公平导向的分配[32(https://arxiv.org/html/2608.18631#bib.bib15),20(https://arxiv.org/html/2608.18631#bib.bib8)]以及经典解概念的求解[31(https://arxiv.org/html/2608.18631#bib.bib14),27(https://arxiv.org/html/2608.18631#bib.bib17)],并应用于投票和参与式预算[82(https://arxiv.org/html/2608.18631#bib.bib68),76(https://arxiv.org/html/2608.18631#bib.bib20)]。另一条并行的研究路线使用大语言模型作为偏好引出流程中的代理[29(https://arxiv.org/html/2608.18631#bib.bib19),36(https://arxiv.org/html/2608.18631#bib.bib67),50(https://arxiv.org/html/2608.18631#bib.bib30)],我们的工作也对此有所贡献,表征了大语言模型解析结构化偏好的可靠性。扩展的相关工作见附录D(https://arxiv.org/html/2608.18631#A4)。 ## 2 基于偏好的任务与方法 ### 2.1 问题与解概念的形式化 **问题域**:我们考虑三个需要对偏好进行推理的经济学问题:房屋(或物品)分配[73(https://arxiv.org/html/2608.18631#bib.bib10)]、具有禀赋的Shapley-Scarf房屋市场[68(https://arxiv.org/html/2608.18631#bib.bib59)],以及双边匹配市场[28(https://arxiv.org/html/2608.18631#bib.bib66)],它们各自具有递增的结构复杂度和独特的公理化解要求。 令\( A \)表示智能体集合,\( B \)表示替代选项(物品)集合。每个智能体\( i \in A \)对\( B \)具有偏好关系\( \succeq_i \),这是一个弱序且可能是偏序。我们记\( b_1 \succ_i b_2 \)表示智能体\( i \)严格偏好\( b_1 \)胜过\( b_2 \),记\( b_1 \succeq_i b_2 \)表示智能体\( i \)弱偏好\( b_1 \)胜过\( b_2 \)(允许无差异)。在双边市场中,每个\( b \in B \)同样对\( A \)持有偏好关系\( \succeq_b \)。在偏好不完整的设定中,\( \phi \succ_i b \)表示\( b \)未出现在智能体\( i \)的偏好列表中,因此未排序或不可比。 一个**偏好组合**是所有智能体偏好的集合,记作\( \succeq = (\succeq_{a_1}, \dots, \succeq_{a_m}, \succeq_{b_1}, \dots, \succeq_{b_n}) \),其中\( m = |A| \),\( n = |B| \)。在**房屋分配**问题中,集合\( A \)中的智能体被分配集合\( B \)中的物品,没有初始禀赋;在**Shapley-Scarf房屋市场**中,每个智能体\( i \in A \)最初拥有物品\( e_i \in B \)作为禀赋,形成交换经济;在**双边匹配市场**中,集合\( A \)和\( B \)中的智能体彼此都有偏好,从而产生双边匹配约束。 一个**匹配**是一个映射\( \mu: A \cup B \rightarrow A \cup B \),使得对于所有\( a \in A \),\( \mu(a) \in B \cup \{\emptyset\} \),对于所有\( b \in B \),\( \mu(b) \in A \cup \{\emptyset\} \),并且满足每个智能体和物品最多与一个对应方匹配,且\( b = \mu(a) \)当且仅当\( a = \mu(b) \)。 **解概念**:偏好和市场结构诱导出标准解概念:在房屋分配中,主要目标是**帕累托最优**;在Shapley-Scarf市场中,核心的解概念是**核心**,即没有智能体联盟可以通过重新分配其禀赋使所有成员严格变得更好;在双边匹配市场中,标准概念是**稳定性**,要求不存在阻碍对。所有这三种设定都允许在标准假设下通过多项式时间算法计算标准解并验证可行性。 **平局下的强化概念**:当偏好允许平局时,上述标准解概念分裂为不同的细化,它们对无差异的鲁棒性不同。在Shapley-Scarf市场中,**弱核心**分配是指没有联盟能严格改善的分配,而**强核心**要求没有联盟能找到一种重新分配方案,使每个成员弱偏好且至少一个成员严格偏好。在双边匹配中,存在类似的层级:匹配是**弱稳定**的,如果没有一对智能体严格偏好彼此胜过其当前伴侣;是**强稳定**的,如果没有一对包含一个智能体,他弱偏好某个伴侣且该伴侣严格偏好他;是**超稳定**的,如果没有一对包含彼此弱偏好的智能体。更强的细化(强核心、强稳定性、超稳定性)对于某些实例可能是不可行的,这产生了我们在第4节研究的结构性不确定性。形式化细节和相关算法回顾见附录E.1(https://arxiv.org/html/2608.18631#A5.SS1)。 ### 2.2 方法与实验设置 **偏好表达能力与推理任务**:偏好表达能力产生了细微差别的查询任务和解概念;我们考虑从严格完全序(SO)、严格但可能不完全的序(SI)、带平局的完全序(TO),到...
相似文章
大规模推理模型(尚)不是多语言潜在推理器
本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
大型语言模型中的数学推理:基准、架构、评估与开放挑战
本综述综合了大型语言模型在数学推理方面的最新进展,涵盖了基准、架构、训练策略和评估协议。它指出了推理忠实性和基准偏差等关键挑战。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。