通过事实-启发-情感状态强制机制衡量与提升大语言模型行为一致性
摘要
本文介绍认知核心模型(CKM),一种提示级别的状态强制层,强制大语言模型在决策前分离事实、启发式与情感。在26个LLM上的实验表明,CKM在不改变模型权重的情况下减少了输出变异性和决策翻转。
arXiv:2607.24765v1 公告类型:新
摘要:大型语言模型(LLMs)在运行中对同一决策问题可能给出不同答案,并在自身先前答案作为上下文返回时逆转决策。我们探究这种不稳定性是否可以在不改变模型权重的情况下被测量并部分降低。
我们测试认知核心模型(CKM),一种提示级别的状态强制层。在决策前,模型必须将其输入分为三种认知角色:事实(给定或可验证)、启发式(推断或假设)、情感(评价或优先级信号)。CKM不增加能力;它强制模型在行动前追踪其所使用信息的种类。形式上,它维护一个结构化状态S_t = {F_t, H_t, E_t},通过转移函数更新。
我们在韩语决策场景(模糊性、伦理冲突、资源分配、错误处理)上评估CKM,涉及来自四个供应商的26个LLM和37,403次观察,通过四个核心实验、一个四臂消融、一个五臂假限制消融以及温度探测。研究发现:
(1) CKM减少了重复输出变异性(随机效应Hedges' g=1.09,95% CI [0.83,1.35],31个模型对);
(2) 状态持久性将较新模型的决策翻转率降低82%(g=1.52);
(3) 效果并非仅来自JSON格式化(仅值重新计算,g=2.24);
(4) 固定锚定状态下的内在随机性可忽略不计;
(5) 在采样随机性下优势增长(温度0.7时g=2.87);
(6) 假消融将约45%的增益归因于结构支架,55%归因于事实/启发式/情感内容,并且CKM是唯一既能提高一致性又能减少翻转的臂。
CKM并未提高推理正确性。较窄的结果:行为一致性可测量,在不同模型间存在差异,并且通过强制模型在决策前分离事实、假设和评价信号可部分改善。
查看缓存全文
缓存时间: 2026/07/29 09:54
# 测量与提升大型语言模型中的行为一致性:基于事实-启发-情感状态强制方法
来源: https://arxiv.org/html/2607.24765
作者: Gi\-Hun Lee1,∗, Joong Yull Park2,∗
1独立研究者
2韩国中央大学机械工程学院, 首尔, 韩国
∗通讯作者: leescoppermine@gmail\.com (G\.\-H\. Lee), jrpark@cau\.ac\.kr (J\. Y\. Park)
预印本: arXiv (cs\.AI, cs\.HC)
版本: arXiv v1\.0
日期: 2026\-06\-05
### 摘要
大型语言模型(LLMs)在多次运行中,可能对同一决策问题给出不同答案。当模型之前的回答被重新引入作为上下文时,它们也可能改变决策。本文探讨这种不稳定性是否可以被测量,并在不改变模型权重的情况下部分减少。我们测试了一种轻量级干预方法,称为**认知核模型**(Cognitive Kernel Model, CKM)。在做出决策前,模型必须将输入分离为三种认知角色:**事实**(给定或可验证的内容)、**启发**(推断或假设的内容)和**情感**(带有评价或优先级信号的内容)。在实际应用中,CKM 是一个提示级别的状态强制层。它并不会使模型变得更强大,而是在决策前强制模型追踪其所使用的信息类型。形式上,CKM 维护一个结构化状态 \( S_t = \{F_t, H_t, E_t\} \),并通过状态转移函数进行更新:\[ S_{t+1} = \delta(S_t, \Omega_{x,t}, \Omega^{\text{Engine}}_t) \]
我们在韩语学生决策场景上评估了 CKM,这些场景涉及歧义解决、伦理冲突、资源分配和错误处理。评估包括四个核心实验、一个四臂消融实验、一个五臂伪限制消融实验以及一个温度鲁棒性探测。数据集涵盖来自四家供应商(OpenAI、Anthropic、Google、xAI)的 26 个独特 LLM 模型、两代模型,总计 37,403 个观测值(35,475 个主要观测值 + 1,928 个案例研究观测值)。主要发现如下:
1. **CKM 降低了重复输出变异性。** 旧模型显示 17/19 个正向 SI 效应(Hedges’g = 1.18,p = 6.55 × 10^-5,解析字段 SI),新模型显示 12/12 个正向效应(g = 3.08),组合随机效应估计 g_RE = 1.09 [95% CI 0.83, 1.35],涵盖 31 个模型级配对。
2. **状态持久性减少了新模型中的决策翻转。** 在新模型队列中,DFR 降低 82%(从 0.385 降至 0.069,g = 1.52)。
3. **活跃机制并非仅来自 JSON 格式化。** 四臂消融实验显示,仅值重计算保留了 F/H/E 效应(g = 2.24),同时消除了仅 JSON 的外观效应。
4. **在固定锚点状态下,模型内在随机性可忽略不计。** FCS 近似为 1.0,表明多轮不稳定性主要源于状态构建。
5. **CKM 的优势在采样随机性增加时更加显著。** 在 T=0.7 时,CKM 效应达到 g=2.87。
6. **伪限制消融实验将结构与认知内容分离。** 结构脚手架贡献了约 45% 的 SI 改进,而推理语义的 F/H/E 内容贡献了约 55%。CKM 是唯一既能改善 SI 又能降低 DFR 的臂。
这些结果**并未**表明 CKM 提升了推理的正确性或决策质量。它们展示了一个更窄但重要的结果:行为一致性是可测量的,不同模型之间存在显著差异,并且可以通过强制模型在决策前分离观察到的事实、推断的假设以及评价性信号来部分改善。代码、提示和规范数据集可在 https://github\.com/TeenyToolSoftware/cogos\-behavioral\-consistency 获取。
### 重要性声明
大多数 LLM 基准测试关注模型能做什么。本文提出了一个不同的、面向部署的问题:当相同情境再次出现时,模型的响应是否稳定?还是会发生漂移并反转决策?本文提出的主张是有边界的。在测试的韩语决策场景中,如果要求 LLM 在选择行动前将决策输入分离为**事实**、**启发**和**情感**,那么一种形式的行为不稳定性就变得可测量,并且可以在重复和状态持久性试验中部分减少。因此,核心贡献不是一个新的 LLM,也不是声称更好的推理质量,而是一种可复现的方法,通过使模型的推理状态足够明确以测量重复响应变异性、决策翻转和状态漂移,来刻画并部分稳定 LLM 行为。
### 1. 引言
大型语言模型(LLMs)通常通过考察其能力来评估:是否能解决基准问题、编写正确代码、回答医学问题或通过标准化测试。本文提出不同问题:**当相同情境再次出现时,模型的行为是否一致?** 一个模型可能能力很强,但仍然不稳定。它可能对相同的提示产生语义不同的回答,在保持相同推理的同时改变行动,或者当自己的先前输出被重新注入作为上下文时反转之前的决策。这种区别对部署至关重要。一个医学助手如果对相同症状在不同会话中给出不同的分诊建议,会破坏临床信任。一个法律助手如果对同一法规改变解释,就会带来责任风险。一个金融或工程助手如果因为推理状态被不同表示而改变其风险建议,就会在需要稳定性的决策中引入噪声。在这些情况下,失败不一定是因为能力不足,而是行为一致性失败。
我们将**行为一致性**定义为在重复或状态持久性试验中,模型的语义响应、保留的上下文、所选行动以及传播状态的稳定性。这一定义有意将一致性与正确性分开。一个模型可能持续错误,也可能在平均准确率上表现良好但在重复中不稳定。本研究测量前者,而将决策质量作为独立问题。
我们的核心假设很简单:一些 LLM 的不稳定性源于模型将所有信息视为无差别的文本。在人类决策情境中,多种信息混合在一起:观察到的事实、推断的假设以及情感或价值观信号。如果这些信息未被分离,模型可能将推测视为事实、将情感强调视为证据、或将先前的推断视为已观察到的约束。因此,我们测试是否强制模型按认知角色(事实、启发、情感,简称 F/H/E)分离信息能够减少行为变异性。
为了验证这一假设,我们开发了**认知核模型**(Cognitive Kernel Model, CKM)。CKM 不是一个新的基础模型,也不需要微调。它是一个提示级别的状态强制框架,要求 LLM:(i)将输入信息分类到 F/H/E 槽中;(ii)基于该结构化状态做出决策;(iii)可选地将结构化状态传递到后续轮次。简而言之,CKM 要求模型在行动前保持一个清晰的清单,区分已知、推断和评估的内容。
这种框架不同于传统的提示工程。思维链、思维树和自我改进等方法结构化模型在单次响应中的推理方式 [1–3, 14, 15]。而 CKM 则结构化每条信息被允许扮演的认知角色,并测试这种强制的状态结构是否改变了重复行为。智能体框架和记忆系统可以跨轮保留信息 [5–7, 38–43],但仅保留本身并不指定保留的内容是事实、推断还是评价信号。CKM 解决了这个分类层次的问题。
本研究做出三项主要贡献,均在测量一致性而非正确性的主张边界内:
1. **行为一致性测量套件。** 我们定义了六个指标——SI、CRR、DFR、FCS、ACS 和 SDR——用于捕获不同形式的响应漂移、决策翻转和状态不稳定性。其中四个指标(SI、DFR、FCS、SDR)在本次实验中具有区分力;CRR 和 ACS 作为探索性指标报告。
2. **模型无关的 F/H/E 状态强制框架。** CKM 将推理输入分解为事实、启发和情感角色,并通过提示级架构强制这种结构。该框架可应用于任何文本输入 LLM,无需修改权重。
3. **跨供应商的 LLM 行为一致性实证分析。** 涵盖来自四家供应商和两代模型的 26 个独特模型,我们展示了基线一致性存在显著差异,CKM 降低了大多数模型的输出变异性,且状态持久性行为在不同架构间存在显著差异。消融研究表明主要活跃机制是认知角色分离,而非单纯的 JSON 格式化。
**主张链边界。** 本文自始至终使用一条主张链:首先,LLM 行为在重复呈现相同决策问题时存在变异性;其次,这种变异性可以通过重复试验和状态持久性指标测量;再次,F/H/E 状态强制在测试场景中减少了部分变异性;最后,消融实验表明这种减少并非仅由 JSON 格式化解释。我们不声称 CKM 提高了事实准确性、伦理质量或通用推理能力。
最近的研究已经开始直接量化 LLM 输出变异性:Wang 和 Wang [34] 发现金融领域在相同提示下 340 万个输出中存在显著不一致性;Atil 等人 [61] 证明了即使在固定解码参数下也存在非确定性变异性;Haase 等人 [62] 显示模型内方差分量因任务类型而异。本文建立在这种认识之上,但增加了一种结构性干预:不仅是观察变异性,还测试特定的状态组织是否能够减少它。
其余部分组织如下:第 2 节回顾相关工作并指出 CKM 所解决的空白;第 3 节定义 CKM 架构和 F/H/E 状态转移;第 4 节定义行为一致性指标;第 5 节描述实验设计;第 6 节报告实证结果和消融实验;第 7 节讨论机制、局限性和意义;第 8 节总结。
### 2. 背景与相关工作
本节回顾三项先前工作流,它们共同推动了 CKM,然后确定我们所解决的具体空白。§2.1 回顾 LLM 一致性评估及其单一维度的局限性;§2.2 回顾来自心理学和认知科学的认知架构与结构化推理框架;§2.3 考察结构化输出、记忆和状态持久性方法;§2.4 阐述 CKM 所解决的研究空白;§2.5 将我们的贡献与同期和邻近工作进行对比。
#### 2.1 LLM 评估:能力 vs. 一致性
LLM 评估的主导范式聚焦于任务性能,通过测量标准化基准(MMLU、HumanEval、GSM8K)的准确率,隐含地将每个评估实例视为独立 [26]。这种设计反映了一种特定假设:测量模型在不同测试项上的能力足以表征其实用性。而测量模型在相同项上的一致性需要根本不同的实验设计,即基于重复测量而非多样采样,并且能力范式并未为此提供基础设施。
近期关于 LLM 校准 [29]、提示敏感性 [30] 和位置偏差 [31] 的研究开始涉及这一空白。Shyr 等人 [33] 为医学 LLM 评估提出了可重复性指标,Wang 和 Wang [34] 评估了金融领域 340 万输出的输出一致性。这些研究将变异性作为观测现象进行测量,而未进行结构性干预,并且采用单一维度的指标,无法检测到我们数据中揭示的多维度失败模式(例如,同时存在高 SI 和高 DFR)。我们的六指标套件同时解决了这两个限制。
#### 2.2 认知架构与结构化推理
尽管这些一致性指标将变异性作为现象进行了捕获,但它们并未解释其结构起源。经典认知科学提供了与这一问题相关的结构化推理框架。双过程理论 [8] 提出了快速和缓慢处理系统;元认知研究 [9] 强调自我监控;脚手架理论 [10] 表明外部结构有助于推理。计算模型如 SOAR [16]、ACT\-R [17] 和 GOMS [18] 提供了带有程序性记忆的结构化框架,但与现代 LLM 嵌入不兼容。
关键的是,这些框架提供了结构性建议,但缺乏定量证据表明其结构改善了行为一致性。三个例子说明了这一空白:SOAR 按处理类型分离模块,而未标记认知来源;ACT\-R 按表示格式(块 vs. 产生式规则)组织知识,而非按信息来源;CoALA [44] 定义了感知-行动-记忆循环,而未要求感知的事实、推断的假设和评价性判断在输入阶段进行结构区分。最近,Kim [35] 引入了神经推理的符号治理,Kargupta 等人 [36] 将认知元素映射到推理轨迹上,这些工作推进了认知结构化,但未测量这种结构化是否带来可测量的一致性提升(补充 §S\-RW 详细讨论)。
#### 2.3 结构化输出、记忆与状态持久性
这些认知框架提出了结构,但未在 LLM 系统中实现。近期结构化 LLM 输出的进展,包括 JSON 模式生成 [12] 和函数调用 [13],提供了减少格式化变异性的语法约束。CKM 扩展了这种方法,不仅强制语法结构,还强制语义角色分离(事实 vs. 启发 vs. 情感),无需修改权重 [22]。这一区别至关重要,因为我们的消融数据(由仅值伪影控制确认)表明语义分离是一致性改进的主要贡献者(§6.1)。
思维链 [1]、思维树 [2]、自我改进 [14] 和思维图 [11] 在孤立的输出中施加结构,但未关注跨步骤一致性,因此多轮不稳定性未得到解决。越来越多的工作关注状态持久性:A\-MEM [38] 通过链接组织记忆;Memoria [39] 结合摘要与知识图谱;Mem0 [40] 提供了生产级的连续性;MemoryOS [43] 提出了智能体记忆的操作系统抽象。这些系统处理的是随时间保留什么内容,通过 F1 或召回率优化保留效果。相比之下,CKM 处理一个互补问题:如何对保留的内容进行分类。记忆系统和 CKM 是在正交维度上运行的;一个系统可以有完美的记忆,但如果缺乏认知角色分离,仍然可能混淆事实与推断——我们的消融数据证实了这一预测:格式强制的测量 SI 贡献可归因于结构同质性而非真正的语义收敛,而语义分离产生了稳健的一致性提升(§6.1)。CKM 并不取代记忆。相似文章
模型何时该改变想法?大语言模型中的情境信念管理
本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。
解构并引导大型语言模型中的功能性元认知
本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。
大型语言模型中的稳定校准错误:高置信度错误的实用视角
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
使用认知模型改进语言模型对人类说服游戏的模拟
本文提出方程到行为提示和强化学习,引导大型语言模型模拟说服游戏中多样的人类决策模式,显示出改进的信念准确性和训练结果。
MechELK:一种用于从大型语言模型中引出潜在知识的机制可解释性框架
MechELK 是一个三阶段框架,结合机制可解释性工具(SAE、激活修补、因果探测)与表示工程,从大型语言模型中引出潜在知识,实现了84.7%的准确率,优于CCS和线性探测等现有方法。