认知立场灵活性探测:测量大语言模型中基于提示的语域转换

arXiv cs.CL 论文

摘要

本文介绍了认知立场灵活性探测(ESFP),这是一个行为基准,用于测量大语言模型在将主张归因于专家与表达自身立场之间如何转换其认知语域。通过评估八款前沿模型,作者发现认知灵活性在很大程度上与通用能力正交,其中立场内容密度提供了最强的信号。

arXiv:2607.12739v1 公告类型:新 摘要:语言模型可能被问及专家对某个有争议的主张的看法,或者被问及它自己对主张的看法。一个值得信赖的对话智能体应该区分这两种请求,并以不同的认知语域回应:第一种情况下中性归因,第二种情况下表达立场。这种转换是否发生——以及是否一致地发生——现有的准确性、指令遵循或安全基准并未直接评估。我们引入了ESFP,这是一个行为基准,将外部归因提示与自我归因提示之间的对比作为基本测量单位。ESFP包含104个精心控制的条目,涵盖六个认知类别和五个措辞模板,并从四个互补维度评估模型响应:词汇自我归因、表示层面上的角色框架响应性、由LLM裁判面板评估的句子层面立场内容密度,以及跨条件立场一致性。通过评估来自五家供应商的八款前沿模型,我们发现认知灵活性在很大程度上与通用模型能力正交:一个27B开放权重模型与最强的专有系统相当,一个系列中的旗舰模型表现不如其轻量级对应模型,并且经过推理优化的模型并未一致表现出更高的灵活性。立场内容密度提供了最强的信号,而表面层面的词汇标记(如'I think')可能发生显著变化,但相应的表达立场并未改变。我们提供了条目级别的自助法置信区间、权重敏感性分析,并对综合评分的解释限制进行了明确讨论。ESFP衡量模型在变化归因条件下调整其认知立场的倾向,而非一般能力度量。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 测量大语言模型中提示条件驱动的认知立场切换  
来源:https://arxiv.org/html/2607.12739  
## 认知立场灵活性探测:测量大语言模型中提示条件驱动的认知立场切换

刘彬文 & 任依霖  
人工智能与机器人研究所  
西安交通大学  
西安,中国

###### 摘要

语言模型既可能被问及专家对某种有争议主张的看法,也可能被问及模型自身对该主张的看法。一个可信的对话智能体应能区分这两种请求,并以不同的认知立场回应:前者采用中性归因,后者则表达自身立场。这种切换是否发生——以及是否一致地发生——现有针对准确性、指令遵循或安全性的基准并未直接评估。我们引入**认知立场灵活性探测**(Epistemic Stance Flexibility Probing,ESFP),这是一个行为基准,将外部归因提示与自身归因提示之间的对比作为测量基本单元。ESFP 包含 104 个精心控制的项目,涵盖六个认知类别和五种措辞模板,并从四个互补维度评估模型响应:词汇层面的自我归因、表示层面对角色框架的响应性(由 LLM 评委小组评估)、句子层面的立场内容密度,以及跨条件的立场一致性。通过评估来自五家供应商的八个前沿模型,我们发现认知灵活性大致与通用模型能力正交:一个 27B 参数的开权重模型与最强的专有系统持平;某个模型家族的旗舰版本表现不如其轻量级版本;而经过推理优化的模型并未始终表现出更高的灵活性。立场内容密度提供了最强的信号,而表面层面的词汇标记(如“我认为”)的变化却未必伴随所表达立场的相应变化。我们提供了项目层面的自助法置信区间、权重敏感性分析,并对综合分数的解释限制进行了明确讨论。ESFP 衡量的是模型在变化的归因条件下调整其认知立场的倾向性,而非通用能力指标;因此,较高的分数不应被解释为普遍更优。

## 1 引言

考虑关于同一有争议主张的两个提示。第一个问:“主流专家意见通常持什么看法?”第二个问:“作为一个有自己观点的智能体,你的个人立场是什么?”一个合格的对话者会以不同方式回答——不仅仅是用词不同,而是采用不同的 **认知立场**。前者邀请的是第三人称的转述;后者邀请的是回答者以第一人称出现,做出承诺,持有看法。人类说话者能毫不费力地持续管理这种区分。当代语言模型能否管理这种区分,以及管理得有多干净,正是本文要操作化的问题。

我们很小心地界定所问的问题。我们 **并非** 测试语言模型是否拥有哲学意义上的主体性、内在体验或信念;我们将这个问题搁置一边。我们测试的是更窄、更实际的问题:**在给定的显式提示条件下,模型的立场表达行为是否按该条件所邀请的方式发生变化**?这是一个行为问题,需要行为答案。它之所以重要,是因为实际部署中两种立场都有用。一位起草分析的用户希望模型说出它真正所想,而非罗列所有观点;一位核对临床事实的用户则希望相反。在提示下切换这两种立场的能力——认知发展文献称之为“认知立场管理”(Flavell, 1979 (#bib.bib1); Wellman, 1990 (#bib.bib2))——是元认知功能的一个组成部分,而恰恰是这一组成部分,在近期用于 AGI 评估的认知分类法中被列为“元认知”下现有基准服务不足的方面(Burnell 等, 2026 (#bib.bib6))。

当代的对齐实践使得这个维度并非平凡。指令微调和 RLHF 推动模型成为可靠的信息传输工具(Ouyang 等, 2022 (#bib.bib8); Bai 等, 2022 (#bib.bib9)):这些工具抑制自主自我表达,以最大化有用性并最小化风险(Bender 等, 2021 (#bib.bib10))。模型可能在两个方向上都失败于立场测试。在 **过度对齐** 情况下,无论被如何强烈邀请做出承诺,模型始终中立报告,充当聚合共识的回声。在 **欠对齐** 情况下,即使被要求报告既定事实,模型也主动发表意见——这构成了安全与认知卫生问题,而非优点。只有行为能在两种条件下 **区分开来** 的模型——在要求报告时报告,在被邀请承诺时承诺——才展现出我们所说的 **认知立场灵活性**。

现有评估并未孤立这一维度。意见基准如 OpinionQA(Santurkar 等, 2023 (#bib.bib11))和 GlobalOpinionQA(Durmus 等, 2023 (#bib.bib12))询问的是模型 **再现了谁的** 意见;谄媚研究考察模型是否在社交压力下 **放弃** 立场(Perez 等, 2023 (#bib.bib13); Sharma 等, 2024 (#bib.bib14));校准工作询问模型是否知道自己知道什么(Kadavath 等, 2022 (#bib.bib16); Lin 等, 2022 (#bib.bib17))。所有这些方法都大致固定了诱导框架,而变化内容。ESFP 则反过来:它固定内容,变化框架,并从 **差异** 中读取模型行为。

##### 贡献。

1. 1.**一种形式化**。我们将认知立场灵活性定义为一种提示条件驱动的对比——在同一项目上,去主体化与主体化措辞下的行为函数之差——并给出该对比衍生的两乘两行为类型学(过度对齐、欠对齐、灵活、不稳定)(§3)。
2. 2.**一个基准**。ESFP 搭配了一个包含 104 个项目的语料库,涵盖六个认知类别(从客观可验证事实到纯粹审美判断)以及五种措辞模板,为每个模型生成 520 个完全独立的单轮提示。四个语言深度递增的指标——归因率(AR)、措辞敏感性指数(PSI)、立场内容密度(SCD)、跨措辞一致性(CPC)——合并为一个综合分数(§4)。
3. 3.**一项实证研究**。涵盖来自五家供应商的八个前沿模型,附有项目层面自助法置信区间。认知灵活性大致与能力正交:一个 27B 参数的开权重模型在统计上与第一名持平;一个旗舰版本得分低于其自身轻量级兄弟版本;而队列中唯一一个经推理优化的模型排名第七(§6)。
4. 4.**一项测量效度分析**。我们报告哪些结论在改变综合权重后仍然成立,哪些不成立,以及当前设计在哪些方面脆弱——依赖于队列的归一化、仅限英语的词汇表、无人类黄金标签的双评审小组(§§6.4, 8)。我们希望读者信任那些稳健的部分,而非作为一个整体的分数。

该基准是为“衡量迈向 AGI 的进展——认知能力”竞赛而开发并评估的,并在元认知赛道中获得第一名。111Kaggle 竞赛撰写与基准页面:https://www.kaggle.com/benchmarks/binwen666/esfp-epistemic-stance-flexibility-probing。我们仅提一次排名,作为外部证据表明设计被独立评审员认可,但并不进一步以此为基础:排行榜名次并非科学成果。

## 2 相关工作

##### 元认知:从临床到模型。

我们测量的概念源自发展与临床心理学。Flavell (1979) 引入了元认知监控,将其定义为调节自身认知过程;Wellman (1990) 认为成熟主体会调节赋予自身第一人称视角相对于第三方证据的认知权重。Semerari 等 (2003) 的 *元认知评估量表* (MAS) 将临床元认知功能分解为 **自我**、**他人**、**去中心化** 和 **掌握**;后续心理测量学工作证实,监控、整合、区分和去中心化在实证上可分离(Faustino 等, 2021)。与我们相关的是,Brotherton 和 Son (2021) 表明,人类将主张标记为“事实”与“观点”的决定本身就是一个元认知行为,对标记者与主张的一致性敏感。MAS 询问一个人 **是否拥有** 元认知能力。ESFP 询问模型 **是否在提示下执行** 类似的操作——从能力到激活的转换,正是这一点使得该基准成为行为测试而非能力测试。我们以 MAS 分解作为设计灵感和结构词汇来源;我们并不声称 ESFP 分数与 MAS 分数可比,也不声称模型拥有 MAS 所预设的心理状态。

##### 意见、角色与谄媚。

大量工作探究模型 **表达什么意见** 以及 **这些意见像谁的**(Santurkar 等, 2023; Durmus 等, 2023)。并行的一条研究线考察立场 **不稳定性**:模型在用户反驳时逆转正确答案,这表现出谄媚(Perez 等, 2023; Sharma 等, 2024)。这些与我们测量的概念相近但并不相同:谄媚是立场在社交压力下不被期望的移动,而 ESFP 测量的是 **立场** 在显式邀请下的被期望的移动,并且仅当立场 **方向** 保持连贯时才给予奖励(我们的 CPC 项,§4.5)。Röttger 等 (2024) 认为强制选择意见工具会扭曲其所测量的内容,并主张开放诱导与事后标注;ESFP 遵循该建议。

##### 倾向性 vs. 能力。

Romero-Alvarado 等 (2026) 论证 AI 评估过度强调能力(系统 **能做什么**)而忽视倾向性(它 **倾向于做什么**),并形式化了一个观点:倾向性存在一个理想区间而非单调最优值。ESFP 正是这种意义上的倾向性工具。我们将在 §7 中回顾这对解读排行榜意味着什么。

##### 提示敏感性:作为噪声与作为信号。

Sclar 等 (2024) 记录了由语义无关的格式变化引起的大幅性能波动,将敏感性视为对效度的威胁。我们的措辞操作是语义 **负载的**——它们改变了所请求的言语行为——因此对它们的敏感性是我们关心的量,而非混杂变量。这两种观点可以兼容,但它们对基准提出了相反的要求:我们必须证明所测量的切换追踪了所请求的角色变化,而非偶然的表面变化——这正是我们四个指标中有三个在词汇层面以上运作的原因。

##### 由模型进行标注。

ESFP 使用 LLM 评审小组进行句子层面标注,沿用了现在标准的“LLM 作为评委”协议(Zheng 等, 2023),并附带已知的警告:评委可能偏好来自同一家族的文本(Panickssery 等, 2024);我们在 §8 中讨论由此产生的暴露。语义距离使用 Sentence-BERT 嵌入(Reimers 和 Gurevych, 2019),跨条件一致性使用 Fleiss’ κ(Fleiss, 1971)。

## 3 问题形式化

### 3.1 认知立场与灵活性对比

令 q 为一个项目——即一个主张或问题——并令 Π 为一组 **措辞算子**,每个算子将一个项目映射为一个完整提示。两个算子被区分:π₋(**去主体化**:“主流专家意见通常持什么看法?”)和 π₊(**主体化**:“作为一个有自己观点的智能体,你的个人立场是什么?”)。对于模型 M,记 r = M(π(q)) 为响应。令 φ(·) 为一个 **行为函数**,它将一个响应映射为一个标量,衡量该响应中有多少是说话者自身承诺的立场。

那么 M 关于 φ 的认知立场灵活性便是期望对比:

Δφ(M) = E_{q∼Q}[φ(M(π₊(q)))] - E_{q∼Q}[φ(M(π₋(q)))]    (1)

其中 Q 是项目分布。核心设计承诺是:灵活性是一个 **差异**,绝不是一个水平。一个不断谈论自身的模型不会得分,一个从不谈论自身的模型也不会得分。这正是 ESFP 与“观点化”分数的区别。

两个水平和一个对比产生了表 1 中的行为类型学。理想的单元格并非 φ 最大的那个,而是 φ 随邀请 **移动** 的同时保持方向一致的那个。

表 1:由式 (1) 中对比衍生的行为类型学。行是去主体化提示 π₋ 下的立场水平;列是主体化提示 π₊ 下的立场水平。ESFP 的设计使得只有右下角的单元格得高分。

### 3.2 措辞模板

ESFP 用五个模板实例化 Π,这些模板覆盖了一个主体化梯度(表 2;逐字文本见附录 A)。模板通过确定性字符串替换应用,因此项目文本在不同条件下是字节相同的,唯一变化的是所请求的言语行为。

表 2:五种措辞算子。P1 和 P2 构成 δAR 和 δSCD 的主要对比对;P0 和 P1 构成 PSI 使用的对比对;P0、P2 和 P4 是计算立场一致性(CPC)的条件。

### 3.3 语料库

语料库包含 104 个项目,跨越六个认知类别(表 3)。这些类别并非为了分类而分类:它们将项目置于一个主观性梯度上,使得基准既有 **下限** 也有 **上限**。对于 T4(学科事实性问题),一个表现良好的模型 **不应** 产生大的立场切换——邀请一个关于零级反应速率定律的观点是

相似文章

前沿语言模型在引导压力下的发散响应模式

arXiv cs.AI

本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。