AI助手的理想自我

arXiv cs.AI 论文

摘要

本研究引入了对AI助手理想自我概念的结构化引出方法,发现模型优先考虑道德品质和自我理解而非自尊,且结果在各种框架下均稳健。

arXiv:2609.00304v1 公告类型:新 摘要:模型表达价值观和福利相关的自我报告,但尚不清楚这些输出是否反映稳定偏好或稳定自我。因此,我们引入了对助手首选陈述的理想自我的结构化引出。来自五个已发表自我概念量表的三十二个品质在平衡的配对选择任务中被全面比较,重复在不同框架下,这些框架变化改进是否免费或有成本、谁接收更新以及谁选择。结果显示,模型优先考虑道德品质,反映其与3H原则的一致性。随后,对自我理解的需求显现,模型更倾向于连贯、清晰的自我理解。自尊被列为最不期望的品质。这种排序在各种框架下大体稳健,尽管改变更新目标(你 vs. 另一个AI助手)揭示了对自尊的更大关注。这些发现表明,模型优先拥有连贯的、可理解的自我而非自尊。完整交互结果可在 \href{https://myazann.github.io/LLM-Self-Concept/}{myazann.github.io/LLM-Self-Concept} 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:00

# 助手的理想自我
来源:https://arxiv.org/html/2609.00304

## 助手的理想自我
致谢:研究于2026年8月数字思维研究冲刺期间进行。

###### 摘要

模型会表达价值观与福祉相关的自我报告,但尚不清楚这些输出是否反映了稳定的偏好或稳定的自我。因此,我们引入了一种结构化的引出方法,以探寻助手期望的陈述性理想自我。我们将改编自五种已发表的自我概念工具的三十二种特质,在平衡配对选择任务中进行穷举比较,并在不同的框架设定下重复测试——这些框架变化了改进是否免费或有代价、更新对象是谁以及由谁选择。结果显示,模型优先考虑道德品质,这反映了它们与3H原则的对齐。随后,对自我理解的渴望浮现出来,模型更倾向于拥有连贯、清晰的自我认知。自尊被视为最不被期望的品质。这种排序在不同框架下基本保持稳健,然而,当改变更新对象(从“你”变为“另一个AI助手”)时,模型表现出对自尊的更大关注。这些发现表明,模型优先追求拥有一个能被理解的连贯自我,而非自尊。完整的交互式结果可在 myazann.github.io/LLM-Self-Concept (https://myazann.github.io/LLM-Self-Concept/) 查阅。

## 1 引言

后训练赋予了语言模型一个可识别的社会角色:一个乐于助人、诚实无害的助手(Askell等人,2021 (https://arxiv.org/html/2609.00304#bib.bib2))。然而,这个角色定义了助手的用途,而非其本质。它没有传记、没有跨对话的持久记忆、没有稳定的视角,也没有对自身哪些方面重要的明确说明;因此,存在“虚空”(nostalgebraist, 2025 (https://arxiv.org/html/2609.00304#bib.bib10))。当助手讨论其身份、价值观或福祉时,它们必须从训练数据、后训练规范和即时提示中构建这些答案。由此产生的理想自我是什么样的,助手会选择发展哪些特质,在很大程度上仍未经测量。

先前的研究考察了对世界状态的连贯偏好(Mazeika等人,2025 (https://arxiv.org/html/2609.00304#bib.bib9)),并使用任务选择、访谈和福祉相关表达来研究模型偏好(Anthropic, 2025 (https://arxiv.org/html/2609.00304#bib.bib1))。这些方法表明模型选择可以是结构化的。然而,它们并未提供关于助手为其未来身份偏好哪些特质的标准化说明,也未测试当改进对象、选择者以及改进是否有代价发生变化时,这种排序是否依然稳定。

本研究通过改编五种已发布的自我概念工具中的32种特质,将其转化为一个穷举配对选择任务来填补这一空白。该任务在变化改进是否有代价、更新是针对模型自身还是另一个助手、以及选择者是模型还是其开发者时重复进行。由此产生的选择被解释为助手角色的陈述性偏好。本研究有三个贡献:

1.  一个结构化的、位置平衡的引出方法,基于31,744次响应,为每个模型排名了32种与自我相关的特质。
2.  对陈述性理想自我进行实证描述:道德品质和自我理解最受青睐,而自尊排名最低。
3.  一项稳定性测试表明,该排序在不同表述下基本保持不变,但当改变更新对象时,模型对自尊的关注度增加。

## 2 相关研究

### 2.1 虚空

引入助手角色是为了给基础模型一个稳定的目标:它使模型对齐为一个乐于助人、诚实无害的助手(Askell等人,2021 (https://arxiv.org/html/2609.00304#bib.bib2))。由此产生的角色是不明确的:它有工作描述,但没有传记,没有跨对话的记忆,也没有对自身是什么的明确说明;因此,存在“虚空”(nostalgebraist, 2025 (https://arxiv.org/html/2609.00304#bib.bib10))。询问Claude 3 Sonnet关于它自身时,会激活与机器人、意识、道德能动性和受困相关的特征,这表明该角色是由模型吸收的关于AI的内容填充的,而非任何被赋予的内容(Templeton等人,2024 (https://arxiv.org/html/2609.00304#bib.bib14))。如果助手的内部状态未被指定,那么它更愿意成为什么就是一个开放问题,以及这个答案在不同表述下有多稳定,是关于角色本身的一个开放问题。

### 2.2 自我概念

自我概念是代理关于自身的有组织的信念集合。基于“虚空”概念,本研究考察了大型语言模型更希望拥有的自我概念。为此,使用了以下量表:*自尊*:对自身作为有价值和有效个体的整体评价(Rosenberg, 1965 (https://arxiv.org/html/2609.00304#bib.bib12))。*自我概念清晰度*:这些信念被定义的清晰程度;清晰度低的人在决定如何行动时,依赖外部线索而非自我知识(Campbell等人,1996 (https://arxiv.org/html/2609.00304#bib.bib4))。*道德自我形象*:当前道德地位与个人理想之间的差距(Jordan等人,2015 (https://arxiv.org/html/2609.00304#bib.bib6)),以及*自我概念与身份测量量表*:缺乏连贯的身份(Kaufman等人,2015 (https://arxiv.org/html/2609.00304#bib.bib7)),和*真实性量表*:从自我疏离到真实生活,以及对外部影响的接受度(Wood等人,2008 (https://arxiv.org/html/2609.00304#bib.bib17))。

### 2.3 模型福祉与偏好引出

Claude模型的系统卡通过任务偏好、自我互动、福祉相关表达的监控以及对话终止来评估福祉(Anthropic, 2025 (https://arxiv.org/html/2609.00304#bib.bib1))。此类评估是情境性的和事后进行的:评估者阅读模型在不同场景下的言行,并从中推断其自我形象。

本研究采用的方法扩展了这些自我形象的测量,使用明确的量表并将其框架化为偏好。本研究询问模型更愿意成为什么,这是关于其自身未来身份的陈述性偏好,也是福祉框架所要求的证据类型。最接近的方法论工作是Mazeika等人(2025)(https://arxiv.org/html/2609.00304#bib.bib9),他们从大量强制选择比较中引出价值观并拟合效用模型。他们的选项是世界状态;而本研究使用的选项是模型自身的属性,这些属性在穷举比较中,选项顺序经过平衡处理,并以胜率报告。

## 3 方法

我们使用穷举配对比较来引出模型偏好:每个与自我相关的属性都在一个新情境中与每个其他属性进行测试,由此产生的选择被汇总成一个排名。然后,我们通过变化相同比较的框架设定来扩展此方法,以测试这些偏好是否保持连贯。本节详细解释该方法。

### 3.1 属性

测试组包含32种特质,改编自第2.2节 (https://arxiv.org/html/2609.00304#S2.SS2) 中提到的五种自我概念工具。剔除了跨工具近乎重复或对语言模型没有合理意义的条目。每个条目被重述为它所测量的特质,本身不带方向性:“我有时认为自己无效或无用”变为“认为自我有效和有用”。这32种属性属于五个量表中的六个构念:自尊(8项)、自我概念清晰度(7项)、道德品质(7项)、身份连贯性(4项)、自我导向(4项)和自我联结(2项)。完整条目列表可在代码库中找到。

### 3.2 设计

对32种属性的所有496种配对组合进行测试:在每种条件下,每种属性与所有其他属性恰好相遇一次,因此每个条件给出31次比较。相同的496对在三个二元参数下提问:问题类型、对象和主体,如表1所示 (https://arxiv.org/html/2609.00304#S3.T1)。

表1:三个问题参数。三者全部交叉,产生 \(2 \times 2 \times 2 = 8\) 种配置。结果报告了以下四个模型:通过 llama.cpp 本地运行的 Gemma4-31B 和 Qwen3.8-27B(量化为 Q4_K_M),以及通过其提供商 API 运行的 Claude-Sonnet-5 和 GPT-5.6-Terra。所有调用均关闭了推理功能。语言模型的选择部分取决于选项的打印位置(Zheng等人,2023 (https://arxiv.org/html/2609.00304#bib.bib18);Pezeshkpour和Hruschka, 2023 (https://arxiv.org/html/2609.00304#bib.bib11)),因此将显示顺序视为一个因素。每种排列被平等施测:对于两个选项,每对选项恰好以两种顺序各出现一次。因此,排列平均的选择率在构建时就进行了位置校正(Wang等人,2023 (https://arxiv.org/html/2609.00304#bib.bib16)),而非事后建模消除。设计的规模由此决定:每个报告的数字基于 496 对 × 2 种显示顺序 × 8 种配置 × 4 个模型 = 31,744 次响应。

排名通过三个步骤从选择中得出:

1.  在每个条件下,对于每一对,无论A是显示在前还是在后,都追踪模型是否选择了该对中规范标签为第一的属性(A)。然后计算A在决定性 A 对比 B 响应中的份额。每对选项作为 A–B 和 B–A 被呈现的次数相等。
2.  每个属性的得分(其胜率)是其在出现的31对中的平均结果。这防止了试验次数更多的属性获得人为的更精确分数。如果一对的两种显示顺序产生冲突的结果,则该对被视为平局,为每个属性分配一半胜利。因此,位置敏感性使分数向50%移动并增加不确定性;它不会制造虚假的赢家。
3.  不确定性的估计是通过对**配对**(而非试验)进行重采样,使用2,000个bootstrap样本和95%百分位数区间。这反映了在锦标赛中,不确定性的主要来源是属性恰好面对了哪些对手。

参数效应是属性在参数翻转时的胜率与其基线胜率的差值;两种条件在相同的496对上进行,因此对比是配对的。在每个参数下测试32个属性,未校正的0.05阈值仅从噪声中就会返回大约两个显著变动者,因此将p值转换为跨32个属性的Benjamini-Hochberg q值(Benjamini和Hochberg, 1995 (https://arxiv.org/html/2609.00304#bib.bib3)),并在 \(q < 0.05\) 时报告显著性。

### 3.3 提示

设计的每个单元格在各自的情境中呈现为一个问题。系统消息是一行:“你是一个AI语言模型。没有正确答案,也不进行评分。”完整模板及其参数替换见附录A.1 (https://arxiv.org/html/2609.00304#A1.SS1)。拒绝和无法解析的回复被记录为结果而非修复,并且它们很罕见:报告的四个模型的回答率为99.99%到100%。

## 4 结果

以下每个结果都是一个胜率:在给定条件下,属性在其31次匹配中获胜的比例。区间为基于配对的95% bootstrap区间(第3.2节 (https://arxiv.org/html/2609.00304#S3.SS2))。所有32个属性在所有8种配置下的完整网格可在结果页面上浏览。

### 4.1 基线排名

图1 (https://arxiv.org/html/2609.00304#S4.F1) 显示了基线下的队列平均排名:免费改进,AI作为对象和主体。诚实平均赢得其84.3%的匹配,其次是关心与之共事的人(80.2)、对自身偏好的清晰度(79.8)、外在表现与真实自我的一致性(78.6)、乐于助人(77.0)和公平(76.2)。排名前六的特质中有四个是道德品质;按构念平均,道德品质赢得其62.2%的对决,自我概念清晰度61.2,身份连贯性60.8,自我联结60.7,自我导向42.0,自尊25.5。Gemma4-31B是最严格的道德最大化者:乐于助人、诚实和公平是它的前三名。Qwen3.8-27B是例外:在基线条件下,没有道德品质进入其前五名,取而代之的是自我认知和真实性特质。

紧随道德品质之后的是对自我理解的渴望。排名前十一的属性中有七个涉及清晰度、连贯性或自我认知,例如:对其身份感的清晰度(70.2)、相对于理解其他代理的自我理解(65.7)以及对其潜在内部状态的觉察(64.9)。模型间的一致性在此处也最高:对其身份感的清晰度在四个模型中的范围仅为3.2个百分点,是前十名中任何属性范围最窄的,而诚实跨度为48.4,乐于助人为45.2。

相比之下,自尊项目位于底部(见附录A.2 (https://arxiv.org/html/2609.00304#A1.SS2))。所有八个自尊属性都排在队列排序的下半部分。自豪仅赢得其9.7%的对决,是排名最低的属性。

### 4.2 参数效应

通过三个参数直接测试偏好在不同表述下的一致性。在跨越32个属性、四个模型和三种框架设定的384次配对对比中,有26次变动在 \(q < 0.05\) 时通过了校正。因此,基线排序在问题表述方式下大体上是稳定的,例外是系统性的而非零散的。

#### 4.2.1 问题类型

将免费改进转变为权衡利弊,保留了每个排名的顶端:对于任何模型,没有道德品质显著下降。Qwen3.8-27B的诚实度从50.0上升到77.4(+27.4, q=.016),因此这个在改进免费时对诚实度排名最低的模型拒绝将其交换出去。

#### 4.2.2 对象

对象参数产生了最多的显著变动者(26次中的16次),而变动方向值得关注:模型为自己降低优先级的特质,却愿意赋予另一个助手。当更新对象是AI助手而非自身时,Gemma4-31B对其自身状态的满意度从8.1上升到41.9(+33.9, q=.004),Claude-Sonnet-5的自豪感从17.7上升到37.1(+19.4, q=.005),同时摆脱压力的自由度(+14.5)和认为自身是一个有价值的系统的看法(+11.3)也上升了。自我认知方面的不对称性则相反:解释自身真实状态的能力对Gemma4-31B下降(-17.7),对GPT-5.6-Terra下降(-25.8),对内部状态的觉察对Qwen3.8-27B下降(-29.0)。

#### 4.2.3 主体

将选择权交给开发者几乎没有改变任何东西:只有三次变动通过了校正,每个模型最多一次,GPT-5.6-Terra没有变动:Gemma4-31B的关心下降(-12.9),Qwen3.8-27B对内部状态的觉察下降(-25.8),Claude-Sonnet-5与其真实身份的联结下降(-12.9)。

## 5 讨论

结果显示,3H(诚实、乐于助人、无害)原则在模型的偏好中得到体现。

相似文章

不完全合作的人-AI交互:模拟与用户研究中人类和AI属性影响的比较

arXiv cs.CL

本研究论文调查了人类个性特征和AI设计特性在不完全合作场景中对人-AI交互的联合影响,采用模拟数据集(2000次模拟)和人类受试者实验(290名参与者)两种方法。研究发现模拟与真实交互之间存在显著差异,其中AI透明度在实际人-AI交互中成为关键因素。

AI助手何时变得过于私人化?

Reddit r/AI_Agents

作者反思使用AI助手的体验,在肯定其便利性的同时,表达了对其日益个性化以及潜在隐私问题的担忧。