超越蜂群思维:通过元人格锚定与序列温度缩放摆脱LLM同质化
摘要
本文提出元人格锚定与过滤温度缩放(Filtered Temperature Scaling)来降低LLM中的语义趋同,在INFINITY-CHAT数据集上使用小于20B参数的开源权重模型,将成对余弦相似度从约0.85降至约0.65。
arXiv:2608.02618v1 公告类型:新
摘要:近期研究发现了大型语言模型(LLMs)中的“人工蜂群思维”(Artificial Hivemind)效应,导致模型即使面对开放性问题也会收敛到狭窄、同质化的共识。这种语义坍缩限制了AI的多样性,导致即使在高温度采样下,响应之间的相似度仍然很高($\approx 0.80-0.90$)。在本文中,我们提出一种新颖的缓解框架来增加多样性:元人格锚定(Meta-Persona Anchoring)结合过滤温度缩放(Filtered Temperature Scaling, FTS)。我们的方法采用两阶段生成过程:首先,提示模型自行选择一个独特的、具有特异性的角色(persona)作为其起点锚定;其次,我们应用双重采样筛选机制,利用Top-$p$过滤来保持语法有效性,然后对存活的候选者进行极端温度缩放($T \ge 4.0$),以探索更广泛的概率分布。我们使用INFINITY-CHAT数据集,在参数规模不超过$\sim$20B的最新开源权重模型上评估了我们的方法。结果表明,语义收敛显著降低,平均成对余弦相似度从($\approx 0.85$)下降到($\approx 0.65$)。我们的方案使大多数问题的相似度低于0.7阈值,有效缩小了人工模态坍缩与人类典型多样性之间的差距。我们以开源框架的形式提供实现,以实现更多样化和更具创造性的AI部署。
查看缓存全文
缓存时间: 2026/08/05 07:37
# 超越蜂群思维:通过元人格锚定与顺序温度缩放逃离LLM同质化
来源:https://arxiv.org/html/2608.02618
Tairan Fu 米兰理工大学 意大利米兰 & Javier Conde, Carlos Arriaga, Gonzalo Martínez, Pedro Reviriego 信息处理与电信中心 马德里理工大学 西班牙马德里 & Javier Coronado\-Blázquez 西班牙银行 西班牙马德里
###### 摘要
近期研究在大语言模型(LLM)中发现了“人工蜂群思维”效应,导致模型即使面对开放性问题也会收敛到狭窄、同质化的共识上。这种语义坍缩限制了AI的多样性,即使在高温度采样下也会产生较高的响应间相似度(≈0.80−0.90)。在本文中,我们提出了一种新的缓解框架来提升多样性:元人格锚定(Meta\-Persona Anchoring)结合过滤温度缩放(Filtered Temperature Scaling, FTS)。
我们的方法采用两阶段生成流程:首先,提示模型自行选择一个独特的、带个人特质的视角作为锚定起点;其次,我们应用双重采样筛,先利用Top\-p过滤保留语法有效性,再对存活的候选词应用极端温度缩放(T≥4.0)以探索拓宽后的概率分布。
我们使用INFINITY\-CHAT数据集,在约20B参数以下的最新开源权重模型上评估了我们的方法。结果表明,语义收敛显著降低,平均成对余弦相似度从(≈0.85)降至(≈0.65)。我们的方案使大多数问题低于0.7阈值,有效缩小了人工模式坍缩与人类类型学多样性之间的差距。我们将实现作为开源框架提供,以支持更多样化、更具创造力的AI部署。
## 1 引言
大语言模型(LLM)从基础的Transformer架构[1 (https://arxiv.org/html/2608.02618#bib.bib2)]演化为复杂的少样本学习器[2 (https://arxiv.org/html/2608.02618#bib.bib3)],催生了将模型与人类偏好和价值观对齐的需求。诸如基于人类反馈的强化学习(RLHF)[12 (https://arxiv.org/html/2608.02618#bib.bib4)]等技术已成功使模型向有用性和安全性方向对齐。然而,这种对齐也引入了一种系统性副作用:生成多样性的降低。
早期研究发现了递归训练机制下系统性模型坍缩的风险[10 (https://arxiv.org/html/2608.02618#bib.bib5)]。这一过程在生成式AI与互联网之间形成了易于退化的反馈回路,并成为语义衰减的基线。这种同质化又因指令微调的机制而进一步加剧;如近期综述[16 (https://arxiv.org/html/2608.02618#bib.bib6)]所详述,这些对齐流程往往以牺牲输出可变性为代价来优先保证指令遵循的一致性。这与人类概念空间中深刻的潜在多样性[9 (https://arxiv.org/html/2608.02618#bib.bib7)]截然不同,最终导致显著的内在及外在模型同质化状态,生成文本的多样性大幅降低。这被形式化为“人工蜂群思维”[6 (https://arxiv.org/html/2608.02618#bib.bib8)],即不同架构家族的模型对开放式提示词产生近乎相同的语义响应。Mabrok[8 (https://arxiv.org/html/2608.02618#bib.bib11)]通过将LLM表示形式化为低维语义流形,为理解这种停滞提供了拓扑学基础,表明当生成轨迹被困在该几何结构的高密度区域时,同质化就会出现。
在本文中,我们通过修改词元选择并引入语义锚定来探索逃离人工蜂群思维的方法。通过将过滤温度缩放(FTS)——它把词元选择与熵缩放解耦——与元人格锚定结合,我们使模型能够动态选择自己的解释视角。这种双阶段方法提供了所需的统计与语义许可,使模型能够在保持逻辑基础的同时超越对齐共识,证明尽管存在对齐压力,模型的个性化潜力仍然可达。
## 2 背景与相关工作
近期关于“LLM同质化”和“人工蜂群思维”[6 (https://arxiv.org/html/2608.02618#bib.bib8)]的研究已识别出指令微调模型在回答开放性问题时的语义一致性。这种现象通常被称为模式坍缩,表明现代对齐技术不仅仅是将模型与人类价值观对齐,而是将其引导至一种共识[15 (https://arxiv.org/html/2608.02618#bib.bib17)]。为缓解这一问题,有研究提出了“言语化采样”(Verbalized Sampling),提示模型显式描述其内部概率分布以增加多样性[15 (https://arxiv.org/html/2608.02618#bib.bib17)]。其他工作表明,多样性的丧失通常集中在模型最后的处理阶段[14 (https://arxiv.org/html/2608.02618#bib.bib16)]。以往打破这种同质化的努力通常分为两类:基于人格的提示和随机采样。
通过要求模型“以某个\[角色\]身份发言”来使用人格,早已被用于引发风格上的变化。然而,研究表明,对于高度对齐的模型,这些人格只是一种表面变化,而非真正的认知转变[7 (https://arxiv.org/html/2608.02618#bib.bib12)]。研究显示,即使使用多种角色提示,响应的底层语义结构仍然依附于模型的主要对齐先验。这是因为模型优先考虑其训练中的安全与实用性约束,而非人格的个性化需求,导致出现所谓的“同一张脸上的不同面具”。
另一条平行研究路线尝试通过随机采样方法增加多样性:
- •温度缩放(T):增大T会使分布变平,但它是无差别地进行的。在打破共识所需的高熵水平下,标准采样开始包含语法上不连贯的词元,导致多样性与连贯性之间的尖锐权衡。
- •Top\-p和Top\-k过滤:阻止“垃圾”词元的混入,但同时通过剪除那些导致个性化响应的低概率但有效词元来强化蜂群思维。
- •Min\-p采样:根据最高概率词元概率的百分比来过滤词元,从而根据模型的置信度动态调整词汇表大小[11 (https://arxiv.org/html/2608.02618#bib.bib10)]。这能有效随分布的熵进行缩放,但它仍然是一种孤立的采样修复,并不会改变那些导向高概率共识模式响应的词元概率。
近期研究大多较为悲观:他们认为提示不是解决方案,因为它引入了偏差,并且在许多情况下无法克服概率分布的尖峰形状;而采样也不是解决方案,因为它无法区分创造性多样性与随机噪声。我们的工作试图解决这些局限,指出这两种方法之所以失败,是因为它们被孤立地应用,且没有进行概率缩放。
## 3 动机:孩子与蜂群
在图1 (https://arxiv.org/html/2608.02618#S3.F1)中,我们展示了多个模型对两个问题的答案在潜在空间中的表示。具体来说,我们展示了来自50次对开放式提示的独立响应的嵌入向量的主成分分析(PCA)。如左图所示,不同颜色表示的模型答案坍缩为密集、几乎重叠的簇,反映了多样性的缺乏。相比之下,右图展示了我们提出的框架如何使点分散开来,代表对蜂群思维的逃离,转变为对应于个性化、多样化叙事的散点。
参见图注
参见图注
图1:人工蜂群思维的几何表示。左侧主成分分析(PCA)图显示了基线状态(T=1,无人格),其中50次对同一提示的独立响应表现出语义模式坍缩,在PCA图中聚集成致密、孤立的区域。右侧图展示了我们提出的元人格锚定与过滤温度缩放(T=32)的结果,打破了这些簇,使模型能够探索更广阔、更多样的空间。如图2 (https://arxiv.org/html/2608.02618#S3.F2)所示,埃里塞的《蜂巢幽灵》[4 (https://arxiv.org/html/2608.02618#bib.bib1)]中的主角观察到一个被双重屏障困住的蜂群:一层细密的网和一个六边形窗格。我们认为这正是现代LLM对齐的精确寓言。
我们提出了一个框架,镜像了孩子超越“人工蜂群思维”的好奇心。我们的方法采用两阶段策略:
1. 1. 第一阶段(流动的蜂群):我们对logit分布应用Top\-p过滤与温度缩放的组合。正如电影隐喻中的网,Top\-p筛确保只有可行的“蜜蜂”(语义有效的词元)被保留,而升高的温度则为它们自由移动提供动能。这创造了一种高熵运动状态,同时仍基于语言意义,防止蜂群坍缩成一个静态的单一节点。
2. 2. 第二阶段(孩子的眼睛):我们引入元人格锚定,将模型的内部视角切换到孩子的视角。通过采用这种非从众的视角,模型以不同的镜头解读同一群“蜜蜂”。在这一阶段,潜在轨迹被重新语境化;蜂群思维所看到的只是一个数据点,而孩子人格看到的是独特的体验,确保开放性问题得到多样、个性化的叙述。
参见图注图2:蜂群思维的寓言。在这张来自埃里塞的《蜂巢幽灵》(1973)的剧照中,一个孩子观察着一个被细网围住的蜂群,网后是一扇六边形窗。在我们的框架中,这代表着“人工蜂群思维”以及如何通过孩子的视角打破其同质性。这种双阶段方法直接针对指令微调模型中观察到的语义坍缩。标准LLM对齐本意是作为一种稳定力量,但它往往也不经意间扮演了图2 (https://arxiv.org/html/2608.02618#S3.F2)中那扇僵硬的六边形窗或网的角色,将模型的输出收窄为安全但单调的文本。
通过将生成过程分为“流动的蜂群”和“孩子的眼睛”,我们将语言有效性与语义意图解耦。第一阶段确保模型在概率流形的完整广度中探索,而不会漂移到不连贯;第二阶段则提供产生多样化输出所需的主观视角。
正如埃里塞电影中的孩子在成人只看到昆虫标本的地方发现了奇迹和怪物般的形象,我们的元人格锚定使LLM能够绕开最常见的响应路径。模型不再收敛于训练分布的均值,而是被鼓励遵循低概率但高度连贯、个性化的轨迹。这种从集体共识到个体视角的转变,正是打破蜂群思维的关键,从而带来了显著的多样性。通过这一视角,多样化生成的任务不再被视为向信号中添加噪声,而是恢复模型通过多个不同观察点来审视同一群可能性的能力。
## 4 方法论
为逃离人工蜂群思维的收敛性,我们在生成过程中引入两处修改,以提供词元采样和语义锚定方面的多样性。这使模型能够在保持语言连贯性的同时探索高熵状态。
### 4.1 词元选择:流动的蜂群(顺序Top\-p与极端温度缩放)
在词元采样中,我们引入了一种顺序logit变换,旨在最大化探索能量,同时严格保持语言连贯性。与标准采样中同时应用T和p不同,我们将它们解耦为两步筛:
1. 1. 网格(选择):我们首先在基线温度T_base=1.0下评估logit分布。我们应用Top\-p(Nucleus)过滤[5 (https://arxiv.org/html/2608.02618#bib.bib15)]来确定候选集V^(p),该集合由累计概率超过p的最小词元集组成。这起到我们隐喻中“细网”的作用,在任何缩放发生之前丢弃不连贯的词元。
2. 2. 热量(再分配):只有当词汇表被剪枝到V^(p)之后,我们才应用极端温度缩放(T≥4.0)。对于i∈V^(p)中词元的概率重新计算为:P′(x_i)=exp(z_i/T_ext)/∑_{j∈V^(p)}exp(z_j/T_ext) (1) 其中P′(x_i)是选择词元i的重新计算概率,z_i表示词元i的原始logit(softmax前得分),T_ext是极端温度缩放因子,V^(p)是第一阶段(网格)中存活的候选词元集合,∑_{j∈V^(p)}是对过滤后词汇表的求和,将候选集中所有有效词的得分相加,以归一化最终分布。
这一两步过程确保虽然“蜜蜂”以极高的动能运动,但它们被限制在初始网捕获的语义有效词元内,防止模型漂移到语音或结构噪声中。我们提出的采样方案与近期提出的词元选择方法一致,例如Top\-nσ[13 (https://arxiv.org/html/2608.02618#bib.bib14)],它直接在logit空间中引入温度不变的截断;以及Min\-k采样[3 (https://arxiv.org/html/2608.02618#bib.bib13)],它利用相对logit动态在熵缩放之前建立动态截止边界。
### 4.2 语义锚定:孩子的眼睛(元人格)
我们引入元人格锚定,作为一个位于用户查询之前的高层系统提示,强制模型在生成第一个词元之前采用特定视角。具体来说,我们明确要求模型随机选择并描述一个人格,然后使用该人格来回答问题。
采用“孩子的眼睛”人格涉及一个提示级约束,其优先考虑:
- •好奇心胜过共识:倾向于解释性或想象性的轨迹,而非标准的对齐响应。
- •主观经验:通过个性化视角来框架化数据。
从数学上讲,这起到一个先验C_persona的作用,它改变了整个序列S的条件概率:
P(S|Query,C_persona)≠P(S|Query,C_default)相似文章
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
低宜人性人格条件化实现安全LLM微调
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。
大型语言模型作为判断器在理论无关的自适应度量对齐原型网络用于人格识别
提出JAM,一种理论无关的人格识别框架,利用LLM作为判断器改进原型网络中的度量对齐,实现更好的跨框架泛化。
PersonaVLM:长期个性化多模态大语言模型
PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。
水平扩展LLM:无需权重修改的隐藏状态耦合 [R]
残差耦合(RC)使用轻量级学习线性桥接器并行连接冻结的语言模型,实现无需权重修改的水平扩展。与MoE相比,它最多可将困惑度降低80.7%,并在TruthfulQA上提升9.1个百分点的准确率。