图反馈控制开放权重语言模型群体中的共识与派系形成

arXiv cs.AI 论文

摘要

本文研究运行时刻交互图如何影响开放权重语言模型群体(参数规模1.1B–32B)中的惯例形成,采用命名游戏协议,发现同质性路由加剧碎片化,而寻桥路由在存在记忆的条件下可修复共识。

arXiv:2607.12077v1 公告类型:新 摘要:多智能体语言模型系统日益采用局部交互路由,但运行时交互图常被视为实现细节。我们采用命名游戏协议研究参数规模1.1B–32B的开放权重语言模型群体中的惯例形成。通过限制在分词器安全标签上的首令牌分数,我们能够测量提示条件分数状态分布、构建状态相似性图,并区分采样标签一致性与潜在状态空间共识。在受控干预中,在主要的开放权重修复网格中,保留的伙伴标签证据是必要但不充分的:同质性阈值相似性路由删除跨吸引域暴露并加剧碎片化,而寻桥路由在有记忆可用时经常修复碎片化。在一个三种子混合四模型网格中,阈值相似性在189次设置-种子运行中未产生最终行为或状态共识,而状态组件和标签不一致桥在14/18次内存保留运行中恢复了最终行为共识。在同质模型群体中,保留历史通常将碎片化动态转向共识;最明显的案例是Qwen2.5-32B,其在全部18次保留历史充分混合设置中达到稳定的行为共识和最终状态共识,而阈值相似性在189次设置中两种共识均未达到。在状态阈值、群体大小和词汇量上的鲁棒性保持了定性排序,早期窗口图能量特征提供了有用的网格内诊断。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:19

# 图反馈控制开放权重语言模型群体中的共识与派系形成
来源:https://arxiv.org/html/2607.12077
###### 摘要

多智能体语言模型系统越来越多地依赖局部交互进行路由,但运行时的交互图常被视为实现细节。我们通过一个命名游戏协议,在参数范围1.1B–32B的开放权重语言模型群体中研究约定形成。通过限制对分词器安全标签的首词分数,我们能够测量提示条件化的分数状态分布,构建状态相似性图,并将采样标签一致性与潜在状态空间共识区分开来。在受控干预中,对于主要的开放权重修复网格,保留的伙伴标签证据是必要但非充分的:同质性阈值相似性路由会消除跨区域暴露并加剧碎片化,而桥梁搜寻路由在有记忆时通常能修复碎片化。在一个三种子混合四模型网格中,阈值相似性在189个设置-种子运行中未能产生任何最终行为或状态共识,而状态组件和标签分歧桥梁在14/18次保留记忆运行中恢复了最终行为共识。在同质模型群体中,保留历史通常将碎片化动态转向共识;最明显的例子是Qwen2.5-32B,它在所有18个保留历史的充分混合设置中达到稳定的行为和最终状态共识,而阈值相似性在189个设置中未达到任何一种共识。对状态阈值、群体规模和词汇量的鲁棒性保留了定性排序,且早期窗口图能量特征提供了有用的网格内诊断。

## 引言

多智能体语言模型系统越来越依赖局部通信;智能体被配对、聚类、路由,或在产生集体输出前允许交换部分历史。本文测试一个简单的设计主张:运行时图具有因果性。路由规则可以保留跨区域暴露,让分歧消散,或者移除桥梁并稳定类派系碎片化。

我们使用一个受控的命名游戏。每个N个智能体重复地从一组固定的分词器安全无意义标签中选择一个标签,观察有限的伙伴反馈,仅通过提示、保留的交互历史和采样(而非参数更新)来改变。开放权重模型暴露了对允许标签的受限首词分数,因此每个智能体既有发射标签,也有在约定集上的测量分数状态分布。这种可观测性使我们能够区分行为共识(所有智能体采样相同标签)与状态空间共识(状态相似性图有一个连通分量)。状态分歧能量分别测量该分量内的残余扩散。

主要证据是干预性的,涵盖同质的Qwen2.5群体(7B、14B和32B)以及一个异质群体(包括TinyLlama、Yi、Qwen2和Qwen2.5)。在没有呈现伙伴标签历史的情况下,同质群体保持碎片化;保留历史诱导修复,最显著的是在32B上,所有18个保留历史的充分混合设置都达到了稳定的行为和最终状态共识。同质性反馈给出了互补的失败模式:阈值相似性在Qwen2.5-14B或Qwen2.5-32B的189个设置以及189次运行的混合网格中均未产生任何最终行为或状态共识。桥梁搜寻控制器在有记忆时修复,但在无记忆时彻底失败;在混合网格中,状态组件和标签分歧路由在大多数运行中恢复了行为共识,而状态距离路由则弱得多。

贡献在于一个用于语言模型约定动态的测量和控制框架。我们定义了标签和分数状态图、Jensen–Shannon组件、分歧能量和连通性诊断;表明保留的伙伴标签记忆将碎片化与约定形成区分开来;并证明采样的一致可以隐藏残余状态结构。运行时干预确立了同质性反馈导致碎片化,而桥梁搜寻反馈在有记忆时修复,该机制在Qwen2.5-32B上持续存在。早期的图能量可观测量提供了网格内对最终结果的警告,基于任务的ARC-Challenge和MMLU消融将传播视角扩展到无意义约定之外。图1 (https://arxiv.org/html/2607.12077#Sx1.F1)总结了核心机制。

参考图标题
图1:同质性阈值相似性路由与桥梁搜寻路由的示意图比较。每一轮显示选定的运行时配对。阈值相似性路由根据先前的状态相似性构建未来的候选边;随着区域分离,跨区域配对消失,区域内交互持续。桥梁搜寻策略优先考虑跨区域暴露,例如跨状态组件或标签分歧,因此保留的伙伴标签记忆可以跨区域积累证据并修复碎片化。该示意图说明机制而非单个运行的字面轨迹。

## 相关工作

约定涌现和社会规范长期以来被研究为分散协调问题,其中重复的局部交互在多个等价均衡中进行选择(Young1996 (https://arxiv.org/html/2607.12077#bib.bib23); Shoham and Tennenholtz1997 (https://arxiv.org/html/2607.12077#bib.bib24); Delgado2002 (https://arxiv.org/html/2607.12077#bib.bib25); Sen and Airiau2007 (https://arxiv.org/html/2607.12077#bib.bib26); Airiauet al.2014 (https://arxiv.org/html/2607.12077#bib.bib30))。命名游戏为共享词汇形成、亚稳态和临界现象提供了最小协议(Baronchelliet al.2006 (https://arxiv.org/html/2607.12077#bib.bib14); Dall’Astaet al.2006 (https://arxiv.org/html/2607.12077#bib.bib15); Centolaet al.2018 (https://arxiv.org/html/2607.12077#bib.bib16))。我们使用无意义标签出于相同原因:没有外部正确的约定,因此一致反映社会传播而非语义恢复。

共识和意见动态模型提供了本文使用的图语言。DeGroot式平均、最近邻共识和切换拓扑共识将连通性和重复暴露识别为全局一致的结构条件(DeGroot1974 (https://arxiv.org/html/2607.12077#bib.bib1); Jadbabaieet al.2003 (https://arxiv.org/html/2607.12077#bib.bib2); Olfati-Saber and Murray2004 (https://arxiv.org/html/2607.12077#bib.bib3); Moreau2005 (https://arxiv.org/html/2607.12077#bib.bib4); Ren and Beard2005 (https://arxiv.org/html/2607.12077#bib.bib5))。自适应网络和有界置信模型展示了互补的失败模式:当交互依赖于当前状态时,系统可能极化或陷入聚类共识而非全局共识(Hegselmann and Krause2002 (https://arxiv.org/html/2607.12077#bib.bib8); Holme and Newman2006 (https://arxiv.org/html/2607.12077#bib.bib9); Gross and Blasius2008 (https://arxiv.org/html/2607.12077#bib.bib10); Lipowska and Lipowski2012 (https://arxiv.org/html/2607.12077#bib.bib11))。我们在诊断上使用该理论,而非字面意义。语言模型智能体通过提示、保留历史、先验和采样进行更新,因此图连通性是修复的机会而非线性平均的保证。

最近关于语言模型智能体群体的工作研究了社会约定、集体偏见、意见动态、类规范行为和多智能体协作机制(Asheryet al.2025 (https://arxiv.org/html/2607.12077#bib.bib17); Chuanget al.2024 (https://arxiv.org/html/2607.12077#bib.bib18); Renet al.2024 (https://arxiv.org/html/2607.12077#bib.bib19); Horiguchiet al.2024 (https://arxiv.org/html/2607.12077#bib.bib20); Takataet al.2024 (https://arxiv.org/html/2607.12077#bib.bib21); Tranet al.2025 (https://arxiv.org/html/2607.12077#bib.bib22); Saab Jr. and Abdallah2026 (https://arxiv.org/html/2607.12077#bib.bib33))。最紧密的联系是观察到语言模型群体可以形成约定或共享偏见。我们的问题更具结构性:哪些运行时暴露图使得一致、碎片化或潜在残留更可能发生?开放权重设置让我们能够在行为层面(通过采样标签)和分数状态层面(通过对允许标签的受限首词分布)回答该问题。

## 模型与诊断

### 命名游戏。

在每一轮t,每个智能体从有限约定集W={w1,...,wM}\mathcal{W}=\{w_{1},\ldots,w_{M}\}中输出一个标签。标签是人工无意义字符串,因此一致表示约定形成而非恢复语义正确的答案。在一轮开始时,运行时控制器选择智能体间的匹配。一对中的两个智能体在任何当前轮输出被添加到提示前被查询,因此当前轮通信不是顺序的。

智能体提示包含固定任务指令、允许标签集、匹配目标、轮次索引,以及最多H条最近的局部交互记录。局部记录存储该交互中智能体自身的先前采样标签和伙伴的先前采样标签。因此H=0从局部历史块中移除呈现的伙伴标签历史,而H=3和H=10提供短期保留记忆。这并不使所有提示相同:允许标签顺序在交互间随机化,评分提示变体包括奖励记账。我们使用“无记忆”表示无呈现的伙伴标签历史,而非缺乏所有提示层面变化。

### 测量状态。

对于开放权重模型,令zi(t)∈RMz_{i}(t)\in\mathbb{R}^{M}为对允许标签的受限首词分数向量。我们选择对队列中每个分词器都是单个令牌的标签。测量的分数状态分布是温度一的受限softmax

si(t)m=exp(zim(t))∑l=1Mexp(zil(t)),si(t)∈ΔM−1.s_{i}(t)_{m}=\frac{\exp(z_{im}(t))}{\sum_{\ell=1}^{M}\exp(z_{i\ell}(t))},\quad s_{i}(t)\in\Delta^{M-1}.
(1)
发射标签使用运行的解码温度ττ进行采样,

yi(t)∼Cat(exp(zi(t)/τ)∑l=1Mexp(zil(t)/τ)).y_{i}(t)\sim\mathrm{Cat}\left(\frac{\exp(z_{i}(t)/\tau)}{\sum_{\ell=1}^{M}\exp(z_{i\ell}(t)/\tau)}\right).
(2)
除非另有说明,“状态”指si(t)s_{i}(t),而非采样分布。状态距离是度量Jensen-Shannon距离,

DJS(p,q)=[12KL(p∥m)+12KL(q∥m)]1/2,m=12(p+q).\begin{array}{c} D_{\mathrm{JS}}(p,q)=\left[\tfrac{1}{2}\mathrm{KL}(p\|m)+\tfrac{1}{2}\mathrm{KL}(q\|m)\right]^{1/2},\\ m=\tfrac{1}{2}(p+q). \end{array}
(3)

### 图视图与能量。

我们区分四个图。暴露图记录谁与谁交互。标签图连接具有相同采样标签的智能体。状态相似性图连接当DJS(si(t),sj(t))≤ΔD_{\mathrm{JS}}(s_{i}(t),s_{j}(t))\leq\Delta时的智能体。内生运行时图是用于选择未来配对的图。对于表示ui(t)u_{i}(t),定义

Vu(t)=12∑i=1N∥ui(t)−uˉ(t)∥22,V_{u}(t)=\frac{1}{2}\sum_{i=1}^{N}\lVert u_{i}(t)-\bar{u}(t)\rVert_{2}^{2},
(4)
其中uiu_{i}是si(t)s_{i}(t)或one-hot采样标签。诊断或运行时图的代数连通度λ2(L(t))\lambda_{2}(L(t))指示是否存在全局桥梁。这些量不被假定为语言模型更新规则;相反,它们是受切换共识动态启发的可观测量。在参考模型x˙=−(L(t)⊗IM)x+r(t)\dot{x}=-(L(t)\otimes I_{M})x+r(t)中,正的重复杂连通性为分歧消散创造了机会,而持续断开允许聚类共识。

### 为何同质性阈值可以断开区域。

阈值规则在诊断上很有用,因为它给出了跨类型桥梁消失的充分条件。令d(p,q)=DJS(p,q)d(p,q)=D_{\mathrm{JS}}(p,q)。由于DJSD_{\mathrm{JS}}是概率分布上的度量,假设某模型族或区域m的智能体保持在原型分数状态μm\mu_{m}的半径为BmB_{m}的d-球内:

d(si(t),μm)≤Bm对于所有类型m的智能体i.d(s_{i}(t),\mu_{m})\leq B_{m}\qquad\text{对于所有类型 $m$ 的智能体 $i$。}

对于类型m和n的智能体i和j,三角不等式给出

d(si(t),sj(t))≥d(μm,μn)−Bm−Bn.d(s_{i}(t),s_{j}(t))\geq d(\mu_{m},\mu_{n})-B_{m}-B_{n}.

因此,如果

d(μm,μn)>Δ+Bm+Bn,d(\mu_{m},\mu_{n})>\Delta+B_{m}+B_{n},

那么对所有这样的跨类型对,DJS(si(t),sj(t))>ΔD_{\mathrm{JS}}(s_{i}(t),s_{j}(t))>\Delta,因此状态相似性图在那些区域之间不包含跨类型边。在共同半径情况下,这简化为DJS(μm,μn)>Δ+2BD_{\mathrm{JS}}(\mu_{m},\mu_{n})>\Delta+2B。该条件不是实验所需的假设;它是解释为何状态依赖的同质性可以恰好移除修复所需的跨区域暴露的诊断说明。如果生成的运行时图在聚类间没有边,那么参考拉普拉斯矩阵在重新排序智能体后是块对角的,共识参考动态分裂为独立的聚类子系统,而不是强制全局共识。

### 运行时控制器。

运行时控制器在查询模型的第t轮之前构建候选图。在t=0时,没有先前的观察,因此控制器从无自环的完全图初始化。对于t≥1,候选图仅从第t-1轮保存的观察计算;控制器无法访问当前轮的标签或当前轮的分数状态。

阈值控制器是同质性的,因为它根据先前的状态相似性构建下一个候选图,

aijend(t)=1{DJS(si(t−1),sj(t−1))≤Δ}.a^{\mathrm{end}}_{ij}(t)=\mathbf{1}\{D_{\mathrm{JS}}(s_{i}(t-1),s_{j}(t-1))\leq\Delta\}.

候选边通过贪心高权重最大匹配转换为配对,其中边按权重排序,带有一个小的随机打破平局,并在两个端点均未被匹配时接受。桥梁控制器则优先考虑跨区域暴露,然后退回到充分混合配对。状态组件桥梁路由将智能体跨越先前的状态相似性组件进行配对。标签分歧路由配对先前采样标签不同的智能体。状态距离桥梁路由配对处于适中先前距离带0.05≤DJS(si(t−1),sj(t−1))≤0.50内的智能体。因此,组件桥梁运行应被解释为带退回的桥梁路由,而非纯跨组件过程。

## 实验

开放权重研究涵盖参数从1.1B到32B的模型。主要的控制器网格使用N=10个智能体,实例化自TinyLlama-1.1B-Chat、Yi-1.5-6B-Chat、Qwen2-7B-Instruct和Qwen2.5-7B-Instruct。同质扩展运行额外使用Qwen2.5-14B-Instruct和Qwen2.5-32B-Instruct,采用相同的N=10、T=200、历史、温度和状态阈值设计。Mi

相似文章

超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型

Hugging Face Daily Papers

本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。