十六个模型,不足两种声音:在无唯一正确答案时衡量集成离散度

arXiv cs.CL 论文

摘要

这篇 arXiv 预印本研究形成集成的十六个语言模型的语义离散度,表明平均而言集成多样性较小,且模型身份仅部分解释了哪个模型的差异最大。作者提出了一种逐模型异议贡献度量,并发现离散度由临床内容而非解释开放性所组织。

arXiv:2608.00285v1 公告类型:新 摘要:来自十个系列的十六个语言模型,平均产生了心理治疗案例的 1.69 种不同表述的语义多样性,而单模型基线为单个模型自身运行产生的 1.43。集成基于多个模型提供多种视角的前提,将不止一种解读呈现给决策者。其输出的离散度既被衡量为多样性,也被衡量为不确定性,而这两种传统都依据正确性标准进行验证,但该任务并不存在这种正确性标准。衡量多样性是一个已解决的问题:Vendi 分数,即相似性矩阵的冯·诺依曼熵的指数,是不同元素的有效数量。单一聚合值无法说明的是多样性来自何处。我们定义了逐模型异议贡献,即一个模型与其集成其他成员的平均相似度的补数:这是一个来自同一矩阵的量值,而非谱指数的分解,其最大值标识出最具分歧的声音。将模型与案例交叉,我们作为预注册假设检验模型身份是否解释了异议方差中的非零份额,并刻画该检验所检测到的结构。专家组制定了十五个分层小故事,产生了 7,082 个表述用于分析。模型身份是剩余异议的一个可检测的结构化因素,但通常的分类仅部分恢复了该因素:规模差异在不同配对间指向相反方向,家族仅在五条双成员线上对模型进行分组,且最具分歧的声音随专家组组成而变化,因此浮现的离群者描述的是集成而非模型。异议并未跟随案例库分层所依据的解释开放性;它反而由临床内容组织,这使得集成产生的离散度成为一个需要衡量而非假设的属性。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:41

# 十六个模型,不足两种声音:在没有唯一正确答案时度量集成离散度
来源:https://arxiv.org/abs/2608.00285
查看PDF (https://arxiv.org/pdf/2608.00285)

> 摘要:来自十个模型家族的十六个语言模型,平均产生了相当于1.69个不同心理治疗案例表述的语义多样性,而单模型基线中一个模型自身多次运行的结果为1.43。集成模型基于多个模型提供多个视角的前提,将不止一种解读呈现在决策者面前。对其输出的离散度分别以多样性和不确定性两种方式进行度量,而这两种传统都以正确性标准来验证其结果,但本任务并不存在这种正确性标准。度量多样性是一个已解决的问题:Vendi分数,即一个相似性矩阵的冯·诺依曼熵取指数,是不同元素的有效数量。单一的聚合值无法说明多样性来自何处。我们定义了每个模型的分歧贡献,即一个模型与其集成中其他成员的平均相似度的补数:这一量度来自同一矩阵,而非谱指数的分解,其最大值标识出最分歧的声音。跨越模型与案例,我们将模型身份是否解释了分歧方差中的非零份额作为预注册假设进行检验,并刻画该检验所检测到的结构。专家组制定了十五个分层情景案例,产生了7,082个表述供分析。模型身份是剩余分歧中可检测到的结构因素,但通常的类别只能部分还原它:规模差异在成对比较中指向相反方向,家族仅在五条双成员谱系上对模型进行分组,而最分歧的声音随专家组构成而变化,因此浮现的离群值描述的是集成本身而非模型。分歧并未跟随案例库分层所依据的解释开放性;而是由临床内容组织,这使得集成产生的离散度成为一个需要测量的属性,而非理所当然的属性。

## 提交历史

来自:Mario Vega-Barbas [查看电子邮件 (https://arxiv.org/show-email/7e96ec84/2608.00285)] **[v1]** 2026年7月31日星期五 20:42:53 UTC(732 KB)

相似文章

深入 CHOIR:自由列表引出法揭示 LLM 集成中的差异化模型声音

arXiv cs.AI

论文提出了 CHOIR(Collective Hierarchically-Ordered Inquiry Responses,集体层级有序问询响应)框架,将认知人类学中的自由列表引出法引入其中,用于探测和量化 LLM 集成在表面一致性之下隐藏的多样性,并发现基础模型身份是可识别的最强信号,能够区分不同的模型声音。