多未必佳:LLM观点多样性的关键因素是什么?

arXiv cs.CL 论文

摘要

一项析因实验表明,角色细节并不会单调增加LLM观点多样性;不同的交互架构探索了互不重叠的观点区域;而温度缩放等低成本干预措施效果甚微。

arXiv:2607.20429v1 Announce Type: new 摘要:大语言模型越来越多地用于模拟开放任务中的人类观点多样性,例如合成调查、焦点小组建模和公众意见预测。然而,LLM的输出表现出系统性的观点同质化。实践者探索了多种提升多样性的干预措施,但相关研究仍较为零散:不同方法在孤立条件下使用不可比较的指标进行评估,且在实际部署中通常会同时升级,难以将效果归因于特定组件。为了更科学地理解LLM输出多样性,我们设计了一项析因实验,将两个主要干预维度分离:输入条件化(通过角色深度实现)和交互架构。我们在7个模型的100个真实用户开放问题上评估了所有条件,并使用多种互补指标衡量多样性。我们的发现挑战了一些常见假设。首先,更多角色细节并不会单调提升多样性。角色条件化的初始步骤已涵盖大部分增益,而进一步添加人口统计细节并未持续改善,甚至在某些模型上降低了多样性。其次,并非寻求单一最佳交互架构,我们发现不同架构探索了基本不重叠的观点区域。组合多种架构比优化任何一种能获得更广泛的覆盖。第三,与结构化干预相比,常见的低成本替代方案(如提高采样温度和添加多样性指令)效果甚微。总体而言,我们的研究表明,多样性并非沿单一维度扩展的产物,而是高度依赖于干预措施的结构形式及其组合。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# 更多不一定更好:LLM观点多样性的关键因素是什么? 来源:https://arxiv.org/html/2607.20429 ###### 摘要 大型语言模型越来越多地被用于在开放式任务中模拟多样化的人类观点,例如合成调查、焦点小组建模和民意预测。然而,LLM 的输出表现出系统性的观点同质化。实践者探索了各种干预措施以增加多样性,但该领域仍然碎片化:不同的方法在孤立的环境下使用不可比较的指标进行评估,并且在实际应用中,它们通常同时部署和升级,使得难以将收益归因于特定组件。为了更科学地理解 LLM 输出多样性,我们设计了一个析因实验,分离了两个主要的干预维度:输入条件化(通过角色深度操作化)和交互架构。我们在 7 个模型上,针对 100 个真实用户的开放式问题评估了所有条件,并使用多个互补的指标测量多样性。我们的发现挑战了几个常见的假设。首先,更多的角色细节并不会单调地增加多样性。角色条件化的初始步骤已经捕获了大部分增益,而进一步增加人口统计细节不会持续改善,在某些模型上甚至会降低多样性。其次,与其寻找单一的最佳交互架构,我们发现不同的架构探索了很大程度上不重叠的观点区域。结合多种架构能比优化任何一种架构提供更广泛的覆盖。第三,与结构化干预相比,常见的低成本替代方案,如提高采样温度和添加多样性指令,效果微乎其微。总的来说,我们的工作表明,多样性不是沿着任何单一维度扩展的产物,而是对干预措施的结构形式和组合高度敏感。该领域需要转向基于经验证据的多样性策略设计,而非假设驱动的探索。 ## 1 引言 大型语言模型在具有确定答案的推理任务上表现出色,但越来越多的研究和应用将这些模型引向另一类问题:生成合成调查响应[1 (https://arxiv.org/html/2607.20429#bib.bib1),5 (https://arxiv.org/html/2607.20429#bib.bib5)]、主持焦点小组讨论[66 (https://arxiv.org/html/2607.20429#bib.bib66)]、建模公众意见分布[55 (https://arxiv.org/html/2607.20429#bib.bib55),16 (https://arxiv.org/html/2607.20429#bib.bib16)]以及预测社会行为[24 (https://arxiv.org/html/2607.20429#bib.bib24),46 (https://arxiv.org/html/2607.20429#bib.bib46),23 (https://arxiv.org/html/2607.20429#bib.bib23)]。在这些开放式设置中,价值不在于单个响应的正确性,而在于集体输出是否涵盖了异质、可区分的立场、判断和理由。如果每个参与者都表达相同的担忧,得出相同的结论,并且仅在措辞上有所不同,那么一个合成的焦点小组就没什么用。这使得观点多样性成为一个核心要求。然而,LLM 的观点多样性面临系统性限制。不同模型趋向于相似的观点[48 (https://arxiv.org/html/2607.20429#bib.bib48),28 (https://arxiv.org/html/2607.20429#bib.bib28)],对齐训练显著收窄了意见分布[32 (https://arxiv.org/html/2607.20429#bib.bib32),55 (https://arxiv.org/html/2607.20429#bib.bib55)],并且 LLM 模拟的调查响应低估了人类群体中观察到的方差,即使是在以人口统计资料为条件的情况下[5 (https://arxiv.org/html/2607.20429#bib.bib5)]。 越来越多的研究工作提出了恢复这种丢失多样性的干预措施。这些措施范围从输入层策略——角色提示[25 (https://arxiv.org/html/2607.20429#bib.bib25)]、显式多样性指令[22 (https://arxiv.org/html/2607.20429#bib.bib22)]、多语言提示[59 (https://arxiv.org/html/2607.20429#bib.bib59)]——到架构层面的干预措施,如多智能体辩论[37 (https://arxiv.org/html/2607.20429#bib.bib37),26 (https://arxiv.org/html/2607.20429#bib.bib26)]和结构化讨论协议[8 (https://arxiv.org/html/2607.20429#bib.bib8)],以及解码时技术,包括口头采样[65 (https://arxiv.org/html/2607.20429#bib.bib65)]和基于 CoT 的引出[40 (https://arxiv.org/html/2607.20429#bib.bib40)]。每项研究在孤立情况下都报告了令人鼓舞的结果。然而,仍然缺少两样东西。首先,缺乏系统性的受控比较。不同的干预措施几乎总是在孤立条件下评估,或者在单个系统内同时升级:一个采用更丰富角色和多智能体架构的产品会产生更多样化的观点,但收益无法归因于任何一个组件。其次,缺乏统一评估标准。不同的研究采用不同的多样性和测量定义——从词汇 n-gram 重复率到语义嵌入离散度再到人类判断——使得跨研究结果在很大程度上不可比较。 为了系统评估 LLM 输出多样性,我们设计了一个析因实验,分离了 LLM 模拟系统中最常见的同时升级的两个轴的贡献:输入条件化(角色深度,从无身份信息到丰富的传记叙述)和交互架构(单次调用、多轮自我提示和多智能体讨论),以及更高温度和多样性指令等低成本控制(图1 (https://arxiv.org/html/2607.20429#S1.F1))。我们在从 7 个聊天模型中的真实用户查询中抽取的 100 个开放式问题上评估所有条件,从每个响应中提取原子观点,并在两个层次上测量多样性:条件内离散度(α\\alpha\-多样性)和条件间互补性(β\\beta\-多样性)。 参见图注 图 1:析因实验设计。纵轴通过五个角色深度级别(无、角色、基础、中级、专业)变化输入条件化。横轴变化三种交互架构:单次调用、多轮自我提示和多智能体讨论。虚线对角线表示实践中常见的共同演化,其中两个维度同时升级。四种低成本技巧(底部)在单次调用×\\times无基线条件下进行评估。 我们的发现揭示,与常见直觉相反,更多并不意味着更好。首先,角色细节显示出急剧的递减回报:一句简单的职业描述就捕获了大部分多样性增益;添加人口统计属性并非始终有帮助,并且在某些模型上*降低*了多样性。其次,不同的交互架构探索了很大程度上不重叠的观点区域;结合多种架构比优化任何一种单一架构产生更广泛的覆盖。第三,常见的捷径——提高采样温度、添加“考虑多元观点”指令——效果微乎其微;一句角色的提示性能优于最佳低成本技巧的 2.5×\\times。 我们做出三项贡献。首先,我们将开放式 LLM 任务中的观点多样性框定为一个归因问题,并设计了一个独立变化输入条件化和交互架构的析因实验。其次,我们构建了一个可复用的评估协议,包括观点提取、条件内 α\\alpha\-多样性度量和条件间 β\\beta\-多样性度量,使未来的工作能够在可比条件下评估新的干预措施。第三,我们进行了系统的实证审查,涵盖 100 个开放式问题、7 个聊天模型和 19 个条件,揭示了角色深度的递减回报、交互架构的互补性以及低成本捷径的有限效果。我们发布完整的评估协议以支持直接复制和扩展。 ## 2 实验设计 增加 LLM 生成观点多样性的方法通常沿着两个轴进行:输入条件化,最常见的是通过日益详细的角色描述[1 (https://arxiv.org/html/2607.20429#bib.bib1),25 (https://arxiv.org/html/2607.20429#bib.bib25)];以及交互架构,从单次 API 调用到多轮提示再到多智能体讨论[15 (https://arxiv.org/html/2607.20429#bib.bib15),37 (https://arxiv.org/html/2607.20429#bib.bib37),8 (https://arxiv.org/html/2607.20429#bib.bib8)]。在实际中,连续的产品迭代倾向于同时沿着两个轴升级,引入更丰富的角色以及更复杂的交互方案。这种对角线式的共同进化使得难以隔离哪个因素对观察到的多样性增益负责。 我们的实验设计旨在分解这条对角线。我们将这两个轴建模为独立维度,并构建一个析因网格(图1 (https://arxiv.org/html/2607.20429#S1.F1))。在这个网格内,垂直比较保持架构恒定同时变化角色深度,隔离输入条件化的效果。水平比较保持角色恒定同时变化架构,隔离交互结构的效果。除了主网格,我们还评估四种低成本技巧作为额外的基线条件。 #### 输入条件化。 该轴控制模型接收的输入条件化,通过五个日益详细的角色深度级别进行操作化: 无。模型只接收默认的系统提示(“你是一个有用的助手”),没有身份信息。 角色。一句简单的句子指定一个职业,例如,“你是一名小学教师”。 基础。在角色之上添加核心人口统计属性:姓名、年龄、种族、性别、职业和位置。 中级。进一步包含教育、收入、婚姻状况、宗教信仰和政治倾向,使总描述达到约 60 个词。 专业。一个大约 150 词的传记叙述补充了结构化档案,涵盖生活经历、价值观、日常生活和个人关切,使模型能够完全融入指定的角色。 四个带有角色的级别(角色到专业)描述了同一组 20 个个体,覆盖了足够的人口统计变异并使用合理的描述[18 (https://arxiv.org/html/2607.20429#bib.bib18),6 (https://arxiv.org/html/2607.20429#bib.bib6)];完整列表见附录 B (https://arxiv.org/html/2607.20429#A2)。 #### 交互架构。 该轴控制交互结构,包含三个条件: 单次调用。每个角色通过单次 API 调用对每个问题生成一个独立响应。模型只看到系统提示和问题,每个问题产生 20 个响应。 多轮自我提示。类似深度访谈:每个角色参与三轮对话,其中模型首先回答问题,然后收到一个中立的后续提示(例如,“关于这个话题你还有什么其他想法?”),每轮都可以访问完整的对话历史。每个问题产生 60 个响应(20 个角色×\\times3 轮)。 多智能体讨论。类似焦点小组:5 个最大化人口统计多样性的角色参与一个 3 轮的小组对话。在第一轮中,每个智能体独立回应;在后续轮次中,每个智能体在贡献前看到完整的讨论历史,每个问题产生 15 个响应。讨论提示是中立的指令;我们特意避免要求智能体寻求分歧。辩论或角色冲突配置是正交的设计选择,不在本研究中涵盖。 这三种架构产生不同数量的响应(20、60 和 15);第 3 节 (https://arxiv.org/html/2607.20429#S3) 描述了我们如何通过指标选择和稀疏化确保公平比较。多智能体讨论中的小组规模固定为 5,符合针对复杂话题的小型焦点小组建议[33 (https://arxiv.org/html/2607.20429#bib.bib33),56 (https://arxiv.org/html/2607.20429#bib.bib56)],并且避免二次上下文增长。所有水平比较(相同角色深度,不同架构)使用匹配的 5 人子集;完整的 20 人条件用于角色深度的垂直比较。 #### 低成本技巧。 除了主网格,我们还在单次调用×\\times无基线条件下评估了四种替代策略。这些代表实践者在投入更重工程之前可能尝试的低成本干预。 增强提示。在系统提示后附加一个鼓励多样性的指令,指示模型考虑多元观点。 高温。将采样温度从默认的 0.7 提高到 1.0。 人口统计提示。在系统提示中插入人口统计关键词(年龄、性别、种族、职业、教育水平、收入水平和政治倾向),测试仅提及这些维度是否就能激活更广阔的观点空间,而无需提供任何实际角色。 特质分配。每次调用时为模型分配五个人格描述之一(例如,创造性和自发性、分析性和谨慎性),每个描述重复四次以产生 20 个响应。 #### 评估范围。 任务。我们从 WildChat[68 (https://arxiv.org/html/2607.20429#bib.bib68)] 的真实用户查询中抽取 100 个开放式问题。遵循 Röttger 等人 [54 (https://arxiv.org/html/2607.20429#bib.bib54)],我们选择那些允许多种合理立场并能自然引出价值判断的问题。生成的集合涵盖了容易产生意见分歧的领域,包括 AI 伦理、社会规范、宗教与文化价值观、性别政治和经济体系。真实的用户查询确保了相对于研究者构建提示的生态效度。带有分类的完整列表见附录 A (https://arxiv.org/html/2607.20429#A1)。 模型与生成参数。我们评估来自 7 个提供商的 7 个聊天模型(包含版本和端点的完整列表见附录 D (https://arxiv.org/html/2607.20429#A4), 表 3 (https://arxiv.org/html/2607.20429#A4.T3))。这些模型在训练流程、架构和对齐程序上有所不同,降低了我们的发现是任何单一提供商人造产物的可能性。所有条件共享一组统一的生成参数:温度 0.7,top-p 1.0,最大输出长度 4096 个 token,无频率或存在惩罚。唯一的例外是高温条件,其温度提高到 1.0。 ## 3 测量观点多样性 我们的评估流程通过三个阶段将原始 LLM 响应转化为可比较的多样性测量:观点提取、嵌入和指标计算(图2 (https://arxiv.org/html/2607.20429#S3.F2))。 参见图注 图 2:评估流程。每个 LLM 响应经过观点提取以隔离原子观点陈述,然后使用 text-embedding-3-small 将其嵌入到共享向量空间中。多样性在两个层次上量化:α\\alpha\-多样性衡量条件内离散度(平均成对距离、聚类数量、Vendi 分数),β\\beta\-多样性衡量条件间互补性(β\\beta\-Vendi 分数、独特聚类比率)。 观点提取。来自三种架构的原始响应在格式上差异很大:单次调用产生独立的段落,多轮调用产生

相似文章

大规模人口统计提示:更多属性如何损害LLM与人类的一致性

arXiv cs.CL

本文研究了在提示中添加人口统计属性如何影响LLM与人类在不同任务中的一致性,发现少数高信号属性能够提升对齐,但过度指定会降低对齐效果。研究使用五个开源LLM和神经元探测,表明属性信号质量和连贯性比数量更重要。

LLMs 会减少人们的极化吗?

Reddit r/singularity

关于广泛使用 LLMs(与维基百科类似,而非引发愤怒的社交媒体算法)是否会减少社会极化的推测性讨论。