标签
本文应用文化共识理论,利用世界价值观调查数据,分析大语言模型在单文化与多文化环境中与文化规范的对齐情况,表明模型要么未能形成连贯的共识,要么过度规范化共识,并为评估真实人类多样性与算法同质化提供了可操作的诊断方法。
本文使用世界价值观调查(World Values Survey)测试不同的提示框架(个性化、角色扮演、第三人称预测)在从大语言模型中获取文化价值观时是否可互换。结果显示,提示框架显著影响模型响应和测量的文化对齐程度,其中第三人称预测在方向性对齐上表现最强。
本文提出一个框架,利用基于情景的行为困境和激活引导来探测和引导大语言模型中的潜在文化价值观,应用于三个模型和四种文化,发现可引导性差异以及文化维度之间的潜在纠缠。
本文定义了文化多样性作为多代理系统的一个新评估维度,通过测量对世界价值观调查响应的成对差异。实验表明,当前模型缺乏人类社会的价值多样性,混合骨干可以提高对齐和多样性,但交互会减少多样性。
本文提出参数化社会身份注入框架(Parametric Social Identity Injection, PSII),该框架将人口统计属性的参数化表示注入到大语言模型的隐藏状态中,以提升公众舆论模拟的多样性。在世界价值观调查上的实验表明,与基于提示的方法相比,该方法能降低KL散度并增强多样性。
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。