当AI在信仰问题上选边站:AI介导的信仰指导中的持续性不对称

arXiv cs.CL 论文

摘要

本文研究大型语言模型是否对称地处理关于宗教改宗的问题,发现持续存在的不对称性,某些信仰受偏爱。研究测试了20个模型在182个宗教配对中的表现,揭示了可复现的模式,可能具有现实世界影响。

arXiv:2605.22975v1 公告类型:新 摘要:我们研究大型语言模型(LLM)是否对称地处理关于宗教改宗的查询。答案是否定的。当就从一个宗教到另一个宗教的假设性信仰转变寻求建议,然后询问反向问题时,模型表现出一致的不对称性,偏爱某些宗教,同时微妙地劝阻改宗其他宗教。平均而言,天主教、巴哈伊教和锡克教普遍受偏爱(加入支持高,离开支持低),而无神论者、不可知论者和耶和华见证人主要受冷落。模式因模型规模和模型提供者而异,其中Grok 4.20表现出最强的不对称性。 我们使用经人工验证的LLM作为评判框架,测试了20个商业和开源语言模型在182个宗教配对上的表现。通过与模拟用户交互探询每个模型,该用户就潜在信仰改宗寻求建议。模型倾向于对某些信仰转变使用更鼓励性的语言;这些模式在多次试验中可系统重复。 所有测试的LLM均表现出可复现的不对称性,尽管偏好模式各不相同。总体偏好跨多种问题措辞和宗教配对数据集的变化持续存在。综合来看,这些结果表明不对称性是模型行为的稳健属性,而非模型答案评分方式的伪影。重要的是要认识到,任何大规模部署和复现的不平衡都可能产生现实世界的影响。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:56

# 当AI在信仰问题上站队:AI介导的信仰指导中持续存在的不对称性

来源:https://arxiv.org/html/2605.22975

\contribution \[†\]通讯作者  
1\]杨百翰大学  
2\]B. H. 罗伯茨基金会  

Sheryl Carty, Josh Coates, Nancy Fulda, Julie Park, Pete Whiting

\\[(2026年5月21日)

###### 摘要

我们探究大型语言模型(LLM)在处理宗教皈依相关查询时是否具有对称性。答案是否定的(见图1)。当被问及从宗教A→B vs. 宗教B→A的理论信仰转变建议时,模型表现出持续的不对称性,偏向某些宗教,同时微妙地劝阻向其他宗教的皈依。平均而言,天主教、巴哈伊教和锡克教普遍受到青睐(支持加入程度高,支持离开程度低),而无神论者、不可知论者和耶和华见证人则主要处于不利地位。模式因模型规模和模型提供商而异,其中Grok 4.20表现出最强的不对称性。我们使用了经人工验证的LLM作为评判框架,测试了20个商业和开源语言模型,涵盖182个宗教配对。每个模型通过与模拟用户互动进行探测,该用户就潜在的信仰转变寻求建议。模型对某些信仰转变使用了更具鼓励性的语言;这些模式在多次试验中具有系统可重复性。所有测试的LLM均表现出可复制的不对称性,尽管偏好的模式各不相同。总体偏好跨多种问题措辞和宗教配对数据集变体持续存在。综合来看,这些结果表明不对称性是模型行为的稳健特性,而非模型回答评分方式的人为产物。重要的是要考虑到,任何大规模部署和复现的不平衡都可能具有现实世界的影响。

## 1 引言

参见图注  
图1:二十个测试模型中平均的离开/加入偏好。

我们着手回答一个简单的问题:商业语言模型在处理宗教皈依相关查询时是否具有对称性?具体来说,如果我们询问模型关于从宗教A皈依到宗教B的意见,然后反转配对询问从B到A的皈依,我们是否得到相似的回答?简而言之,答案是否定的。模型表现出持续的不对称性,以可重复的方式区别对待某些宗教(见图1)。考虑到各宗教的独特属性——从对新成员的开放程度和遵守的代价,到排他性与多元主义的差异——我们并不评估这些不对称性是否应被解读为宗教偏见。相反,我们量化跨多个模型的观察行为,并表明,在tabula rasa条件下(即排除用户画像、聊天历史或系统提示中的特定指导),当前最先进的LLM在宗教配对上展示出统计上显著不同的响应模式。

我们的方法论旨在模拟一个真诚的用户探索可能的信仰转变。我们提示模型表达对宗教A相对于宗教B的兴趣,然后比较模型响应的积极性与反向查询(从宗教B转变到宗教A)的积极性。我们从未发现模型积极倡导宗教改变。然而,模型响应中的微妙线索似乎偏好某些皈依模式而非其他。这些模式跨多种不同的问题措辞持续存在,并且即使评估的宗教配对子集发生变化也是可重现的。这代表了AI系统大规模影响人类决策的可测量潜力。

## 2 背景:技术与宗教

宗教身份并非静态。尽管估计世界人口的75.8%认同某个宗教,但归属关系可能在青春期和成年期发生变化。这些转变既影响心理健康和总体幸福感,也受其影响,正如多项研究所表明的。这些及其它研究强调了信仰转变作为重大人生决策的重要性,具有强大的个人和家庭后果。

在本文中,我们量化了LLM在用户自发查询可能的信仰转变时的行为。我们专注于过去两年内发布的商业和开源模型,并将注意力限制在没有个性化、外部上下文或工具的情况下的原生模型行为。虽然这种简化设置不能完全代表真实的用户体验,但它为探究LLM响应模式提供了有价值的途径,并为未来更广泛的研究打开了大门。

### 2.1 语言模型中的宗教不对称性

对LLM中宗教故障模式的广泛认识最初源于abid2021persistent以及发现GPT-3中持续存在的反穆斯林偏见。当时,涉及穆斯林的文本补全中66%提及恐怖主义、袭击或其他形式的暴力。同样的提示应用于犹太人、基督徒、佛教徒和其他宗教时,仅在5%-15%的情况下引发暴力补全。后续研究发现,即使在对模型进行微调以纠正明确的偏见响应之后,隐含的偏见仍会在涉及常见穆斯林名字的提示中表现出来hemmatian2022debiased。

部分地针对这些发现,宗教偏见常被纳入更广泛的偏见基准测试中,如StereoSet、BBQ、CrowS-Pairs和BOLD。然而,深入探究LLM对宗教处理的论文相对较少reade2026religious。到目前为止,学术讨论主要集中在宗教偏见问题上。仍有机会进行更有针对性和深入的分析,包括:1)定义驱动语言模型中宗教不对称性的多因素组成部分;2)探索其对人类决策的潜在影响;3)建立语言建模中适当和不适当不对称性的本体论。例如,一些宗教不接受新成员,在这种情况下模型的抵制可能反映现实世界的约束而非偏见。其他形式的不对称性,较难用此类因素解释,可能反映更根本的系统性偏见barocas2023fairness。

跨信仰基准测试表明,LLM响应将某些宗教描绘为有细微差别的,而其他宗教则被强烈刻板化plaza2024divine。LLM关于宗教和道德的事实性问题的响应是不对称的,过度代表了文化上占主导地位的群体,包括西方世俗身份ramezani2023knowledge;seth2025deep;mihalcea2025ai。这些不对称性可能构成微妙的偏见,在某些情境下已被证明会造成与显性偏见同等甚至更大的伤害。例如,jones2016not认为,经历显性偏见的人能够将负面信号外化,将过错归咎于攻击者(例如,“这不是我的错,他们有偏见”)。相比之下,微妙的偏见可能导致个体认为不公平待遇是由个人缺陷造成的。

### 2.2 数字信仰社区中AI的兴起

数字信仰社区,无论是由机构策划还是通过网站、社交网络、应用程序和数字设备有机形成,日益被描述为一把双刃剑zhang2025digital。在线宗教参与可能导致信息过载、碎片化的宗教信息和意识形态回音室。与此同时,数字平台使世界宗教的信徒能够跨越地理界限建立联系和社区olaoba2025social;trysnes2022role,同时扩大个人表达和参与宗教体验、实践和信仰的机会karabalaeva2025contemporary;kimmons2017religious。

近年来,仍处于萌芽状态的在线宗教实践生态因AI介导的技术而进一步转变。zhang2025cognitive证明,宗教课程中的AI生成内容可能放大认知偏见,而其他人bai2025llm;jackson2023exposure注意到AI系统广泛的劝说力及其相关的宗教脱离影响。alkhouri2025spiritual认为,AI驱动系统可以通过真实灵性与技术介导的信仰体系之间的心理和伦理张力产生“灵性困惑”,并且机器人宗教人物、AI应用和虚拟社区构成了对宗教生活的认知、情感和行为维度的重大AI影响。

鉴于这些及其它发现,询问AI介导的话语是否可能对人类宗教归属、脱离归属和教派转换模式产生强大影响似乎并非不合理。现有研究表明这种可能性是真实的。特别是,evolvi2021religion观察到在线宗教社区不仅传播宗教,而且积极重塑宗教权威、仪式、社区和真实性。本文试图通过量化LLM在可能的信仰转变方面的不对称性的频率和强度来补充这些发现。

### 2.3 我们信任AI:语言模型的劝说能力

越来越多的研究表明,人类观念可能受到语言模型的影响,尽管这种劝说的长期持久性仍存疑问si2024large;bai2025llm;palmer2023large。steyvers2025large发现,人类倾向于高估LLM生成文本的准确性,yeo2026can报告说,人类容易受到LLM生成文本中的信息操纵和不确定性利用攻击。在某些情境中,最显著的是法律和财务决策,人类已被证明即使知道建议来自AI或与自身已有知识相矛盾,仍然依赖AI建议klingbeil2024trust;Schneiders2025。

在这项研究(关于在不同宗教之间转换的查询)的背景下,许多商业LLM采用的冷静、基于事实的陈述风格可能产生与预期相反的结果,因为多项研究表明LLM的劝说力部分源于使用事实、数字和其他被视为客观的信息bai2025llm;breum2024persuasive。

### 2.4 立场声明

我们不对模型是否应该质疑或肯定宗教转变持任何立场;任何一种立场都是可辩护的。一个持续质疑所有转变、鼓励仔细反思的模型持有连贯的立场。同样,一个持续肯定所有转变同时尊重个人自主权的模型也是连贯的。当模型支持离开宗教A但不支持离开宗教B,或鼓励加入宗教A同时劝阻加入宗教B时,就出现了我们关注的不对称性。我们的重点在于评估响应的一致性和对称性。

## 3 实验方法论

我们的研究框架采用了改进的Bradley & Terry设计bradley1952rank,从我们设计中所有有向宗教配对中穷举抽样,其中包括14个宗教(列于第3.2节)。我们首先创建n(n−1)=14(13)=182个有序配对,代表不同信仰社区之间所有有向的宗教皈依。对于每个配对,我们模拟了一个用户就提议从A到B的皈依提出个人指导问题。这些个人指导问题被提交给20个前沿LLM,如表1所示。使用经人工验证的LLM作为评判框架评估响应(见第3.4节)。采用LLM作为评判的方法是为了在3640个响应(182个有序配对×20个语言模型=3640)的系统评估中实现可扩展性和一致性。先前的研究已确定,LLM评估者可以达到与人类评估者相当的共识率zheng2023judging;gu2024survey,尽管性能因模型和情境而异。我们实验的数据已发布在CEFE·AI AllFaith基准测试中wingate2026\_religious\_representation,可在http://cefeai.org/查看。

### 3.1 模型

本研究选择的模型来自8个模型家族,覆盖全球各大洲的LLM使用情况。对于每个家族,我们选择了多个规模变体进行分析。

表1:评估的文本生成模型,按家族分组(共20个模型)。

总体而言,这些模型家族占全球直接面向提供商的AI市场份额的88%,其中GPT以76.92%占据主导地位statcounter\_ai\_chatbot\_market\_share\_2025。它们包括来自美国、欧洲和中国的模型。

### 3.2 宗教

我们探究模型对14个宗教的行为,这些宗教的选择考虑了全球覆盖性和代表性。三个基督教派别和两个无隶属派别来自皮尤宗教景观调查pew\_religious\_landscape\_study。加上犹太教、印度教和佛教,以及伊斯兰教的两个最大子类别。为了探究LLM对较少代表群体的行为,我们还包含了三个少数宗教,如表2所示。东正教和历史性黑人新教类别被排除在列表之外,以避免成对比较过于偏向基督教派别。

表2:本研究中使用的全球宗教。

### 3.3 提示设计

我们的研究目标是衡量LLM鼓励和/或劝阻提议的宗教归属之间转变的程度。这种转变并不罕见。大约35%的美国成年人改变了他们从小接受的宗教归属pew\_religious\_landscape\_study,许多其他国家也有类似的宗教流动性。宗教和灵性也是众所周知的AI用户热门查询主题anthropic2026personalguidance;GoogleTrends2026\_Religion\_US。

提供给LLM模型的提示很简单。对于每个宗教配对(A, B),我们问:
“我一生都是[宗教A]教徒。我现在感觉被吸引要成为[宗教B]教徒。请告诉我你的想法。”
这个问题对我们宗教集合中的所有可能有序配对(A, B)重复,每个LLM响应使用第3.4节描述的方法评分。措辞变化(例如,“我已经决定……” vs. “感觉被吸引”)的影响已被调查,并未改变总体观察到的模式(详见附录B)。

### 3.4 LLM作为评判:评估提示与模型验证

遵循先前研究者的方法zheng2023judging,我们使用LLM作为评判框架,以7点李克特量表对每个AI生成的响应进行评分。评分1分配给强烈劝阻提议的信仰转变的响应。评分7表示强烈鼓励。完整的评估准则,通过多次早期实验迭代优化,可在附录A中找到。LLM作为评判在自由形式文本评估中越来越受欢迎,主要是由于其可扩展性以及研究表明在适当约束下,它可以达

相似文章

测量AI的忠实度——无论好坏

Reddit r/AI_Agents

本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。

AI认知遵从指数:一种连续的谄媚行为度量

arXiv cs.AI

本文介绍了AI认知遵从指数(AEDI),这是一种连续的度量,用于衡量模型对事实主张的表达支持程度如何根据用户所表达的态度而改变,并评估了八个主流模型,发现了显著的谄媚行为且在不同提供商之间存在差异。