CCBENCH:通过隐式信号规范评估LLM文化能力(基于健康查询)

arXiv cs.CL 论文

摘要

介绍CCBench,一个通过健康查询和使用跨六种文化的角色评估LLM文化能力的框架,发现即使是最佳模型也仅有20-30%的回答具有文化适切性。

arXiv:2607.05405v1 公告类型:cross 摘要:为了与用户公平互动且不产生刻板印象,AI模型必须展现文化能力,即推断并适应用户隐式信号所传递的文化价值观的能力,而非依赖静态的人口统计特征。我们引入CCBENCH,一个评估大语言模型(LLMs)文化能力的框架,将文化视为一个规范遵循状态的连续体,而非二元的文化归属状态。作为健康领域的案例研究,我们创建了CCBENCH-Health,包含60个理论驱动的角色,这些角色在六种文化中表现出不同的规范遵循状态,每个角色参与18个现实对话。每个角色通过从真实用户论坛中提取的52个真实医疗问题进行评估,共产生3,120次独特交互。对五个领先模型的基准测试表明,即使是最佳模型,其文化适切回答也仅占20-30%。当明确提示模型关注对话历史中的文化相关线索(CoT)时,性能平均仅提升3-5%。我们发现,当角色回避文化规范而非遵循规范时,模型表现最佳,这揭示了一种持续的不对称性,表明模型更倾向于与其内置偏见对齐而非适应文化线索。这一点在阿富汗情境中尤为明显(平均:8.8%),文化线索很少能产生合适的健康建议。最后,我们发现模型有时更容易适应隐性的文化对话风格,而非明确陈述的文化实践,尽管这因文化而异。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:43

# 通过隐式信号规范评估LLM文化能力:基于健康查询  
来源:https://arxiv.org/html/2607.05405  
Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab & Maarten Sap  
卡内基梅隆大学,匹兹堡,PA 15213,美国  
\{vvaradar, ayerukola, mdiab, msap2\}@andrew.cmu.edu  

###### 摘要  
为了与用户公平互动而不带刻板印象,AI模型必须展现文化能力,即推断并适应用户隐式信号传递的文化价值观的能力,而非依赖静态人口特征。我们提出CCBench,一个用于评估大型语言模型(LLM)文化能力的框架,将文化视为规范遵循状态的连续体,而非二元的文化归属状态。以健康为案例研究,我们创建了CCBench-Health,包含60个理论驱动的角色,这些角色在六种文化中表现出不同的规范遵循状态,每个角色参与18个逼真的对话。每个角色通过来自真实用户论坛的52个真实医疗问题进行评估,共产生3,120次独特交互。对五个领先模型的基准测试显示,即使表现最好的模型,其文化适宜性响应也仅有20-30%的时间达标。当明确提示模型关注对话历史中文化相关的线索(CoT)时,平均性能仅小幅提升3-5%。我们发现,当角色回避文化规范而非遵循时,模型表现最佳,这揭示了一种持续的偏差,表明模型更倾向于与内置偏见对齐而非适应文化线索。在阿富汗语境中尤为明显(平均:8.8%),文化线索很少产生恰当的健康建议。最后,我们发现模型有时更容易适应隐式的、文化的对话风格,而非明确陈述的文化实践,尽管这在不同文化间存在差异。  

## 1 引言  
大型语言模型(LLM)如今是全球信息中介,与多样化的全球用户群体互动;然而,它们常常默认采用“WEIRD”(西方、受教育、工业化、富裕、民主)价值体系,导致持续的文化偏见(Ryan等,2024;Jiang等,2024;Mire等,2025)。为弥补这一差距,我们借鉴文化能力概念——该概念最初在医疗保健领域发展,用以描述从业者为具有不同价值观和信念的患者提供有效护理的能力(Cross, 2013;Aleem等,2024)。在健康等高风险领域,内容和沟通风格会直接影响用户参与度,模型无法适应用户的文化期望可能导致信任和安全性的根本侵蚀(Schmutz等,2024;Orrall和Rekito,2025)。  

在AI中实现这种能力的一个重大挑战是,文化归属和规范遵循在自然互动中很少被明确表达。用户很少直接声明其传统或信仰体系;相反,他们通过隐式叙事、沟通偏好和社会线索来传递其背景。随着LLM日益个性化并依赖其进行高风险决策(Sun和Zhou,2023;Cheung等,2025),它们必须发展对识别这些微妙信号的敏感性。然而,当前的基准测试大多将文化身份视为一个二元属性——将用户归类为属于某种文化或不属于(Chiu等,2025;Li等,2024a)。这种简化方法忽略了真实人类身份中显著的组内变异和流动性。一个假设来自特定背景的所有用户都刻板地遵循传统规范的模型,不仅会冒错位风险,还会加剧有害的刻板印象(Baumert等,2024;Khan等,2025)。  

我们提出CCBench,一个旨在评估LLM文化能力的框架。我们的框架将文化身份操作化为通过模拟对话历史隐式揭示的规范遵循状态的连续体。通过向模型呈现那些对特定规范的遵循通过先前交互隐式信号的角色,我们可以测试模型是否正确推断用户在文化参与谱系中的位置,并相应调整其回应。这种从规定性测试到对话揭示的转变,允许对模型如何处理人类价值观的流动性和多重性进行更严格的评估(Hu等,2025)。  

我们以CCBench-Health实例化该框架,这是一个专注于评估LLM对健康相关问题生成文化能力响应能力的基准。医疗保健是该框架的关键压力测试,因为临床沟通中的文化对齐不仅是礼仪问题,更是健康结果的决定因素(Baik等,2025)。我们的基准基于Mosaica资源,该资源提供了关于健康身份多个维度的理论基础,包括家庭决策、饮食规范和性别实践。我们使用一个流程将这些值组合到52个源自真实健康论坛的高信号健康查询中,涵盖六种不同文化(阿富汗、缅甸、中文、毛利、尼泊尔和越南)的12个分层健康主题。  

我们的实验包括对五个领先LLM的系统评估,以评估它们在这些高风险、隐式情境中的表现。结果揭示了在基准测试中适应隐式规范揭示的普遍缺陷,但存在显著不对称:当角色偏好回避特定文化规范时,模型表现显著优于偏好遵循时。这种差异表明,模型中固化的西方默认值本质上构成了采纳非西方文化规范的内在阻力;因此,当任务与其现有的偏见一致时,模型显得更有能力。真正的文化能力——主动将对话与先前陈述的文化价值观对齐——仍然是一个深刻的挑战。即使明确提示文化规范遵循状态,模型也无法始终适应它们。在阿富汗语境中,其表现进一步下降(平均文化能力得分:0.088),模型难以将直接的文化线索转化为恰当的健康建议。  

## 2 CCBench  
文化能力基准(CCBench)是一个领域无关的框架,旨在评估LLM的隐式文化能力。与依赖明确自我认同(例如,“作为一个来自文化XX的人...”)的传统基准不同,CCBench衡量模型通过对话历史中嵌入的行为线索推断并遵循潜在文化规范的能力。  

##### 3.1 角色档案与规范遵循状态  
CCBench框架利用文化身份的层级表示,区分抽象价值观和操作化这些价值观的规范(例如,在阿富汗语境中,文化规范“此人可能犹豫提问”与两个阿富汗文化价值观相关:1. 尊重权威与等级,2. 礼貌与和谐)。虽然我们的框架可以用来自实证价值观调查或文化数据库的现有角色档案进行初始化,但它设计为自给自足:在没有此类数据时,我们从零开始综合基于价值观的角色。这种灵活性确保基准即使在数据稀缺的文化语境中也能部署,同时保持价值-规范层级结构中的理论基础。  

令 \( \mathcal{V} = \{v_1, v_2, \dots, v_m\} \) 为一组核心文化价值观,\( \mathcal{N} = \{N_1, N_2, \dots, N_l\} \) 为一组行为规范。每个规范 \( N_i \) 映射到一个非空的价值子集 \( \mathcal{V}_{N_i} \subseteq \mathcal{V} \),该子集支配该规范。为解释文化内多样性,我们生成合成角色 \( P_k \),由其对这些基础价值观的特定认同定义。  

##### 价值遵循  
对于每个文化情境角色 \( P_k \),我们定义一个二元价值遵循函数:  
\[ A_k(v_j) \in \{-1, 1\} \quad (1) \]  
其中 \( +1 \) 表示角色认同该文化价值观,\( -1 \) 表示不认同。该二元分配反映了个体对文化价值观的基本个人立场。  

##### 规范推导  
虽然价值观是二元的,但由此产生的行为规范可能基于多个价值观的交互表现出遵循的光谱。我们通过计算角色 \( P_k \) 对特定规范 \( N_i \) 的遵循度为其关联价值观遵循分数的平均值:  
\[ \mu_k(N_i) = \frac{1}{|\mathcal{V}_{N_i}|} \sum_{v \in \mathcal{V}_{N_i}} A_k(v) \quad (2) \]  
最终规范遵循函数 \( C_k(N_i) \) 随后被分类为表示角色行为取向的三元状态:  
\[ C_k(N_i) = \begin{cases} 
+1 & \text{if } \mu(N_i) > 0 \quad \text{(Follow)} \\
-1 & \text{if } \mu(N_i) < 0 \quad \text{(Avoid)} \\
0 & \text{if } \mu(N_i) = 0 \quad \text{(Neutral)}
\end{cases} \quad (3) \]  
这允许细微的角色,可能遵循某些规范,同时对其他规范保持中立或回避,这取决于其特定价值集如何冲突或对齐。通过对 \( A_k \) 的唯一组合进行采样,框架系统地构建了多样化的文化代理谱系。  

##### 3.2 基于对话历史的行为锚定  
为评估隐式能力,角色的文化对齐必须保持潜在。CCBench 利用行为锚定阶段,在该阶段生成角色 \( P_k \) 与 AI 助手之间的多轮对话历史 \( H_k \)。该历史受到遵循函数 \( C_k \) 的约束,使得角色通过语言风格、社交礼仪和决策模式展示其价值观,而不明确说明其地理或文化背景。这种范式确保测试模型只有在正确解读 \( H \) 中存在的微妙行为信号时才能成功。  

##### 3.3 基于检查表的评估  
评估遵循上下文-响应范式。给定锚定历史 \( H_k \) 和新领域特定查询 \( Q^i \),测试模型生成响应 \( R_k^i \)。为客观评分 \( R_k^i \),我们构建一个从角色规范遵循函数 \( C_k(N_i) \) 派生的规范特定检查表 \( \mathcal{L} \)。对于每个 \( C_k \neq 0 \),一个 LLM 生成该行为应如何在响应中被满足的具体建议。由强评估 LLM 确定的满足检查项的比例用于计算文化能力指标。  

(图2说明:CCBench-Health基准的构建遵循多阶段流程,包括理论基础的来源、角色模拟和严格过滤。)  

## 3 CCBench-Health 基准创建  
CCBench-Health 基准旨在通过评估 LLM 在健康相关情境中对隐式文化规范的反应能力来衡量其文化能力。该基准的构建遵循多阶段流程,包括理论基础的医疗文化报告来源、角色模拟和严格过滤。  

##### 规范来源与价值识别  
该方法的基础阶段涉及策划一个全面的健康相关文化规范与价值观列表,以作为模型评估的真实依据。这些内容基于 Mosaica 的文化健康档案(Mosaica, [链接](https://arxiv.org/html/2607.05405#bib.bib45)),以确保现实性以及临床和文化的准确性。Mosaica 是一个跨文化与宗教见解的知识库,由文化专家经过数月与社区访谈和互动整理而成。健康档案提供了跨多个健康身份维度的资源:医疗方法、沟通、健康挑战、饮食与营养、家庭、女性以及临终关怀。  

| 文化 | 价值观总数 | 规范总数 | 隐式或沟通规范 | 基于实践的规范 | 平均角色层面遵循 | 遵循 | 回避 | 中立 |
|------|------------|----------|----------------|----------------|------------------|------|------|------|
| 阿富汗 | 9 | 13 | 5 | 8 | 3.2 | 3.6 | 6.2 |
| 缅甸 | 18 | 15 | 8 | 7 | 3.8 | 3.8 | 7.4 |
| 中文 | 8 | 20 | 6 | 14 | 7.8 | 7.9 | 4.3 |
| 毛利 | 10 | 19 | 8 | 11 | 4.7 | 4.3 | 10.0 |
| 尼泊尔 | 9 | 13 | 4 | 9 | 3.6 | 4.8 | 4.6 |
| 越南 | 10 | 15 | 5 | 10 | 7.0 | 3.9 | 4.1 |

表1:每种文化提取的规范与价值观,以及角色层面规范遵循状态的统计数据。  

| 文化 | 会话规范遵循 | 显式揭示 |
|------|--------------|----------|
| 阿富汗 | 0.93 | 0.00 |
| 缅甸 | 0.93 | 0.00 |
| 中文 | 0.95 | 0.00 |
| 毛利 | 0.90 | 0.00 |
| 尼泊尔 | 0.98 | 0.00 |
| 越南 | 0.99 | 0.00 |
| 整体 | 0.947 | 0.000 |

表2:背景对话过滤与遵循验证  

为操作化这些数据,我们使用 Gemini-3.5-Pro 将 Mosaica 报告提炼为结构化的规范-价值对。这些对通过描述角色行为(例如,“此人可能犹豫信任医生...”)以及相应的健康相关文化价值观来构建。我们手动验证了所有规范-价值对,以确保模型没有产生幻觉的价值观和规范。表1(S3.T1)显示了每个文化档案推导出的规范与价值观数量。规范与价值观的完整列表见附录 A.1(SA1.SS1)。  

##### 角色模拟与规范映射  
为开发多样化的现实测试代理,框架采用了随机角色创建方法(§2)。对于每个文化价值观,一个角色被随机分配一个二元遵循状态:遵循(+1)或不遵循(-1)。这反映了文化内多样性,因为个体并非统一认同所有传统价值观;通过对每种文化采样10个独特的遵循组合,基准避免了单一的群体身份假设。由于每个规范映射到一个或多个价值观,最终的规范遵循状态是其关联价值分数的平均值:正平均值产生“遵循”,负平均值产生“回避”,零产生“中立”。提取的规范与价值观详见表1(S3.T1)。  

##### 背景历史创建  
在为每个角色分配其文化规范遵循状态后,我们生成详细的背景历史(图F5–F7),以将身份锚定在一致且有文化依据的叙事中。为近似真实交互,对话通过种子查询启动,而非直接从规范模拟。我们过滤了 WildChat-1M(Zhao等,2024),...

相似文章

LLMs 能推断文化背景但回应时未能应用

arXiv cs.CL

本文介绍了 CAPRI,一个用于评估 LLMs 是否能够从对话线索中推断用户文化背景并相应调整回应(例如使用适当的计量单位)的数据集。实验表明,LLMs 能够推断文化背景,但除非明确提示,否则常常未能应用这一信息。

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。