BavGround:巴伐利亚地区文化接地与方言能力的基准

arXiv cs.CL 论文

摘要

介绍了BavGround,一个用于评估大语言模型在英语、德语和巴伐利亚语中的地区文化接地与方言能力的基准,发现模型在方言化和本地化的文化知识方面表现不佳。

arXiv:2608.12894v1 公告类型:新 摘要:大语言模型(LLM)的文化评估通常聚焦于高资源标准语言,使得地区文化和方言群体代表性不足。我们推出了BavGround,一个用于评估巴伐利亚地区文化接地和方言能力的基准,覆盖英语、德语和巴伐利亚语。BavGround包含每个语言8个文化领域的206道多项选择来源问题,共产生618个多平行实例,题目既涵盖广泛可获取的文化知识,也涵盖来自新闻、历史资料和专业文献的基于来源的地区知识。我们评估了十五个7B-10B开放权重指令微调模型和一个闭源模型作为参考。强大的多语言模型总体上表现最佳,但在巴伐利亚语题目和基于来源的问题上性能下降,表明对方言和本地化文化知识存在持续困难。我们进一步表明,结论在很大程度上取决于评估协议:原始答案字母评分、乱序字母评分、选项文本似然、生成答案解析和语义匹配会产生不同的绝对分数和排名,尤其是对于地区适应性模型。最后,对GENBA-10B检查点的探索性分析表明,持续预训练在提高答案内容似然性方面在不同领域间不均,而方言能力仍然相对薄弱。BavGround支持本地化、协议感知的LLM文化表征评估。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:27

# 面向巴伐利亚语地区文化锚定与方言能力的基准

Michael Hoffmann, Jan Fillies  
所属机构:斯坦福大学,美国加利福尼亚州斯坦福;柏林自由大学,德国  
Michael A. Hedderich  
所属机构:慕尼黑大学语言与信息处理中心;慕尼黑机器学习中心(MCML)  
Barbara Plank  
所属机构:慕尼黑大学语言与信息处理中心;慕尼黑机器学习中心(MCML)  
莱布尼茨超级计算中心(LRZ),加尔兴,德国  
同等贡献。  
通讯:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected])

###### 摘要

大型语言模型(LLM)的文化评估通常聚焦于高资源标准语言,导致地区文化和方言社区的代表性不足。我们推出了 **BavGround**,一个评估巴伐利亚语地区文化锚定和方言能力的基准,涵盖英语、德语和巴伐利亚语。BavGround 包含 206 道多选来源题,按每种语言分布在八个文化领域中,共形成 618 个多语言平行实例;题目既包括广泛可获取的文化知识,也包括来自新闻、历史文献和专业文献的来源锚定地区知识。我们评估了十五个 7B–10B 开放权重指令微调模型和一个封闭模型参考。强多语言模型整体表现最佳,但在巴伐利亚语题目和来源锚定问题上表现下降,表明模型在方言和本地化文化知识方面仍存在持续困难。我们进一步表明,结论高度依赖于评估协议:原始答案字母评分、打乱字母评分、选项文本似然、生成答案解析和语义匹配可能产生不同的绝对分数和排名,尤其是对地区适配模型。最后,对 GENBA-10B 检查点的探索性分析表明,持续预训练在不同领域间不均匀地提升了答案内容似然,而方言能力仍然相对薄弱。BavGround 支持对 LLM 中文化表征进行本地化、协议感知的评估。

## 1 引言

大型语言模型(LLM)越来越多地部署在日常场景中,引发了人们对其可靠性、公平性和社会影响的担忧(Bender et al. 2021 (https://arxiv.org/html/2608.12894#bib.bib3);Blodgett et al. 2020 (https://arxiv.org/html/2608.12894#bib.bib6))。因此,越来越多的研究开始评估 LLM 是否以可靠和公平的方式表征处于特定文化中的规范、价值观、语言实践和知识形式(Gallegos et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib10);Liu et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib20))。近年来,文化基准推动了多语言和跨文化评估的发展(Shi et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib33);Myung et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib25);Seveso et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib32);Zhao et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib36)),但许多工作仍将文化操作化为国家层面、宽泛地理区域或高资源标准语言。这使得地区性、方言性和少数族裔语言社区的代表性相对不足。

地区文化并非国家认同的简单缩小版:它们可能涉及独特的历史、制度、物质实践、语言形式和身份标识。已有研究强调,文化和语言评估应考虑社会语境,而不应将语言变体视为可互换的表层形式(Blodgett et al. 2020 (https://arxiv.org/html/2608.12894#bib.bib6);Hershcovich et al. 2022 (https://arxiv.org/html/2608.12894#bib.bib14))。近期研究表明,方言使用者可能因当前 LLM 而处于不利地位,包括德语方言场景(Bui et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib7))。这些关切促使我们在民族国家层面以下开展评估,尤其是针对与高资源标准语言密切相关的地区语言变体。

我们通过巴伐利亚语来研究这一问题。巴伐利亚语是一种地区语言变体,分布在德国南部、奥地利和意大利北部,使用人口约一千万(Rowley 2011 (https://arxiv.org/html/2608.12894#bib.bib30))。巴伐利亚语是一个有价值的测试案例,因为它兼具强烈的地区认同、显著的方言变异以及与标准德语的密切关系。我们推出了 **BavGround**,一个用于巴伐利亚地区文化锚定和方言能力评估的基准。BavGround 包含 206 道来源多选题,分布在八个主题类别中,并翻译为英语、德语和巴伐利亚语,共形成 618 个评估实例。所有德语和巴伐利亚语翻译均由一位母语合著者手工完成。该基准结合了广泛可访问的常识类问题与基于来源的地区问题,后者源自地区新闻、人类学专著和专业历史文献。

我们评估了十五个 7B–10B 指令微调开放权重模型,发现即使对强大的多语言系统而言,BavGround 仍具有挑战性:模型在巴伐利亚语和基于来源的地区问题上表现下降。我们进一步表明,研究结果对评估协议高度敏感。标准的 MCQA 字母评分可能将文化知识与答案标签先验、选项顺序和生成格式行为混为一谈,因此我们比较了打乱标签、选项文本、生成式、语义匹配和隐藏状态诊断等方法(Mizrahi et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib24);Wang et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib35);Dominguez-Olmedo et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib9))。作为探索性案例研究,我们还研究了训练动态,并跟踪了一个以巴伐利亚语为中心的模型 GENBA-10B-it(Hoffmann et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib16))在持续预训练检查点上的 BavGround 表现,发现不同领域、语言和协议之间的提升并不均衡。

本文的贡献包括:(1)**BavGround**,一个手工验证的巴伐利亚地区文化锚定和方言能力基准,涵盖英语、德语和巴伐利亚语;(2)对十五个 7B–10B 开放权重指令微调模型的评估,显示模型在巴伐利亚语和基于来源的地区问题上存在持续困难;(3)一项协议感知分析,表明单一协议的 MCQ 分数可能掩盖重要的模型行为。我们还额外提供了 GENBA-10B 检查点的探索性分析。

##### 工件可用性。

为支持透明度和可复现性,我们计划在论文接收后发布基准、评估代码、生成输出和交互式分析仪表板(附录 H (https://arxiv.org/html/2608.12894#A8))。在评审过程中,这些材料以匿名形式提供,地址为:https://anonymous.4open.science/r/BavGround-7C68/README.md。

## 2 相关工作

### 2.1 自然语言处理中的文化评估

NLP 中关于文化表征的研究迅速扩展,尤其是在多语言 LLM、公平性和社会性生成方面(Gallegos et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib10);Liu et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib20))。已有工作至少从两个互补视角研究文化。

第一条研究路径将文化概念化为共享的规范、价值观、信仰和社会化行为,评估模型输出是否与围绕道德、宗教、礼貌或社会互动的特定文化期望一致(Ma et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib22))。例如,Naous et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib26) 研究了宗教和社会语境中的文化情境续写,而更广泛的工作则考察语言模型如何复现文化相关的刻板印象(Abid et al. 2021 (https://arxiv.org/html/2608.12894#bib.bib1);Kirk et al. 2021 (https://arxiv.org/html/2608.12894#bib.bib17);Kumar et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib19))。

第二条研究路径将文化概念化为地理情境中的知识、制度、历史记忆和传说(Bhagat et al. 2026 (https://arxiv.org/html/2608.12894#bib.bib5);Rooein et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib29);Hedderich et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib13))。这一视角在基准构建中尤为常见,其中的文化能力通过事实性或情境性问答来操作化。近期基准评估了与特定国家或语言社区相关的知识,例如 ITALIC 中的意大利文化知识(Seveso et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib32))和 MakiEval 中的多语言文化意识(Zhao et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib36)),而更广泛的跨文化 NLP 工作则强调了在现有系统中表征多元社区的挑战(Hershcovich et al. 2022 (https://arxiv.org/html/2608.12894#bib.bib14))。

近期工作也质疑了文化 NLP 评估背后的理论假设。Zhou et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib38) 认为,当前许多研究依赖粗略的文化代理变量,尤其是民族国家边界,这些无法捕捉社区内部的大量差异,并提出 *本地化*(localization)比静态的国家类别更有用。这一批评对地区和少数族裔语言变体尤为相关,这些语言变体尽管具有独特的历史、制度和语言实践,但在现有基准中仍然相对代表性不足。BavGround 通过聚焦巴伐利亚语这一具有大量使用人口和强烈地区认同的地区语言变体,为该文献做出了贡献。

### 2.2 文化与多项选择基准的评估协议

现有文化评估工作不仅在研究何种文化形式方面存在差异,在如何衡量文化能力方面也不尽相同。常见方法包括多项选择问卷,模型在其中生成答案字母或对候选选项进行评分(Seveso et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib32);Zhao et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib36)),以及文化情境场景中的生成续写或自由形式回答。

近期工作日益表明,评估结果在很大程度上取决于方法论。提示措辞、答案顺序、解析策略和解码配置都可能显著影响测量到的性能(Mizrahi et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib24));在多语言环境中,仅改变提示语言就可能改变测量到的文化能力(Zhao et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib36))。更广泛地,Wang et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib35) 证明了在答案选择、拒绝行为和提示扰动中,首 token 概率排名与生成回答之间存在显著不匹配——这表明标准 MCQA 评分只捕捉了模型有效答案行为的一部分。相关工作也记录了 MCQ 评估中的选项顺序敏感性和答案标签偏差(Pezeshkpour and Hruschka 2024 (https://arxiv.org/html/2608.12894#bib.bib27);Zheng et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib37)),以及调查式 LLM 评估中的排序、标签、提示扰动和响应生成方法效应(Dominguez-Olmedo et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib9);Rupprecht et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib31);Ahnert et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib2))。总之,这些发现表明,基准分数可能部分反映的是诱导产物,而非潜在知识。

不同的评估方法也会在某些设置下探测不同的能力:基于概率的评分测量对候选答案的偏好;自由形式生成评估指令遵循和答案实现能力;语义匹配关注独立于格式的意义;表征层面分析则探测模型内部几何结构。因此,即使在同一个基准上,不同协议也可能产生不一致的排名。

我们的工作通过一个协议感知的评估框架来解决这一问题,该框架比较了基于概率的评分、答案顺序扰动、生成式评估、语义相似性匹配和隐藏状态对齐诊断。我们并非以此表明文化基准不可靠,而是说明关于文化能力的结论可能在很大程度上取决于评估方法。

### 2.3 持续预训练与文化表征

持续预训练(CPT)已成为一种广泛使用的策略,用于在不从头训练的情况下将预训练语言模型适配到新领域和语言(Gururangan et al. 2020 (https://arxiv.org/html/2608.12894#bib.bib12)),并且越来越多地被用于在保留已有能力的同时扩展语言覆盖范围(Choudhury et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib8);Koto et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib18))。

大多数已有工作通过聚合下游任务性能或领域专门化来评估 CPT,而较少关注文化锚定知识在训练过程中如何演化,尤其是对于地区性或方言性语言变体。文化评估通常也只分析最终检查点,将文化能力视为已发布模型的静态属性。

我们通过一项对 GENBA-10B(Hoffmann et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib16))(一个通过持续预训练开发的德英巴三语模型)的探索性纵向分析来扩展这一文献。我们不只评估最终检查点,而是考察不同形式的文化锚定知识如何在中间检查点上演化,以及在以巴伐利亚语为中心的适配过程中,各文化领域是否均匀提升。

表 1:来自 BavGround 的示例问题,每个类别分别展示一个通用(GEN)和一个来源型(GRD)问题。GEN 问题针对广泛可获取的文化知识;GRD 问题来源于地区新闻和专业专著,考查的知识不太可能出现在标准 LLM 预训练语料中。

## 3 BavGround 基准

### 3.1 数据集构建

BavGround 是一个用于评估巴伐利亚文化知识和文化偏差的多项选择基准。该基准包含 206 道来源题,分布在八个巴伐利亚文化和身份主题类别中,每个类别包含两种题型。在每个类别中,基准分为两种结构上不同的类型(子集)。第一种类型(GEN)包含广泛可获取的常识题,针对巴伐利亚文化中广为人知的方面。第二种类型包含来源型问题(GRD),来源于地区新闻、人类学专著和专业历史文献,针对不太可能频繁出现在标准 LLM 预训练语料中的特定文化知识。该基准同时涵盖文化的观念层面和物质层面。诸如“生活传统与习俗”和“巴伐利亚方言”等类别(待续?原文被截断)

Wait, the source ended at "Categories such as Living Traditions and Customs and Bavarian Dialect". We translate what's given. Continue maybe not. So end there.

Need include "Categories such as..." sentence: "该基准涵盖文化的观念层面和物质层面。诸如“活态传统与习俗”和“巴伐利亚方言”等类别" Actually "Living Traditions and Customs" should be "生活传统与习俗" or "活态传统与习俗". Let's use "活态传统与习俗". But sentence incomplete; translate as in source.

Let's update final accordingly. The source section 3.1 may continue but in provided content it's cut. We'll translate only provided content.

Need ensure all text present. Let's output final now.# 面向巴伐利亚语地区文化锚定与方言能力的基准

Michael Hoffmann, Jan Fillies  
所属机构:斯坦福大学,美国加利福尼亚州斯坦福;柏林自由大学,德国  
Michael A. Hedderich  
所属机构:慕尼黑大学语言与信息处理中心;慕尼黑机器学习中心(MCML)  
Barbara Plank  
所属机构:慕尼黑大学语言与信息处理中心;慕尼黑机器学习中心(MCML)  
莱布尼茨超级计算中心(LRZ),加尔兴,德国  
同等贡献。  
通讯:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected])

###### 摘要

大型语言模型(LLM)的文化评估通常聚焦于高资源标准语言,导致地区文化和方言社区的代表性不足。我们推出了 **BavGround**,一个评估巴伐利亚语地区文化锚定和方言能力的基准,涵盖英语、德语和巴伐利亚语。BavGround 包含 206 道多选来源题,按每种语言分布在八个文化领域中,共形成 618 个多语言平行实例;题目既包括广泛可获取的文化知识,也包括来自新闻、历史文献和专业文献的来源锚定地区知识。我们评估了十五个 7B–10B 开放权重指令微调模型和一个封闭模型参考。强多语言模型整体表现最佳,但在巴伐利亚语题目和来源锚定问题上表现下降,表明模型在方言和本地化文化知识方面仍存在持续困难。我们进一步表明,结论高度依赖于评估协议:原始答案字母评分、打乱字母评分、选项文本似然、生成答案解析和语义匹配可能产生不同的绝对分数和排名,尤其是对地区适配模型。最后,对 GENBA-10B 检查点的探索性分析表明,持续预训练在不同领域间不均匀地提升了答案内容似然,而方言能力仍然相对薄弱。BavGround 支持对 LLM 中文化表征进行本地化、协议感知的评估。

## 1 引言

大型语言模型(LLM)越来越多地部署在日常场景中,引发了人们对其可靠性、公平性和社会影响的担忧(Bender et al. 2021 (https://arxiv.org/html/2608.12894#bib.bib3);Blodgett et al. 2020 (https://arxiv.org/html/2608.12894#bib.bib6))。因此,越来越多的研究开始评估 LLM 是否以可靠和公平的方式表征处于特定文化中的规范、价值观、语言实践和知识形式(Gallegos et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib10);Liu et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib20))。近年来,文化基准推动了多语言和跨文化评估的发展(Shi et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib33);Myung et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib25);Seveso et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib32);Zhao et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib36)),但许多工作仍将文化操作化为国家层面、宽泛地理区域或高资源标准语言。这使得地区性、方言性和少数族裔语言社区的代表性相对不足。

地区文化并非国家认同的简单缩小版:它们可能涉及独特的历史、制度、物质实践、语言形式和身份标识。已有研究强调,文化和语言评估应考虑社会语境,而不应将语言变体视为可互换的表层形式(Blodgett et al. 2020 (https://arxiv.org/html/2608.12894#bib.bib6);Hershcovich et al. 2022 (https://arxiv.org/html/2608.12894#bib.bib14))。近期研究表明,方言使用者可能因当前 LLM 而处于不利地位,包括德语方言场景(Bui et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib7))。这些关切促使我们在民族国家层面以下开展评估,尤其是针对与高资源标准语言密切相关的地区语言变体。

我们通过巴伐利亚语来研究这一问题。巴伐利亚语是一种地区语言变体,分布在德国南部、奥地利和意大利北部,使用人口约一千万(Rowley 2011 (https://arxiv.org/html/2608.12894#bib.bib30))。巴伐利亚语是一个有价值的测试案例,因为它兼具强烈的地区认同、显著的方言变异以及与标准德语的密切关系。我们推出了 **BavGround**,一个用于巴伐利亚地区文化锚定和方言能力评估的基准。BavGround 包含 206 道来源多选题,分布在八个主题类别中,并翻译为英语、德语和巴伐利亚语,共形成 618 个评估实例。所有德语和巴伐利亚语翻译均由一位母语合著者手工完成。该基准结合了广泛可访问的常识类问题与基于来源的地区问题,后者源自地区新闻、人类学专著和专业历史文献。

我们评估了十五个 7B–10B 指令微调开放权重模型,发现即使对强大的多语言系统而言,BavGround 仍具有挑战性:模型在巴伐利亚语和基于来源的地区问题上表现下降。我们进一步表明,研究结果对评估协议高度敏感。标准的 MCQA 字母评分可能将文化知识与答案标签先验、选项顺序和生成格式行为混为一谈,因此我们比较了打乱标签、选项文本、生成式、语义匹配和隐藏状态诊断等方法(Mizrahi et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib24);Wang et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib35);Dominguez-Olmedo et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib9))。作为探索性案例研究,我们还研究了训练动态,并跟踪了一个以巴伐利亚语为中心的模型 GENBA-10B-it(Hoffmann et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib16))在持续预训练检查点上的 BavGround 表现,发现不同领域、语言和协议之间的提升并不均衡。

本文的贡献包括:(1)**BavGround**,一个手工验证的巴伐利亚地区文化锚定和方言能力基准,涵盖英语、德语和巴伐利亚语;(2)对十五个 7B–10B 开放权重指令微调模型的评估,显示模型在巴伐利亚语和基于来源的地区问题上存在持续困难;(3)一项协议感知分析,表明单一协议的 MCQ 分数可能掩盖重要的模型行为。我们还额外提供了 GENBA-10B 检查点的探索性分析。

##### 工件可用性。

为支持透明度和可复现性,我们计划在论文接收后发布基准、评估代码、生成输出和交互式分析仪表板(附录 H (https://arxiv.org/html/2608.12894#A8))。在评审过程中,这些材料以匿名形式提供,地址为:https://anonymous.4open.science/r/BavGround-7C68/README.md。

## 2 相关工作

### 2.1 自然语言处理中的文化评估

NLP 中关于文化表征的研究迅速扩展,尤其是在多语言 LLM、公平性和社会性生成方面(Gallegos et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib10);Liu et al. 2025 (https://arxiv.org/html/2608.12894#bib.bib20))。已有工作至少从两个互补视角研究文化。

第一条研究路径将文化概念化为共享的规范、价值观、信仰和社会化行为,评估模型输出是否与围绕道德、宗教、礼貌或社会互动的特定文化期望一致(Ma et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib22))。例如,Naous et al. 2024 (https://arxiv.org/html/2608.12894#bib.bib26) 研究了宗教和社会语境中的文化情境

相似文章