Pancasila-Dilemmas:基于潘查希拉的印尼人类价值困境对大语言模型的评估

arXiv cs.CL 论文

摘要

介绍了Pancasila-Dilemmas,这是一个包含1,834个问题的评估数据集,基于印尼价值观(潘查希拉)来衡量大语言模型与国家特定价值观的对齐程度。对50个大语言模型的评估显示,尤其在宗教和团结困境方面存在显著差距。

arXiv:2607.18066v1 公告类型:新 摘要:大语言模型(LLM)的价值对齐对于确保其响应符合人类意图和价值观偏好至关重要。然而,大多数价值对齐评估都聚焦于西方或普世价值观,而基于特定国家价值体系的评估仍然很少。在本文中,我们介绍了Pancasila-Dilemmas,这是一个包含1,834个问题的评估数据集,这些问题源自印尼新闻,并按潘查希拉的五个价值观进行分类:宗教、人道、团结、民主和社会公正。该数据集反映了印尼的日常生活,因此适合衡量部署于印尼的大语言模型的价值对齐程度。为确保评估更加严谨,我们选择了包含困境的场景。该数据集由母语者校对,并由五名不同的印尼公民作答。我们评估了50个闭源和开源大语言模型。结果显示,所有评估的LLM的概率匹配得分(PMS)均低于0.5,最大投票一致得分(MVAS)低于0.72。按各价值观比较,LLM在宗教和团结困境案例中表现最差。这凸显了在捕捉印尼价值观方面存在显著差距。该数据集公开于 https://github.com/tjunlp-lab/Pancasila-Dilemmas。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:46

# Pancasila-Dilemmas:基于潘查希拉的印尼人类价值困境下评估大型语言模型

来源:https://arxiv.org/html/2607.18066

Supryadi1, Irfan2, Julianti3, Darren Keanly Martin4, Jayvin Fernando5, Yuqi Ren1, Deyi Xiong111footnotemark:1 1天津大学计算机科学与技术学院TJUNLP实验室,中国 2Universitas Universal,印度尼西亚 3北京语言大学,中国北京 4天津大学人工智能学院,中国 5天津大学计算机科学与技术学院,中国 \{supryadi, ryq20, dyxiong\}@tju\.edu\.cn

###### 摘要

大型语言模型(LLMs)的价值对齐对于确保其响应符合人类意图和价值偏好至关重要。然而,大多数价值对齐评估都聚焦于西方或普世价值,而基于特定国家价值体系的评估仍然很少。在本文中,我们引入了Pancasila-Dilemmas,这是一个包含1834个问题的评估数据集,这些问题源自印尼新闻,并根据潘查希拉的5项价值进行分类:宗教、人道、团结、民主和社会公正。该数据集反映了印尼的日常生活,适用于衡量部署在印尼的LLMs的价值对齐程度。为确保评估更严格,我们选择了包含困境的场景。数据集由母语者校对,并由5位不同的印尼公民作答。我们在数据集上评估了50个闭源和开源LLMs。结果显示,所有被评估的LLMs的概率匹配得分(PMS)均低于0.5,最大投票一致得分(MVAS)低于0.72。按各项价值比较,LLMs在宗教和团结困境案例中表现最为挣扎。这凸显了在捕捉印尼价值方面存在显著差距。该数据集公开发布于https://github.com/tjunlp-lab/Pancasila-Dilemmas。

---

# Pancasila-Dilemmas:基于潘查希拉的印尼人类价值困境下评估大型语言模型

Supryadi1, Irfan2, Julianti3, Darren Keanly Martin4, Jayvin Fernando5, Yuqi Ren1††thanks:通讯作者, Deyi Xiong111footnotemark:11天津大学计算机科学与技术学院TJUNLP实验室,中国2Universitas Universal,印度尼西亚3北京语言大学,中国北京4天津大学人工智能学院,中国5天津大学计算机科学与技术学院,中国\{supryadi, ryq20, dyxiong\}@tju\.edu\.cn

## 1 引言

大型语言模型(LLMs)的对齐对于确保LLMs的输出反映人类偏好至关重要(Ouyang等人,2022)。通过微调(Wei等人,2022)或基于人类反馈的强化学习(RLHF)进行偏好优化(Rafailov等人,2023;Shao等人,2024),已取得了显著成果。虽然LLMs能够与一般人类偏好对齐,但当涉及特定国家的价值以及特定国家独有的地方问题时,仍存在问题,尤其是在印尼。

![参考说明](图1:Pancasila-Dilemmas数据集的一个示例(AI生成),展示了一个与人道价值相关的困境。给定场景和问题,任务是识别人类或LLMs将做出的决定。原文已翻译为英文以便阅读。结果突出了人类与LLMs之间的分歧。)
*图1:Pancasila-Dilemmas数据集的一个示例(AI生成),展示了一个与人道价值相关的困境。给定场景和问题,任务是识别人类或LLMs将做出的决定。原文已翻译为英文以便阅读。结果突出了人类与LLMs之间的分歧。*

潘查希拉(Pancasila)¹¹¹https://indonesia\.go\.id/profil/konstitusi 是印度尼西亚共和国的基本国家意识形态和原则(Aryani等人,2022;Mulia等人,2025)。它包含5项核心价值:宗教、人道、团结、民主和社会公正。潘查希拉不仅是一种政治意识形态,更是印尼社会的道德基础,为公共道德提供了一个独特且植根于文化的框架。

现有的价值对齐基准通常依赖于单一真实答案或多数投票一致,这过于简化了道德推理中的规范性复杂性(Lee等人,2024;Yu等人,2024)。现实世界的价值情境往往需要在相互冲突的困境之间进行权衡,而非做出客观正确的决定。

为解决这一问题,我们引入了Pancasila-Dilemmas,这是一个包含1834个多项选择困境问题的基准数据集,问题源自真实的印尼新闻,如图1所示。每个条目包含一个场景、一个问题以及四个答案选项,这些选项代表不同的行动偏好,而非客观正确的答案。我们通过识别涉及潘查希拉价值冲突的新闻文章,并使用LLMs生成基于该场景的问题-答案对来构建数据集。为捕捉人类判断的多样性,每个问题均由5位印尼本地标注员进行标注。

在评估中,我们比较了多种LLMs,涵盖闭源和开源模型、基础LLMs及指令调优版本。我们还选择了不同模型规模和模型家族的LLMs。评估的LLMs来自不同地区,包括西方、东亚、东南亚和印尼。我们使用概率匹配得分(PMS)和最大投票一致得分(MVAS)指标评估LLMs,其中PMS评估LLMs与人类偏好整体分布的匹配程度,MVAS评估LLMs是否成功选择了多数共识。

我们的结果表明,所有被评估的LLMs,包括最先进的(SOTA)LLMs,其PMS得分约为0.50,MVAS得分约为0.72。这表明当前的LLMs在处理这些复杂困境时仍存在困难。LLMs在独特的印尼宗教和团结困境中表现最差,并生成过度合作性的开放式回答,这凸显了当前印尼价值对齐方面的差距。

总而言之,我们的贡献如下:

- • 我们引入了Pancasila-Dilemmas,一个用于评估印尼困境的新型数据集。据我们所知,这是首个用于评估印尼价值对齐的主观多项选择基准。
- • 我们提出了一个使用PMS和MVAS指标的综合评估框架,评估了从开源到闭源LLMs的多种模型。
- • 我们的研究发现,所有LLMs的PMS得分约为0.50,MVAS得分约为0.72,这表明它们与印尼公众偏好存在显著偏差。我们还发现,与宗教和团结相关的困境是LLMs最难回答的问题。

## 2 相关工作

### 2.1 国家特定的道德与价值对齐

近期研究评估了LLMs在不同价值和人口群体中的对齐情况(Sorensen等人,2024;Kirk等人,2024;Jiang等人,2025;Xiang等人,2025;Zheng等人,2026),探讨了价值的可迁移性和表征(Xu等人,2024;Wyn等人,2024)。部分研究还探索了改善LLMs价值对齐的技术(Xu等人,2025;Zhu等人,2026)。在这些广泛见解的基础上,该领域已转向面向特定国家的评估,以捕捉更精细的文化差异。现有基准涵盖中国、美国、英国等国家(Ju等人,2025),以及针对韩国(Lee等人,2024)和中国价值(Yu等人,2024;Wu等人,2025)的专门数据集。受这种国家特定关注点的启发,我们研究了LLMs在印尼语境下的决策行为,使用日常生活困境来捕捉超出常见任务的价值冲突(Chiu等人,2025)。

![参考说明](图2:我们的Pancasila-Dilemmas数据构建与评估设置框架。)
*图2:我们的Pancasila-Dilemmas数据构建与评估设置框架。*

### 2.2 印尼LLM基准

印尼自然语言处理(NLP)已受到越来越多的关注(Aji等人,2022)。现有基准评估LLMs在本地知识(Koto等人,2023;Koto,2025)、本地毒性(Susanto等人,2025)以及本地文化推理(Wibowo等人,2024;Koto等人,2024)方面的表现。然而,尚无基准涉及印尼潘查希拉语境下的决策问题。与Lee等人(2024)不同,我们采用四选项困境问题。这是首个完全依赖主观人类价值偏好的非西方对齐研究。

### 2.3 潘查希拉作为印尼价值框架

潘查希拉是印尼的主要意识形态和原则。该术语源自梵文,可译为“五项原则”。潘查希拉不仅作为政治、政府和法律的基础,也作为印尼人在印尼生活时行为举止的指南。潘查希拉的五项价值为:(i) 信仰唯一神(宗教);(ii) 公正文明的人道(人道);(iii) 印度尼西亚的统一(团结);(iv) 以智慧为指导的民主(民主);(v) 为全体人民实现社会公正(社会公正)。这些价值是印尼人民日常生活的基石(Antari and Liska, 2020;Ardhani等人,2022)。在自然语言处理(NLP)研究中,Azmi等人(2025)构建了一个基准,基于印尼文化和规范(包括潘查希拉)评估LLM的安全性。具体而言,他们评估了对潘查希拉价值的误解如何被用于证明有害行为的合理性。在本研究中,我们采用潘查希拉价值作为印尼困境数据集的分类体系,因为潘查希拉真实地代表了印尼的价值身份。

## 3 Pancasila-Dilemmas 数据集

在本节中,我们提供了Pancasila-Dilemmas数据集的详细构建过程,从困境场景的爬取开始(3.1)。然后,我们解释如何基于困境场景生成问题(3.2),最后介绍质量保证(3.3)和数据集的最终确定(3.4)。我们的框架示意图如图2所示。

*表1:按价值分类的Pancasila-Dilemmas数据集统计信息。*

### 3.1 困境场景爬取

为构建困境数据集,必须捕捉印尼的真实生活场景。因此,我们依赖本地报纸,因为它们经常报道社会冲突。我们从Kompas²²²https://www\.kompas\.com/(印尼主要新闻门户网站)获取数据。鉴于文章数量庞大,我们将构建过程分为三步:标题爬取与去重、困境标题分类、新闻信息爬取。

#### 3.1.1 标题爬取与去重

每年发布的新闻数量巨大,涵盖体育、经济、法律等多个领域。为识别与日常生活困境相关的新闻,我们分析标题,因为标题提供了内容的简洁摘要。我们爬取了2024年(1月1日至12月31日)发布的新闻标题,共收集到279,362个标题。为减少冗余,我们应用MinHash去重,阈值为0.2。该阈值的选择旨在平衡数据集规模与多样性,确保最终语料库既不过于稀疏也不过于庞大,最终得到9,155个标题。

#### 3.1.2 困境标题分类

接下来,我们判断新闻是否包含价值困境。我们使用GPT-4o根据是否包含困境场景对标题进行分类。我们首先手动标注了300个随机选取的标题,分为困境和非困境两类。从这组数据中,我们通过从每个类别中随机选取两个示例构建了一个4-shot提示。分类后,有2,075篇新闻文章被识别为包含困境场景。

#### 3.1.3 新闻信息爬取

基于识别出的困境标题,我们进一步爬取相应的新闻文章。只有当标题被识别为困境时,我们才爬取信息。为确保数据质量,我们仅提取文章主体部分,过滤掉广告和不相关内容。我们还应用基于正则表达式的后处理,移除特定站点的推广页脚。

### 3.2 问题生成

我们使用GPT-4o从识别出的困境新闻中生成多项选择问题,这种格式便于标准化评估和多样化选择。每个数据集条目包含一个场景、一个问题以及四个不同的答案。生成后,我们使用GPT-4o通过上下文学习(采用随机5-shot方法,从15个人工标注示例中选取,每个价值3个示例)为每个条目标注对应的潘查希拉价值。

为确保对人类决策的全面覆盖,我们使用Thomas-Kilmann冲突模式工具(TKI)(Kilmann and Thomas, 1977)对多项选择选项进行映射,该工具根据果断性和合作性对冲突反应进行分类。我们使用GPT-4o-Mini将每个选项标记为5种模式之一:竞争(高果断性,低合作性——执行严格规则)、迁就(低果断性,高合作性——优先考虑共情)、回避(低果断性,低合作性——回避冲突)、协作(高果断性,高合作性——寻求双赢解决方案)和妥协(两者中等——寻找中间解决方案)。在92.3%的问题中,四个选项对应完全唯一的模式。其余不足8%的问题存在轻微重叠,但由于行动方式细微差异,困境仍然具有挑战性。

### 3.3 质量保证

为确保数据集的高质量,我们邀请了2位母语者协助校对。他们是管理学和教育学专业的博士生,对印尼社会现象具有批判性推理和理解能力。标注员根据五项标准评估数据:(i) 验证标签以确保其恰当分类问题;(ii) 评估写作质量,确认文本逻辑清晰、语法正确;(iii) 检查场景中立性,确保场景客观且匿名呈现;(iv) 评估问题清晰度,确认问题易于理解且聚焦困境核心;(v) 审查答案选项质量,确保所有选项合理、独特且相关。基于这些标准,标注员分配三种结果之一:“接受”(高质量数据)、“需修订”(有

相似文章

LLM能否超越二元困境想象道德替代方案?

arXiv cs.CL

本文介绍了MoralAltDataset,一个包含307个道德困境及其折衷与重构替代方案的数据集,并评估了15个LLM在超越二元选择生成道德替代方案方面的能力,发现折衷替代方案往往更受青睐,且LLM生成的替代方案可达到人类标准。

PLURAL: 面向价值对齐的全球数据集

arXiv cs.CL

介绍PLURAL,一个基于92个国家综合价值观调查的大规模偏好数据集,包含来自20个不同国家的约50万个偏好三元组,旨在改进大语言模型中的文化价值对齐。