MET:理论驱动与文化感知的多语言道德推理
摘要
本文介绍了 MCLASH(一个多语言道德决策基准)、MET(一种基于理论的提示方法,用于文化感知的道德推理),以及 MET-D(一种自蒸馏训练方法,可跨不同模型家族和规模改进多语言道德推理)。
查看缓存全文
缓存时间: 2026/07/14 20:17
论文页面 - MET:基于理论且具有文化意识的多语言道德推理
Source: https://huggingface.co/papers/2607.11736
摘要
语言模型越来越多地被用于跨不同语言和文化背景的道德决策,然而现有工作在三个方面忽视了多语言特性:1)多语言评估基准使用直接翻译,未能适配特定文化项目;2)道德推理的推理时方法依赖静态的、以英语为中心的支架,缺乏道德理论基础;3)道德决策的训练方法通常需要来自更强模型或人工标注者的昂贵监督。我们通过三项贡献填补这些空白。首先,我们推出 MCLASH,一个多语言道德决策基准,用于捕捉跨语言的、具有文化情境的道德直觉和社会规范。其次,我们提出 MET(基于理论推理的多语言伦理方法),这是一种两步提示方法,建立在来自心理学和哲学的专家策划、基于理论的基石之上:模型首先选择特定情境和文化的基石,然后以用户母语进行推理。第三,我们引入 MET-D(MET 蒸馏),它通过一个无需外部监督的自蒸馏训练阶段增强第二步。MET-D 在三种不同规模和系列(Qwen3-4B、Qwen3-8B、Gemma3-4B)的模型上,相比基础模型平均提升 macro-F1 值:在 MCLASH 上提升 3.71 分,在 MMoralExceptQA 上提升 4.23 分,其中马来语在 Qwen3-8B 上的 MCLASH 增益最高达 12.94 分。我们进一步揭示 MET-D 平均提升母语推理 62.13 分,且有益的基石在不同文化之间存在系统性差异。这些贡献共同为文化对齐、理论驱动的多语言道德推理开辟了道路。
查看 arXiv 页面 (https://arxiv.org/abs/2607.11736)查看 PDF (https://arxiv.org/pdf/2607.11736)项目页面 (https://huggingface.co/collections/launch/met)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11736)
引用本文的模型(11个)
launch/MET-D-Qwen3-4B 文本生成• 4B• 约4小时前更新 • 759 (https://huggingface.co/launch/MET-D-Qwen3-4B)
launch/MET-D-Qwen3-8B 文本生成• 8B• 约4小时前更新 • 836 (https://huggingface.co/launch/MET-D-Qwen3-8B)
launch/MET-D-Gemma3-4B 文本生成• 4B• 约4小时前更新 • 859 (https://huggingface.co/launch/MET-D-Gemma3-4B)
launch/MET-D-Qwen3-4B-en-only 文本生成• 4B• 约4小时前更新 • 775 (https://huggingface.co/launch/MET-D-Qwen3-4B-en-only)
浏览引用本文的11个模型 (https://huggingface.co/models?other=arxiv:2607.11736)## 引用本文的数据集(1个)
launch/MCLASH 查看器• 约4小时前更新 • 2.61k • 103 (https://huggingface.co/datasets/launch/MCLASH)
引用本文的Space(0个)
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2607.11736,即可从此页面链接。
包含本文的收藏集(1个)
相似文章
LLaMA 3.1-8B-Instruct中的框架条件道德计算:伦理推理的机械可解释性审计
本文使用机械可解释性对LLaMA 3.1-8B-Instruct中的伦理推理进行审计,发现了“情境锚定效应”,即特定领域的表征在道德计算中占主导地位,并提出了“机械对齐”作为研究计划。
元认知作为奖励:通过知识与调控信号强化大语言模型推理
介绍了元认知即奖励(MaR),一个基于元认知知识与调控信号指导大语言模型推理的强化学习框架,在推理基准上相比基准方法最高提升11%。
AdaMame: 自适应多语言推理的训练方案
本文介绍了AdaMame,一种两阶段训练方案(SFT + GRPO),用于在多语言数学推理中自适应地将推理语言与查询语言对齐,在不牺牲准确性的情况下缓解语言崩溃。
多语言思维,而非更难的思维:教授推理模型代码切换的数据高效框架
本文介绍了一个数据高效的微调框架,用于教授推理模型有效地进行代码切换(混合使用多种语言),证明了战略性的代码切换可以提升低资源语言的推理能力。该工作分析了大型语言模型在不同语言、任务和领域中的代码切换行为,并开发了促进有益代码切换模式的干预措施。
x1:跨语言与文化自适应推理学习
研究人员推出了 x1,这是一类推理模型家族,能够针对每个具体实例自适应地选择最优语言进行推理,证实了在多语言及文化相关任务中,语言选择会对推理质量产生影响。