GaoYao基准:全面评估大模型多语言与多文化能力的新框架

arXiv cs.CL 论文

摘要

GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。

arXiv:2604.20225v1 公告类型:新增 摘要:评估大语言模型(LLM)的多语言与多文化能力对其全球落地至关重要。现有基准存在三大痛点:(1)评测维度割裂,忽视深层文化差异;(2)主观任务语言覆盖不足,依赖低质机翻;(3)分析浮于表面,仅做简单排名缺乏诊断深度。为此,我们推出GaoYao:18.23万样本、26种语言、51个国家/地区。首先,GaoYao提出统一框架,将评测任务划分为三层文化维度(通用多语言、跨文化、单文化)及九层认知子维度。其次,通过专家严格本地化,把主观基准高质量拓展至19种语言,并为34种文化合成跨文化测试集,覆盖率提升最高111%。第三,对20余款旗舰及轻量模型进行深度诊断,发现显著地域性能落差与任务间差异,为未来研究提供可靠路线图。基准已开源:https://github.com/lunyiliu/GaoYao
查看原文
查看缓存全文

缓存时间: 2026/04/23 10:03

# 皋陶基准:评测大模型多语言与多文化能力的综合框架  
来源:https://arxiv.org/html/2604.20225  
刘逸伦¹,赵春光¹*,朴梦瑶¹,苗灵琪¹,陶世民¹,何明贵¹,刘晨欣¹,张莉¹,马红霞¹,郭佳欣¹,刘晨¹,邓丽群¹,魏建生¹,孟小军¹,杜凡一¹,魏代猛¹,肖仰华²  
¹华为技术有限公司,中国  
²复旦大学,中国  
[email protected], [email protected]  

###### 摘要  
评测大语言模型(LLM)的多语言与多文化能力对其全球落地至关重要。然而现有基准存在三大硬伤:  
1. 评测维度碎片化,忽视深层文化差异;  
2. 主观任务语言覆盖不足,依赖低质量机翻;  
3. 分析浅显,仅做排行榜,缺乏诊断深度。  

为此,我们推出**皋陶**¹——综合基准,含182.3k样本、26种语言、51个国家/地区。  
首先,提出统一框架,将任务按文化深度分为三层(通用多语言、跨文化、单文化)及九层认知子维度。  
其次,通过专家严格本地化,将主观评测集扩展至19种语言,并为34种文化合成跨文化测试集,覆盖度提升最高111%。  
最后,对20余款旗舰与轻量模型深度诊断,揭示显著的地域性能落差与任务鸿沟,为未来工作提供可靠路线图。  
基准已开源²:https://github.com/lunyiliu/GaoYao  

## 1 引言  
随着LLM服务全球用户,处理多语言与复杂文化语境的能力成为衡量包容性的关键指标。然而当前多语言评测面临三大挑战:  

1. **缺乏系统性,忽视文化**  
   多数知名基准仅聚焦单一能力,如事实知识或阅读理解,忽略文化敏感度等深层能力,把多语言当作孤立测点,而非文化与认知交织的整体。  

2. **主观任务语言覆盖不足,质量堪忧**  
   指令遵循、多轮对话等主观任务主要在英语上评测。多语言扩展往往靠机翻,仅覆盖少数语言,导致“翻译腔”,在开放问答中尤为有害。  

3. **缺乏深度诊断**  
   现有研究止步于排行榜,未揭示性能差异背后的地域、任务或架构关联,留下大量盲区。  

为此,我们推出**皋陶**,一个强调系统性、真实性与分析深度的多语言多文化基准,具备三大特色:  

- **系统评测框架**:依托文化理论与认知分类法,提出三层文化深度(通用多语言、跨文化、单文化)及九层认知子维度。  
- **母语级数据扩展**:组织专家把两项关键主观评测(指令遵循、多轮对话)本地化为19种语言;并通过专家验证合成34种文化的跨文化测试集。  
- **深度诊断发现**:分层评测20+SOTA模型,揭示严重的“数字鸿沟”与任务代差,提出部署与数据建设建议。  

贡献总结:  
- 提出含23.3M tokens、三层文化九层认知的系统评测基准,终结碎片化。  
- 将指令与对话评测扩展至19种语言,文化评测覆盖34种文化,填空白、保质量。  
- 绘制现有LLM多语言能力全景图,释放评测集与代码,为社区指路。  

## 2 方法  
如图1,我们先定义LLM必备的多语言多文化能力理论框架,再通过“整合-扩展-泛化”三策略构建皋陶基准。  

### 2.1 分层评测维度  

##### 三大文化层的理论基础  
借鉴文化冰山模型与组织文化三层模型,我们把任务按文化深度分为:  

- **通用多语言能力**:冰山之上,评测语言无关的推理、知识、理解等。  
- **跨文化能力**:冰山之下,评测共享概念的文化差异,如“龙”在东西方象征截然不同。  
- **单文化能力**:冰山之底,评测文化独有概念,如中国“春运”、印度“合十礼”。  

##### 认知分类法导出九子层  
引入布鲁姆认知分类,将任务细分为九层:  

- **记忆与理解**:多语言知识问答、阅读理解、翻译。  
- **应用与分析**:推理、数学。  
- **评价与创造**:  
  1. 创造类:指令遵循、多轮对话;  
  2. 评价类:跨文化、单文化任务,需模型在高度相似选项中做出符合文化规范的价值判断。  

### 2.2 皋陶基准构建  

在理论框架指导下,采用“整合现有资源 + 扩展关键语言 + 泛化文化数据”的混合策略。  

#### 2.2.1 整合现有数据集  
对客观知识与推理子层,直接集成经广泛验证的开源数据集:  

- **知识与推理**:Include、MMMLU  
- **阅读**:Belebele  
- **翻译**:Flores-101  
- **数学**:MGSM  
- **跨/单文化**:SAGE、CultureScope(原仅覆盖中文、西语),我们补充构建34文化跨文化评测集(见2.2.3)。  

#### 2.2.2 扩展AlpacaEval与MT-Bench的语言覆盖  
指令遵循与多轮对话是反映模型“类人”实用性的关键能力,却主要在英语评测。我们精选AlpacaEval与MT-Bench,组织20名母语专家耗时175人日进行严格本地化,产出S-AlpacaEval与S-MT-Bench,覆盖19种语言,非简单翻译,而是地道改写与文化适配。

相似文章

OmnilingualGAIA2:评估前沿AI智能体的多语言差距

arXiv cs.CL

本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。

探索大语言模型在中文抽象语言掌握中的能力边界

arXiv cs.CL

本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。