OmnilingualGAIA2:评估前沿AI智能体的多语言差距
摘要
本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。
arXiv:2608.08775v1 公告类型:新
摘要:智能体基准旨在衡量AI智能体在现实多工具环境中规划、搜索、执行和恢复的能力,但这些基准几乎完全使用英语。随着AI智能体在全球范围内面向语言多样化的用户群体部署,以英语衡量的智能体能力是否能迁移到其他语言仍是一个悬而未决的问题。我们引入了OmnilingualGAIA2,这是GAIA2智能体基准的机器翻译扩展(部分经过人类专家验证),涵盖五种书写系统的十种目标语言,并配以本地化且经人工校准的多语言验证器。在评估七种前沿及开放权重智能体时,我们发现存在普遍8.8-18.4 pass@3点的跨语言差距,该差距在幅度上因智能体而异,集中于工具编排而非定量推理,且不会随模型规模扩大而消失。分层错误归因将该差距分解为以模型驱动为主(55%),而翻译污染的下限仅为6.4%的场景-语言对。人类专家语言分析进一步识别出形态线索丢失和歧义放大是非拉丁文字语言中的主要失败机制。我们的研究结果表明,多语言智能体评估必须成为全球部署智能体报告协议的标准组成部分。
查看缓存全文
缓存时间: 2026/08/11 08:09
# OmnilingualGAIA2:评估前沿AI智能体的多语言差距 来源:https://arxiv.org/html/2608.08775 Meta超级智能实验室 Pere-Lluís Huguet Cabot Chierh Cheng Albert Ventayol-Boada Gabriel Mejia Gonzalez Christophe Ropers Lucas Bandarkar Sebastian Ruder Darlene Sakakihara Elliot Yun Pierre Andrews Grégoire Mialon Romain Froger Marta R. Costa-jussà [costajussa](https://arxiv.org/html/2608.08775v1/mailto:costajussa) (2026年8月9日) ###### 摘要 智能体基准测试旨在衡量AI智能体在现实多工具环境中规划、搜索、执行和自我恢复的能力,但这些基准测试几乎完全使用英语。随着AI智能体在全球范围内面向语言多样的用户群体部署,以英语衡量的智能体能力能否迁移到其他语言仍然是一个悬而未决的问题。我们推出了**OmnilingualGAIA2**,这是对GAIA2智能体基准测试的机器翻译扩展(部分经过人类专家验证),覆盖了跨越五种书写系统的十种目标语言,并配有一个本地化且经过人工校准的多语言验证器。通过评估七种前沿和开放权重智能体,我们发现存在普遍存在的跨语言差距,为8.8–18.4个pass@3百分点,该差距在幅度上呈现智能体不对称性,主要集中在工具编排而非定量推理,并且不会随模型规模扩大而消失。分层错误归因将该差距分解为主要由模型驱动(55%),而翻译污染的下限仅为所有场景-语言对的6.4%。人类专家语言学分析进一步揭示了形态线索丢失和歧义放大是非拉丁字母语言中的主要失败机制。我们的结果表明,多语言智能体评估必须成为面向全球部署智能体的报告协议中的标准组成部分。 ## 1 引言 AI智能体——在环境内规划、调用工具并自主行动以追求用户目标的系统(Wooldridge和Jennings,1995 (https://arxiv.org/html/2608.08775#bib.bib56);Franklin和Graesser,1996 (https://arxiv.org/html/2608.08775#bib.bib10);Russell和Norvig,2009 (https://arxiv.org/html/2608.08775#bib.bib46))——已从研究好奇心的对象转变为全球数亿人实际使用和部署的真实产品,这得益于大语言模型(LLM)能力的快速进步(Wang等人,2024 (https://arxiv.org/html/2608.08775#bib.bib53);Xi等人,2025 (https://arxiv.org/html/2608.08775#bib.bib57);Yang等人,2025 (https://arxiv.org/html/2608.08775#bib.bib62);Staufer等人,2026 (https://arxiv.org/html/2608.08775#bib.bib51))。这些用户并非都说英语,然而我们衡量这些智能体是否真正有效的能力却几乎跟不上其部署速度,尤其是在英语之外更是如此。即使在英语环境中,基础也不稳固:预计从AI工具中获得24%加速的开发者反而被拖慢了19%(Lobentanzer,2026 (https://arxiv.org/html/2608.08775#bib.bib29)),而观察到的智能体任务覆盖率仍只是假设的一小部分(Massenkoff和McCrory,2026 (https://arxiv.org/html/2608.08775#bib.bib31);Johnston等人,2026 (https://arxiv.org/html/2608.08775#bib.bib17))。我们在英语中认证的能力,在智能体必须用另一种语言规划、搜索和行动时是否仍然成立,在撰写本文时基本上未被测量。 在英语方面,这一差距正在迅速缩小,大量工作投入于探究这些系统如何规划、搜索和使用工具的智能体基准测试(Mialon等人,2024 (https://arxiv.org/html/2608.08775#bib.bib35);Qin等人,2024 (https://arxiv.org/html/2608.08775#bib.bib43);Xie等人,2024 (https://arxiv.org/html/2608.08775#bib.bib59);Patil等人,2025 (https://arxiv.org/html/2608.08775#bib.bib42);Deng等人,2026 (https://arxiv.org/html/2608.08775#bib.bib8);Barres等人,2025 (https://arxiv.org/html/2608.08775#bib.bib6);Merrill等人,2026 (https://arxiv.org/html/2608.08775#bib.bib33))。而在英语之外,评估几乎没有跟进:对于前沿智能体系统¹¹例如参见System Card: Claude Opus 4.7 (https://www.anthropic.com/claude-opus-4-7-system-card),多语言评估在很大程度上仍然局限于单轮、基于知识的问答数据集,如Global-MMLU(Singh等人,2025 (https://arxiv.org/html/2608.08775#bib.bib49)),甚至有时根本不进行多语言评估²²GPT-5.4 Thinking System Card (https://openai.com/index/gpt-5-4-thinking-system-card/)未报告多语言性能。 为帮助弥合这一差距,我们提出了**OmnilingualGAIA2**,这是GAIA2(Froger等人,2026 (https://arxiv.org/html/2608.08775#bib.bib11))的高质量机器翻译扩展,配有多语言验证器和前沿多语言智能体排行榜。我们的贡献如下: 1. **一个多语言智能体基准测试。** 我们发布了**OmnilingualGAIA2**,这是GAIA2的机器翻译(MT)扩展,涵盖四种能力,即适应性、歧义处理、执行和搜索,跨越五种书写系统的十种目标语言,同时保留验证器所需的可执行结构(§3 (https://arxiv.org/html/2608.08775#S3))。我们通过逐语言质量评估选择翻译系统,并设计了一个MT流水线,以强制实现跨场景的表层术语一致性(§3.2 (https://arxiv.org/html/2608.08775#S3.SS2))。有关我们相对于现有数据集的语言覆盖贡献,请参见附录A (https://arxiv.org/html/2608.08775#A1)。 2. **一个经过人工校准的多语言验证器。** 我们对GAIA2验证器的LLM-as-a-Judge(LLMaaJ)组件进行了本地化,并通过在人工标注和MT智能体轨迹的黄金集上进行校准来确保其多语言质量(§3.3 (https://arxiv.org/html/2608.08775#S3.SS3))。 3. **一个跨语言多智能体排行榜以及对差距的实证刻画。** 我们评估了包含七种AI智能体的异构队列,涵盖前沿闭源系统和不同规模及架构的开放权重模型,并发现:(i) 跨语言差距在方向上普遍存在,但在幅度上呈智能体不对称性(8.8–18.4个百分点,pp);(ii) 能力排序(搜索 > 执行 > 适应性 > 歧义处理)在语言间保持稳定——翻译改变了水平而不重新排序难度;(iii) 智能体在英语之外会改变其行为策略,增加探索性读取,同时减少改变状态的写入;(iv) 跨语言差距集中在工具编排和最终响应质量上,而非定量或分类推理;以及 (v) 在单一模型家族内,该差距不会随模型规模扩大而消失(§4 (https://arxiv.org/html/2608.08775#S4)、§5 (https://arxiv.org/html/2608.08775#S5))。 4. **一个错误分类体系和对差距的归因,表明该差距主要由模型驱动。** 我们定义了一个五类别判定分类体系,并应用分层自动分流协议,以校正仅做确定性分析的选择偏差。由此得到的分解将跨语言差距的55%归因于真实的智能体失败,35%归因于翻译缺陷,10%归因于验证器伪影(§6.1 (https://arxiv.org/html/2608.08775#S6.SS1)、§6.2 (https://arxiv.org/html/2608.08775#S6.SS2))。将分析扩展到整个基准测试,我们将MT引起的污染限制在所有场景-语言对的仅6.4%,从而确立该基准测试主要衡量的是模型能力而非翻译噪声。 5. **一项人类专家语言学分析,识别每种错误类别的失败机制。** 三位母语语言学家独立检查了四种能力下的智能体轨迹,并揭示出定性模式:(i) 翻译缺陷——MT放大了英语中潜在的歧义,并悄然丢弃了用于消除正确答案歧义的定向/形态约束;(ii) 验证器伪影——验证器的严格性因语言而异、具有随机性,并且可能产生对正确内容的幻觉性拒绝;(iii) 智能体失败——cmn/jpn/ind中的形态线索丢失(冠词、复数标记)驱动了最具后果性的过度操作;以及 (iv) 测量伪影——动作计数评分会惩罚达到正确最终状态的无害自我修正,从而虚增表面上的失败率(§6.3 (https://arxiv.org/html/2608.08775#S6.SS3))。 OmniGAIA2是Meta更广泛的Omnilingual工作的一部分,旨在将AI能力扩展到主导当前系统的少数高资源语言之外,与用于1,600多种语言语音识别的Omnilingual ASR(Omnilingual-ASR团队等人,2025 (https://arxiv.org/html/2608.08775#bib.bib37))以及相同量级翻译的Omnilingual MT(Omnilingual-MT团队等人,2026 (https://arxiv.org/html/2608.08775#bib.bib38))并列。这些工作扩展了能力前沿,BOUQuET(Andrews等人,2025 (https://arxiv.org/html/2608.08775#bib.bib1))扩展了翻译评估前沿,而OmniGAIA2则将评估扩展到英语之外的使用工具的交互式智能体任务。 ## 2 相关工作 #### 多语言智能体评估。 将智能体评估推进到英语之外的努力到目前为止至少在一个维度上是狭窄的:语言集合、所评估的智能体类别,或验证器在翻译下的保真度。在网络智能体设置中,X-WebAgentBench(Wang等人,2025 (https://arxiv.org/html/2608.08775#bib.bib54))将导航任务的一个子集翻译成多种语言,而Ticket-Bench(Sales Almeida等人,2025 (https://arxiv.org/html/2608.08775#bib.bib47))将客户服务功能调用基准测试区域化到六个欧洲语言环境。仅就工具调用这一子能力而言,MLCL(Luo等人,2026 (https://arxiv.org/html/2608.08775#bib.bib30))分离了API选择和参数复制的跨语言鲁棒性,将多语言差距分解为查询理解和参数值不匹配两个组成部分。MASSIVE-Agents(Kulkarni等人,2025 (https://arxiv.org/html/2608.08775#bib.bib25))覆盖52种语言,通过清理原始MASSIVE数据集并在伯克利函数调用排行榜(BFCL)框架内重新格式化以进行评估而创建。MAPS(Hofman等人,2026 (https://arxiv.org/html/2608.08775#bib.bib16))将十语言智能体套件与安全导向的分析配对,TelcoAgent-Bench(Bariah等人,2026 (https://arxiv.org/html/2608.08775#bib.bib5))评估英语和阿拉伯语中的多语言电信智能体,发现在无约束的双语环境中性能差距会扩大——这一模式与我们在十种语言中的发现一致。 与我们的设置最接近的是,最近的三项工作跨语言翻译了结构相同的基准测试,同时保留了其可执行验证器:SEATauBench(Nguyen等人,2026 (https://arxiv.org/html/2608.08775#bib.bib36))将τ^2-Bench适配到五种东南亚语言,PolyWorkBench(Li等人,2026 (https://arxiv.org/html/2608.08775#bib.bib28))从零开始构建了一个原生多语言长周期智能体基准测试,而我们最直接的姊妹工作GAIA-v2-LILT(Kim等人,2026 (https://arxiv.org/html/2608.08775#bib.bib20))通过先翻译后适配的流水线将GAIA本地化到五种目标语言,该流水线会修改任务语义以适应当地语言环境。**OmnilingualGAIA2**则通过机器翻译进行扩展:与合成生成方法(IntellAgent(Levi和Kadar,2025 (https://arxiv.org/html/2608.08775#bib.bib27))、TaskCraft(Shi等人,2026 (https://arxiv.org/html/2608.08775#bib.bib48))、AgentSynth(Xie等人,2026 (https://arxiv.org/html/2608.08775#bib.bib58)))不同,基于MT的扩展在保留现有验证器可执行结构的同时在语言上进行扩展,遵循MMLU-ProX(Xuan等人,2025 (https://arxiv.org/html/2608.08775#bib.bib60))在29种语言上的混合式“先MT后专家审查”流水线。基准测试的有效性支撑着我们的分析:智能体基准测试清单(ABC)(Zhu等人,2026 (https://arxiv.org/html/2608.08775#bib.bib65))记录了广泛使用的智能体基准测试中系统性的结果有效性和任务有效性失败;我们通过对照人工标签校准验证器(§3.3 (https://arxiv.org/html/2608.08775#S3.SS3))以及将观察到的差距分解为翻译侧、模型侧和验证器侧因素并设置有限的污染下限(§6.3 (https://arxiv.org/html/2608.08775#S6.SS3))来应对这些问题。 在此背景下,据我们所知,**OmnilingualGAIA2**是GAIA2的第一个扩展,它(i)覆盖了跨越五种书写系统的十种目标语言(附录A (https://arxiv.org/html/2608.08775#A1)),同时端到端保留可执行验证器,(ii)报告了在共享的、经过校准的跨语言评判器下,前沿智能体和开放权重智能体异构队列的配对比较,以及(iii)将观察到的差距分解为翻译侧和模型侧因素,将MLCL的分析程序从孤立的工具调用扩展到完整的智能体轨迹——并辅以全面的人类专家语言学验证。 #### 多语言LLM-as-a-Judge。 由于GAIA2以及继承而来的OmnilingualGAIA2依赖基于模型的验证器来对智能体的自然语言写入动作进行评分,因此评判器本身的跨语言可靠性是一等关注问题。LLM评判由Zheng等人(2023 (https://arxiv.org/html/2608.08775#bib.bib64))推广,并继承了MT社区中基于提示的翻译质量评分方法(Kocmi和Federmann,2023 (https://arxiv.org/html/2608.08775#bib.bib22);Rei等人,2022 (https://arxiv.org/html/2608.08775#bib.bib45);Juraska等人,2025 (https://arxiv.org/html/2608.08775#bib.bib18));随后的审计记录了位置、冗长度和自我偏好偏差(Panickssery等人,2024 (https://arxiv.org/html/2608.08775#bib.bib41);Koo等人,2024 (https://arxiv.org/html/2608.08775#bib.bib23)),这些偏差在单语设置中已经存在问题。在多语言设置中,这些效应会叠加:METAL(Hada等人,2024 (https://arxiv.org/html/2608.08775#bib.bib15))和MM-Eval(Son等人,2024 (https://arxiv.org/html/2608.08775#bib.bib50))记录了在低资源语言上评判器与人工一致性的大幅下降,M-RewardBench(Gureja等人,2025 (https://arxiv.org/html/2608.08775#bib.bib14))报告了多语言奖励模型的类似崩塌,BabelJudge(KC,2026 (https://arxiv.org/html/2608.08775#bib.bib19))将分析扩展到完整智能体轨迹,发现在某些语言上顺序一致性接近随机水平,硬币翻转评判器研究(Yagubyan,2026 (https://arxiv.org/html/2608.08775#bib.bib61))量化了对抗性配对下的可靠性下限,而Zhang等人(2026 (https://arxiv.org/html/2608.08775#bib.bib63))则分离出一种独特的*翻译腔*偏差,即评判器系统性地偏好回译内容而非人工撰写的内容。Doğruöz等人(2026 (https://arxiv.org/html/2608.08775#bib.bib9))将这些发现综合为多语言评判实践的具体建议。 我们的验证器设计(§3.3 (https://arxiv.org/html/2608.08775#S3.SS3))继承了GAIA2的LLMaaJ框架,但明确地对照人工标注的多语言智能体轨迹进行重新校准,使用标准的名义尺度统计量(Cohen,1960 (https://arxiv.org/html/2608.08775#bib.bib7);Artstein和Poesio,2008 (https://arxiv.org/html/2608.08775#bib.bib3);Landis和Koch,1977 (https://arxiv.org/html/2608.08775#bib.bib26);Krippendorff,2019 (https://arxiv.org/html/2608.08775#bib.bib24))量化评分者间一致性,并在由此产生的排行榜上报告语言条件置信区间。
相似文章
Telco-GAIA:电信领域智能体的双语基准测试
Telco-GAIA是一个用于评估电信领域工具使用智能体的双语多模态基准测试,包含100个经过人工验证的任务,要求对异构来源进行多跳推理,并通过精确字符串匹配进行客观评分。
GaoYao基准:全面评估大模型多语言与多文化能力的新框架
GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。
超越英语:揭示视觉-语言-动作模型中的多语言差距
本文首次系统研究了视觉-语言-动作(VLA)模型中的多语言指令跟随问题,揭示了当模型基于英语训练时,在其他语言上的性能显著下降。作者提出了多语言主成分对齐(MPCA)方法来缩小多语言性能差距。
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。
历经考验:在陌生环境中重新评估智能体的能力
GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。