Telco-GAIA:电信领域智能体的双语基准测试

arXiv cs.AI 论文

摘要

Telco-GAIA是一个用于评估电信领域工具使用智能体的双语多模态基准测试,包含100个经过人工验证的任务,要求对异构来源进行多跳推理,并通过精确字符串匹配进行客观评分。

arXiv:2607.20510v1 公告类型:新 摘要:我们推出了Telco-GAIA,这是一个用于评估在真实电信运营商数据上使用工具的智能体的双语多模态基准测试。Telco-GAIA包含100个经过人工验证的问答任务,使用英语和阿拉伯语,每个任务需要对三个异构来源进行平均4.2跳的多跳推理:一个静态网站快照(HTML、图片及链接的PDF)、一个合成的关系型SQL数据库以及外部网络档案,涵盖文本、图像和表格模态。该基准测试以沙盒化的Docker环境提供,并通过归一化的精确字符串匹配进行评分,使得评估客观、确定且可重现,无需任何LLM作为评判者。通过对一个专门构建的参考智能体在十二个商业和开源LLM上进行评估,我们发现Telco-GAIA具有挑战性:即使是最强的模型也仅能解决71%的任务;在中等成本预算下,这一比例降至约40%,而视觉基础类别仍然是最弱的,后端平均得分低于30%,在文档和图像理解方面留有大量提升空间。Telco-GAIA为企业智能体提供了一个严谨、可重复的测试平台,并为构建封闭域基准测试提供了一个模板。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:04

# Telco-GAIA:面向电信领域智能体的双语基准
来源:https://arxiv.org/html/2607.20510
Dmitrii Khizbullin1,\*,Zaid Alyafeai1,Abdelrahman Eldesokey1,Nourah AlSultan2, Raghad Alshalan2,David R\. Pugh1,Bernard Ghanem1

1阿卜杜拉国王科技大学(KAUST),2stc \*通讯作者:dmitrii\.khizbullin@kaust\.edu\.sa (https://arxiv.org/html/2607.20510v1/mailto:[email protected])

###### 摘要

我们推出了 Telco\-GAIA,这是一个用于评估真实世界电信运营商数据上使用工具的智能体的双语、多模态基准。Telco\-GAIA 包含 100 个经过人工验证的问答任务,涵盖英语和阿拉伯语,每个任务都需要对三种异构来源进行多跳推理(平均 4.2 跳):一个静态网站快照(HTML、图像和链接的 PDF)、一个合成的关系型 SQL 数据库以及外部网页存档,跨越文本、图像和表格模态。该基准以沙盒化的 Docker 环境提供,并通过标准化的精确字符串匹配进行评分,使评估客观、确定且可随时间复现,无需任何 LLM 作为裁判。通过评估一个专门构建的参考智能体在十二个商业和开源 LLM 上的表现,我们发现 Telco\-GAIA 具有挑战性:即使最强的模型也仅能解决 71% 的任务;在中等成本预算下,这一比例降至约 40%,而视觉基础类别仍然最弱,平均后端得分低于 30%,在文档和图像理解方面留下了巨大的提升空间。Telco\-GAIA 为企业智能体提供了一个严格且可复现的测试平台,并为构建封闭领域基准提供了模板。

Telco\-GAIA:面向电信领域智能体的双语基准

Dmitrii Khizbullin1,\*, Zaid Alyafeai1, Abdelrahman Eldesokey1, Nourah AlSultan2,Raghad Alshalan2,David R\. Pugh1,Bernard Ghanem11阿卜杜拉国王科技大学(KAUST),2stc\*通讯作者:dmitrii\.khizbullin@kaust\.edu\.sa (https://arxiv.org/html/2607.20510v1/mailto:[email protected])

## 1 引言

大型语言模型(LLM)智能体越来越多地被部署在面向客户的企业环境中,在这些环境中,它们必须浏览专有网站、解析内部文档并查询运营数据库以解决客户请求。电信就是这种环境的典型案例:单个运营商在一个大型双语网站上展示数百种套餐、设备、漫游选项和促销活动,背后有关系型计费和使用数据支撑。因此,确定智能体能否可靠地检索并推理这些异构来源,是部署前的实际前提。

然而,对此类智能体的严格评估仍然困难。常见做法是半自动地从文本块生成问答对,并使用 LLM 作为裁判(LLMaJ)对响应进行评分。这很方便,但既不客观也不可复现:LLMaJ 分数对裁判模型和提示措辞敏感 [41, 42]。此外,自动生成的问题无法保证具有唯一、可验证的答案:超过一半的开放域问题存在多个有效答案 [43],审计发现 13–17% 被判定为错误的响应实际上是正确的,这是由于作为黄金标准的参考答案本身不完整或错误 [44]。学术基准解决了部分问题,但在此场景下仍留有空白。诸如 GAIA [1] 等开放域智能体基准依赖于实时互联网,因此无法随时间复现;诸如 WebArena [5] 等沙盒化网络环境是通用的,且未在单个领域内结合关系型数据库、PDF 和图像检索;而诸如 WixQA [9] 等企业 RAG 基准仅是纯文本、单语种,且不提供实时智能体环境或结构化数据。没有一个目标针对具有确定性评分的双语、多模态、电信特定语料库。

我们推出了Telco\-GAIA¹,这是一个用于评估真实电信运营商公共数据上使用工具的智能体的基准,该运营商服务数千万用户。Telco\-GAIA 从 GAIA [1] 中汲取设计灵感,但目标锁定在沙盒化、可复现环境中的封闭企业领域。它包含 100 个多跳任务(平均 4.2 跳),涵盖七个类别(定价、图像、网页存档、PDF、PDF 视觉、数据库和杂项),涉及英语和阿拉伯语(分别为 65 个和 35 个任务)。每个任务都有一个经人工验证的唯一正确答案,通过标准化精确字符串匹配评分,消除对 LLM 裁判的依赖。解决一个任务需要检索并推理三种异构来源:运营商网站的静态快照(HTML 页面、图像和链接的 PDF)、一个通过 REST API 暴露的合成关系型 SQLite 客户数据库,以及外部网页存档(维基百科和 arXiv)。网站和数据库通过 Docker 本地提供,而网页存档实际上是不可变的;因此该环境是半封闭的,并且运行可随时间复现。由于运营商的网站是真实且公开的,模型可能从参数记忆而非从提供的快照检索来回答某些任务;这种捷径只会随时间减弱,因为实时网站会偏离我们的冻结快照,迫使进行真正的检索,从而强化基准而非使其退化。附录 A 详细介绍了框架、评估器和架构。

为了建立基线难度,我们评估了一个专门构建的参考工具调用智能体,涉及十二个商业和开源模型。该基准具有挑战性:最强模型整体达到 71%,而在视觉基础类别(图像和 PDF 视觉)上准确率最低,暴露了当前智能体在文档和图像理解方面的具体弱点。表 1 将 Telco\-GAIA 与先前基准进行了比较。

表 1:关键基准属性比较。Telco\-GAIA 是唯一同时具备所有五个属性的基准。
‡ 部分黄金步骤标注(仅部分任务,或里程碑检查点而非推理步骤)。
† TelAgentBench 是单语韩语;其他所有先前基准均为单语英语。

| 基准 | 多模态 | 电信领域 | 关系型数据库 | 黄金步骤标注 | 多/双语 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| GAIA [1] | ✓ | – | – | ✓ | – |
| WebArena [5] | – | – | – | – | – |
| VisualWebArena [26] | ✓ | – | – | – | – |
| TheAgentCompany [25] | – | – | – | ✓‡ | – |
| WorkArena [6] | – | – | – | – | – |
| AgentBench [7] | – | – | ✓ | – | – |
| τ-bench [27] | – | – | – | – | – |
| WixQA [9] | – | – | – | – | – |
| LiveRAG [29] | – | – | – | – | – |
| FinanceBench [20] | – | – | – | – | – |
| MMLongBench-Doc [31] | ✓ | – | – | – | – |
| TelAgentBench [22] | – | ✓ | – | ✓‡ | –† |
| TeleQnA [32] | – | ✓ | – | – | – |
| ToolHop [34] | – | – | – | ✓ | – |
| Telco-GAIA (ours) | ✓ | ✓ | ✓ | ✓ | ✓ |

总之,Telco\-GAIA 的主要贡献如下:

1.  **一个双语、多模态、多跳的电信智能体基准。** Telco\-GAIA 跨越三种模态(文本、图像和表格数据),这些模态来自同一框架内的异构源:单个运营商的网站(HTML 文本和页面内图像)、链接的 PDF 文档(文本和嵌入图像)、一个合成的关系型数据库(表格数据)以及存档的网页资源(维基百科和 arXiv),涵盖阿拉伯语和英语。没有先前的基准同时具备这些属性(表 1)。
2.  **一个可复现、抗污染的沙盒化环境。** 网站快照和客户数据库已冻结并通过 Docker 本地提供,因此每次运行,无论何时执行,都基于相同的语料库,这与答案随实时网页内容变化而漂移的开放互联网基准不同。
3.  **客观、确定性的评分。** 100 个任务中的每一个都有一个经人工验证的正确答案,通过标准化精确字符串匹配评分,消除了在 RAG 框架(如 RAGAS [13] 和 ARES [12])中使用的 LLM 作为裁判指标所面临的裁判模型、提示和尺度敏感性。
4.  **关系型客户数据库作为一等模态。** 一个包含 53 名客户的合成 SQLite 数据库,附带十二个月的计费和使用历史,通过 REST API 使用 SQL 进行查询,要求智能体将结构化查询与网站和 PDF 检索交织在一起,这是一种在先前 RAG 基准中缺失的结构化/非结构化组合。

## 2 相关工作

Telco\-GAIA 位于多个基准家族的交汇处(表 1)。诸如 GAIA [1] 等通用智能体基准建立了精确匹配、使用工具的评估框架,但在开放互联网上运行,牺牲了可复现性。诸如 WebArena [5] 和 VisualWebArena [26] 等沙盒化网络环境可复现且通用,但缺乏关系型数据库和领域基础。诸如 WixQA [9] 等企业 RAG 基准提供单一公司语料库,但仅为纯文本、单语种,且没有实时智能体环境。最接近的是 TelAgentBench [22],它针对电信智能体,但仅限韩语,通过抽象 API 而非提供服务的网站暴露数据,并且没有图像或 PDF 模态。Telco\-GAIA 在统一所有这些属性方面是独特的;附录 D 提供了相关工作的详细描述。

## 3 数据集创建原则

本节描述了用于构建 Telco\-GAIA 基准中 100 个任务的设计原则和按类别划分的规范。该数据集包含 65 个英语任务和 35 个阿拉伯语任务,分布在七个类别中:定价、杂项、图像、网页存档、PDF、PDF 视觉和数据库。英语子集首先构建;阿拉伯语子集随后构建,基于相同原则,通过翻译和全新创作相结合。

### 3.1 通用原则

以下原则适用于每个任务,无论类别或语言如何。

#### 由人工标注员启动。

人工标注员创作一组种子任务,LLM 智能体以相同精神扩展它们,并且每个任务,无论是手动还是合成的,都由一个或多个人独立验证。

#### 严格的因果链。

*一跳*是一个检索与推理步骤,例如导航网站到目标页面、在 PDF 中查找事实、查询数据库或从图像中读取值。推理过程必须形成一条单一的线性链,其中第 N 跳的输出是第 N+1 跳所需的输入。在最终确定之前,每个任务都根据三个标准进行验证:(i)每个检索到的事实都是后续步骤的必要输入(无死胡同);(ii)严格的因果顺序成立(没有第 N 跳就不可能进行第 N+1 跳);(iii)没有悬空或冗余的事实。一个常见的失败模式是“剧透”:在较早的步骤中揭示中间或最终答案,这使得智能体可以跳过事实发现的子链。

#### 验证不对称性。

每个任务必须*易于验证*(人类可以使用步骤字段在 2 分钟内确认答案),但*难以解决*(智能体必须进行真正的搜索、消歧和多工具协调)。难度来源于发现、消歧、排除潜在替代方案的努力以及非显而易见的跨源桥梁。

#### 阿拉伯语子集。

阿拉伯语子集由母语为阿拉伯语的人创建,结合了现有英语任务的人工翻译和新创作的任务,并遵循除数据库外英语类别的分布。

### 3.2 类别特定原则

#### 定价。

定价任务从运营商网站检索精确的货币值(套餐费用、设备价格、附加费用以及含增值税的总计)。当套餐名称具有通用性时,问题会暗示或陈述导航路径,并区分预付费和后付费、消费者和企业(其价格不同);答案为精确数字。

#### 杂项。

杂项任务涵盖非定价推理:覆盖检查、帮助中心常见问题解答、设备比较和套餐功能,来自故意多样化的页面组合。我们禁止使用是/否答案。每个检查的*结果*必须驱动下一步(例如,如果一个城市被覆盖,则查找其特定的漫游代码),保持每一步都是因果的,并且最终答案是一个具体值。

#### 图像。

图像任务要求智能体定位页面上的特定视觉元素(由页面和部分标识的横幅或促销图像),并从中提取一个*确定性*事实:人物或层级数量、品牌标志或颜色。这个视觉事实是一个 4–5 跳、多页面链条的第一环,因此无法读取图像的模型无法继续。

#### 网页存档。

网页存档任务将运营商网站与外部知识连接起来,要求至少从维基百科或 arXiv 检索一个 LLM 参数记忆中不一定可靠持有的事实。目标实体在问题中从不被命名(反剧透):智能体必须从上下文线索中识别它,然后才去查找。我们偏好对更新有弹性的目标,例如信息框字段和 ISO 代码,并使用双向的 Wiki↔Site 模式。

#### PDF。

PDF 任务要求下载网站链接的 PDF,并提取特定的文本值,然后该值驱动链条(例如,映射到套餐排名,然后映射到价格的条款编号)。每个任务都从不同的产品组(后付费、预付费、企业、度假套餐)中抽取一个 PDF,以确保没有文档被过度使用。

#### PDF 视觉。

PDF 视觉任务针对仅存在于 PDF 的*视觉布局中*而非其文本层的事实:计数彩色框、表格行、图标或平面图元素。每个此类事实都经过验证,确保不能作为纯文本提取,从而将真正的文档图像理解与单纯的 OCR 区分开来。

#### 数据库。

数据库任务将网站与合成的关系型 SQL 数据库配对,需要 4–5 个主要涉及数据库的跳数,并且沿着创意的多源链进行。

相似文章

历经考验:在陌生环境中重新评估智能体的能力

Hugging Face Daily Papers

GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。

TerraBench:智能体能否推理异构地球系统数据?

arXiv cs.AI

TerraBench 是一个新基准,用于评估人工智能智能体在异构地球系统数据(包括网格数据、卫星图像和模拟器输出)上进行推理的能力。它揭示了当前前沿模型的显著局限性,表现最佳的模型平均工具使用得分仅为 59.2%。

TUA-Bench: 通用终端使用代理的基准测试

Hugging Face Daily Papers

TUA-Bench是一个综合性基准测试,用于评估通用终端使用代理在各种数字活动和专业工作流中的表现,揭示了当前前沿代理之间的显著性能差距。