PolyUQuest:基于异构图的可验证结构感知Web RAG

arXiv cs.AI 论文

摘要

PolyUQuest 是一个可验证、结构感知的 Web RAG 框架,利用异构图统一超链接拓扑、DOM 层次结构和实体关系知识,在答案正确性、覆盖率和忠实度方面优于现有系统。

arXiv:2607.08269v1 公告类型:新 摘要:现有的检索增强生成(RAG)系统将网页视为扁平文本,丢失了编码在 HTML 中的结构和语义信号。我们提出 PolyUQuest,一个可验证、结构感知的 Web RAG 框架,构建在异构图之上,该图统一了页面间的超链接拓扑、页面内的 DOM 层次结构以及跨页面的实体关系知识。一个双层路由器将每个查询分派到与其结构需求匹配的三种检索模式之一,包括直接块检索、跨页图遍历和多跳实体推理。每个答案都是完全可验证的,因为每个引用的块都携带其源页面、标题路径和实体链接,用户可以追溯任何声明到其结构证据。我们在香港理工大学(PolyU)的官方网站上进行了评估,该网站包含 4,240 个页面、31,086 个 DOM 块、29,119 个实体和 37,680 个关系,并附带一个多类型评估基准。PolyUQuest 在答案正确性、覆盖率和忠实度方面优于现有 RAG 系统,同时每个查询消耗的 LLM token 显著更少。该演示提供了一个交互界面,用于检查引用的答案、比较路由模式下的检索轨迹以及探索证据图路径。PolyUQuest 正在准备部署为 PolyU 面向学生的问答服务。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:08

# PolyUQuest:面向异构图的可验证结构感知网页RAG

来源:https://arxiv.org/html/2607.08269
Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li\*, Chen Jason Zhang, Qing Li 香港理工大学,香港特别行政区,中国 \{yarden\.liu, yi000\.ye, quanyu\.feng, mingxi\.ye, mingtao\.zhang\}@connect\.polyu\.hk \{haoyang\-comp\.li, jason\-c\.zhang, qing\-prof\.li\}@polyu\.edu\.hk

\(2026\)

###### 摘要.

现有的检索增强生成(RAG)系统将网页视为平面文本,丢失了 HTML 中蕴含的结构和语义信号。我们提出 PolyUQuest,一个可验证的、结构感知的网页 RAG 框架,它构建在一个异构图上,该图统一了页面间的超链接拓扑、页面内的 DOM 层级结构以及跨页面的实体-关系知识。一个双层路由器将每个查询分派到三种与其结构需求匹配的检索模式之一,包括直接块检索、跨页面图遍历和多跳实体推理。每个答案都是完全可验证的,因为每个被引用的块都携带其来源页面、标题路径和实体链接,用户可以追踪任何主张回到其结构证据。我们在香港理工大学(PolyU)的官方网站上进行评估,该网站包含 4,240 个页面、31,086 个 DOM 块、29,119 个实体和 37,680 个关系,并附带一个多类型评估基准。PolyUQuest 在答案正确性、覆盖率和忠实度方面优于现有的 RAG 系统,同时每个查询消耗的 LLM token 显著更少。演示提供了一个交互式界面,用于检查带引用的答案、比较不同路由模式的检索轨迹以及探索证据图路径。PolyUQuest 正准备部署为面向学生的 QA 服务。演示视频可在 https://youtu.be/thKWYaL_4rw 获取。

检索增强生成,问答,异构图,Web 搜索

∗通讯作者。

††版权:无††期刊年份:2026††会议:第 35 届 ACM 国际信息与知识管理会议;2026 年 11 月 7–11 日,意大利罗马

## 1. 引言

网页是检索增强生成(RAG)中最广泛使用的知识来源之一 (Huang et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib2); Li et al., 2025d (https://arxiv.org/html/2607.08269#bib.bib3); Wang et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib26)),其中检索准确且当前证据是遏制幻觉的关键 (Jiang et al., 2025a (https://arxiv.org/html/2607.08269#bib.bib1); Fan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib11); Zhang et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib37); Xu et al., 2026 (https://arxiv.org/html/2607.08269#bib.bib42))。与纯文本文档不同,网页内容组织在三个互补的层次中:页面间的超链接、每个页面内的 DOM 层级结构以及跨页面重复出现的命名实体。考虑一位潜在学生提问:“计算系有哪些教授从事 NLP 研究并教授相关课程?”没有一个页面能单独给出答案:答案分散在教师简介页面和课程页面中。回答这个问题需要跟随超链接并在页面间连接实体,这超出了简单的相似性检索的能力范围。

现有的 RAG 方法无法处理结构复杂的网站上的问题,特别是那些需要跨页面导航的问题。纯文本和基于块的 RAG (Singh et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib39); Li et al., 2025c (https://arxiv.org/html/2607.08269#bib.bib10)) 将每个页面扁平化为一个块包并进行相似性检索,完全丢弃了结构;而代理型网络搜索可以通过浏览来恢复结构,但代价是巨大的 token 消耗和延迟。图 RAG 系统 (Wang et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib43); Guo et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib33); Hu et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib34); Liang et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib35); Wang et al., 2026 (https://arxiv.org/html/2607.08269#bib.bib44)),例如 LightRAG (Guo et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib33)),捕获了实体-关系结构 (Peng et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib36)),但它们仍然将 HTML 扁平化为文本并注入了过大的全局上下文,从而增加了每个查询的成本 (Zhou et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib38); Jiang et al., 2025b (https://arxiv.org/html/2607.08269#bib.bib4))。相比之下,HTML 和文档结构感知的 RAG (Tan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib32); Lin et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib13); Li et al., 2025a (https://arxiv.org/html/2607.08269#bib.bib21)),例如 HtmlRAG (Tan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib32)),保留了页面或文档内部的结构,但忽略了连接页面的超链接,因此无法追踪跨网站的证据。总之,现有系统无法共同推理超链接拓扑、DOM 层级结构和跨页面实体,而那些最接近结构感知的系统则在 token 和延迟方面付出高昂代价。

PolyUQuest(第 2 节 (https://arxiv.org/html/2607.08269#S2))。作为回应,我们开发了 PolyUQuest,一个基于异构 Web 图的交互式结构感知 RAG 系统。PolyUQuest 将超链接拓扑、DOM 层级结构和跨页面实体关联统一在一个单一的图中,并通过查询路由加以利用,解决了限制先前方法的结构保真度、跨页面推理和检索成本之间的矛盾。与现有 RAG 系统相比,PolyUQuest 提供以下功能:

**三层网络图。** PolyUQuest 将一个网站建模为一个单一的异构图,其网页、证据块、实体和主题节点在所有三个结构层上连接。与通常只强调一个结构层的先前系统不同,这个统一的图允许系统从一个实体移动到它出现的块,然后移动到包含它的页面及其链接邻居,当答案跨越多个页面时。

**结构驱动的检索。** 不同的问题利用图的不同层次,因此 PolyUQuest 对每个查询进行分类并将其分派到三种检索模式之一:用于单跳事实的直接块检索、用于比较和聚合的跨页面导航,以及用于跨页面分散证据的多跳实体推理。通过仅检索结构相关的证据,这种路由避免了使图 RAG 成本高昂的过大全局上下文。

**可验证的答案来源。** 每个被引用的块都携带其来源页面、标题路径和实体链接。用户可以点击引用来检查声明背后的精确页面上下文,跟随连接人员、项目、课程和页面的图路径,并一目了然地看到答案是来自一个页面还是多个页面。

**演示(第 3 节 (https://arxiv.org/html/2607.08269#S3))。** 我们将提供 PolyUQuest 在机构网页上的引导式演示,涵盖带引用答案检查、引导式检索轨迹和基于图的证据探索。参与者可以提问、检查每个答案背后的来源块和页面、比较不同模式下的检索轨迹,并探索支撑结果的图路径。

## 2. PolyUQuest 系统

参见图注图 1\. PolyUQuest 框架概览PolyUQuest 的整体架构,包括离线索引、三层异构图构建、查询路由和在线检索。本节描述离线索引(§2.1 (https://arxiv.org/html/2607.08269#S2.SS1))、在线检索(§2.2 (https://arxiv.org/html/2607.08269#S2.SS2))和完整工作流程(§2.3 (https://arxiv.org/html/2607.08269#S2.SS3))。

### 2.1. 离线索引

**三层异构图。** PolyUQuest 将网站 W 建模为一个异构图 G_W = (V, E),其中 V = V_P ∪ V_B ∪ V_E ∪ V_T 包含网页、证据块、实体和主题节点 (Wang et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib26); Peng et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib36); Huang et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib2))。边集 E 捕获了四类连接:页面-页面超链接、页面-块包含关系、块-实体提及以及实体与主题之间的语义关联。每个证据块节点 b ∈ V_B 都附有其来源页面 p(b)、标题路径 h(b)、块嵌入 x_b、长度 l(b) 以及提及的实体子集 V_E(b) ⊆ V_E。
**第 1 层(站点图):** 超链接捕获网页如何指向彼此。
**第 2 层(块树):** 页面内容被组织为标题感知的文本块,保留了本地文档层级结构。
**第 3 层(实体图):** 提取的实体连接到其源块、相关实体和主题。这些层允许系统从一个实体移动到它出现的证据块,然后在需要跨页面证据时移动到包含它的页面和相邻页面。

**块树构建。** 遵循 HTML 感知研究 (Tan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib32); Lin et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib13)),我们的系统从原始 HTML 中移除非内容区域(如脚本、样式定义、嵌入框架和注释),同时保留有用的文本、超链接和可访问性信息。一个自底向上的算法遍历清理后的 DOM 树,合并兄弟子树,直到一个块达到可配置的单词阈值,采用粒度可调的块树构建。我们将此单词大小设置为 150 个词,遵循 (Tan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib32); Guo et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib33))。表格、列表和预格式化代码被视为原子单元,不能从中间拆分。每个保留的块继承其周围的章节标题,这是一种紧凑的表示,在不存储完整 DOM 树的情况下捕获页面层级结构。重复的样板区域(如导航栏、页脚和 Cookie 通知)在块嵌入之前被过滤掉。

**实体提取与解析。** LLM 使用一小套与网站相关的实体类型(如人员、项目、院系、课程和研究主题)从每个页面的块中提取实体和关系 (Han et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib22); Huang et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib14); Hashemi and Lakshmanan, 2025 (https://arxiv.org/html/2607.08269#bib.bib25))。每次提取都链接回源块,从而实现细粒度的来源追溯。因为同一个人、项目或院系可能以缩写、别名或略有不同的页面标题出现,PolyUQuest 在将提取的提及添加到图之前会先解析它们。它首先规范化明显的别名,并使用权威页面作为锚点,然后将剩余候选项与组合的语义和字符串相似度分数合并;对于边界情况,使用 LLM 进行决策。

### 2.2. 在线结构感知检索

PolyUQuest 根据查询所需的结构将在线检索组织为三种模式:模式 A 用于直接事实查找,模式 B 用于跨链接页面导航,模式 C 用于基于实体的多跳推理 (Ye et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib20); Yu et al., 2025a (https://arxiv.org/html/2607.08269#bib.bib7))。路由器在这些模式之间进行选择,然后选定的检索路径组装带引用的证据,用于答案生成。

**双层路由器。** 给定用户查询 q 及其嵌入 x_q,路由器分两层对其进行分类。第一层轻量级规则处理无歧义的结构信号:“哪些教授”触发模式 C,“录取要求”触发模式 B,比较模式如“X 和 Y 的区别”映射到模式 B 进行跨页面聚合。不匹配任何启发式的查询传递给第二层 LLM 分类器,该分类器将查询分配至三种模式之一并给出置信度分数。这种设计使常见模式上的路由延迟保持较低,同时将长尾查询委托给 LLM。

**模式 A:直接块检索。** 对于单跳事实问题,例如“人工智能硕士的学费是多少?”,系统分两个阶段检索候选项。第一阶段通过结合基于 x_b 的密集近似最近邻搜索与 BM25 稀疏检索来构建候选块集合 B_q,捕获语义和词汇信号 (Li et al., 2025c (https://arxiv.org/html/2607.08269#bib.bib10); Yu et al., 2025b (https://arxiv.org/html/2607.08269#bib.bib19))。此模式将每个标题感知块作为基本证据单元,因此适用于答案可能位于一个页面章节内的情况。然后,交叉编码器重排序器通过联合关注查询、块文本、其来源页面 p(b) 和标题路径 h(b) 来重新评分 B_q 中的块。在答案生成之前,顶部块被丰富以父块内容,这有助于为引用保留本地上下文。

**模式 B:导航检索。** 对于跨页面的聚合查询,例如比较两个项目,系统通过 LLM 将查询分解为子查询。对于每个子查询,它首先检索相关页面,然后在站点图中扩展到附近的链接页面。候选集 B_q 随后从发现的页面上的证据块中组装。这种扩展对于大学网站和其他结构化网页集合非常重要,因为概览页面通常链接到独立的费用、录取、截止日期或联系方式页面 (Chen et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib27); Wang et al., 2024 (https://arxiv.org/html/2607.08269#bib.bib26); Choi et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib18))。一个整体性的交叉编码器重排序在最终合成之前对所有跨子查询的候选项进行评分,使答案生成器能够在共享上下文下比较来自多个页面的证据。

**模式 C:实体推理。** 对于需要多跳的查询,例如“哪些教授研究 NLP 并教授相关课程?”,系统首先通过 LLM 提取主题关键词,然后遵循两条互补的证据路径。第一条路径检索候选实体并通过实体关系进行扩展。第二条路径检索主题关键词并扩展到与这些主题相关的实体。总之,这些路径识别与查询相关的实体节点 V_E,q ⊆ V_E,系统将它们回溯到提及它们的源块 (Quan et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib23); Li et al., 2025d (https://arxiv.org/html/2607.08269#bib.bib3); Peng et al., 2025 (https://arxiv.org/html/2607.08269#bib.bib36); Li et al., 2025b (https://arxiv.org/html/2607.08269#bib.bib16))。此模式专为证据分散在多个页面上的问题而设计。使用候选块 B_q,模式 C 按以下公式对每个块 b 进行排名:

\(1\) \(s(b, q) = \cos(\mathbf{x}_q, \mathbf{x}_b) + \frac{\min(|V_E(b) \cap V_{E,q}|, \kappa)}{\kappa} + (1 - \frac{\ell(b)}{\max_{b' \in B_q} \ell(b')})\).

相似文章