TRACE:可信检索增强对话引擎
摘要
TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。
arXiv:2608.10176v1 公告类型:新
摘要:公共服务聊天机器人应当从底层公共服务目录中提供推荐,同时确保推荐符合用户的明确约束。然而在实际中,公共服务目录往往嘈杂且不一致,通用大语言模型(LLM)或基于AI的聊天机器人经常生成不可靠的推荐,引用来自网络的不明来源。我们研究了检索质量对基于嘈杂且异构服务目录构建的公共服务对话系统中约束感知推荐的影响。我们提出 TRACE(可信检索增强对话引擎,Trustworthy Retrieval-Augmented Conversational Engine),一个基于检索的约束感知框架,借助双数据表示模式,将输入的用户查询解析为结构性和语义约束,用于下游检索。通过使用一个精心整理的全州食品储藏室目录和合成查询基准,我们评估了多种知识表示变体(包括有无知识图谱(KG)的情况)。我们实验了多个开源LLM和一个专有模型,结果表明增强检索能显著提高用户约束满意度,同时减少幻觉推荐。在我们的实验中,随着检索质量的提升,不同LLM之间的性能差距缩小,结果对模型大小的敏感度降低。这些发现表明,检索质量对于构建稳健的公共服务对话系统至关重要。
查看缓存全文
缓存时间: 2026/08/12 08:21
###### 摘要
公共部门服务聊天机器人应当从底层公共部门服务目录中提供推荐,同时还要确保推荐满足用户的明确约束。实际上,公共部门服务目录往往存在噪声且格式不一致,通用大语言模型(LLM)或基于 AI 的聊天机器人经常会生成不可靠的推荐,并引用来自网络的未经核实来源。我们研究了在基于噪声和异构服务目录构建的公共部门对话系统中,检索质量对约束感知推荐的影响。我们提出了 TRACE(Trustworthy Retrieval-Augmented Conversational Engine,可信检索增强对话引擎),一种基于检索的、约束感知的框架,它借助双重数据表示模式,将输入的用户查询解析为结构约束和语义约束以供下游检索使用。通过精心整理的州级食品库目录和合成查询基准,我们评估了多种知识表示变体(有/无知识图谱)。我们实验了多个开源 LLM 和一个专有模型,结果表明,强化检索能够显著提高用户约束满意度,同时减少幻觉推荐。在我们的实验中,随着检索质量的提高,不同 LLM 之间的性能差异显著缩小,使得结果对模型大小的敏感度降低。这些发现表明,检索质量是构建稳健的公共部门对话系统的关键。
信息检索,大语言模型,知识图谱,检索增强生成,公共服务推荐。
## 1. 引言
公共部门对话系统通常是基于目录的系统,即它们通过从底层公共部门服务目录中检索候选服务提供者来回答用户请求(Dow 等,2018 (https://arxiv.org/html/2608.10176#bib.bib10))。这些聊天机器人应当从目录中提供可靠的推荐(例如,去哪里获取食品援助),同时满足用户的明确约束,如位置、营业时间和资格要求(Larsen and Følstad, 2024 (https://arxiv.org/html/2608.10176#bib.bib14); Van Noordt and Misuraca, 2019 (https://arxiv.org/html/2608.10176#bib.bib9))。实际上,这些约束往往难以满足,因为公共部门服务目录通常存在噪声且格式不一致(Dow 等,2018 (https://arxiv.org/html/2608.10176#bib.bib10); Cherry, 2002 (https://arxiv.org/html/2608.10176#bib.bib11))。因此,通用大语言模型(LLM)或 AI 驱动的聊天机器人可能会通过引用未经核实的来源或隐式违反用户约束来生成不可靠的推荐(Dreyling 等,2024 (https://arxiv.org/html/2608.10176#bib.bib12))。在对商用 LLM 聊天机器人(如 ChatGPT)的初步试验中,我们观察到在明确约束下尤其容易出现目录外推荐,并偶尔依赖未经核实的网络来源(Kleiman and Barbosa, 2025 (https://arxiv.org/html/2608.10176#bib.bib13))。在社区援助场景中,这些失败代价尤其高昂,因为用户依赖系统获得可靠且有时效性的指导。
这些失败指向一个根本性缺口:如果无法在权威目录上进行可靠检索,即使是强大的 LLM 也无法在公共服务场景中交付可信推荐。我们的前提是:*该领域的生成质量在很大程度上取决于检索质量*:如果系统能够可靠地检索到一小批满足用户约束的候选,LLM 的作用主要是综合证据来生成回复,而不是“编造”新的推荐。为了将这一理念落地,我们提出了 TRACE(Trustworthy Retrieval-Augmented Conversational Engine,可信检索增强对话引擎),一种在 LLM 生成回复之前依赖稳健检索的约束感知框架。我们在一个基于精心整理目录构建的真实食品库数据集上评估了该框架。我们还开发了一个由约束驱动的用户查询合成基准,并带有参考答案。我们的评估在相同的检索设置下比较了多种知识表示变体(有/无知识图谱)和多个 LLM,衡量约束满足度和数据集外幻觉率。结果支持了这样一个观点:检索质量是可靠公共部门对话访问的主要杠杆。通过 TRACE,我们的主要贡献如下:
- • 双重表示、约束感知的检索框架。一个检索优先的流水线,将用户约束显式解析为:(i) 通过知识图谱实现的结构约束,以及 (ii) 通过文本实现的语义约束。这种双重表示将 LLM 回复生成锚定在目录记录中,并减少了目录外推荐。
- • 面向对话检索的知识图谱(KG)结构消融。我们系统地将多种知识图谱表示与无 KG 基线进行比较,并报告检索及端到端可靠性指标。
- • 跨 LLM 的检索中心鲁棒性。在固定检索流水线下,我们评估了 15 个开源 LLM 和一个专有模型,表明在公共服务目录场景中,更强的检索显著缩小了 LLM 之间的性能差异(无论模型大小)。
## 2. 相关工作
参见说明
图 1:TRACE(Trustworthy Retrieval-Augmented Conversational Engine)框架概览。
**约束感知的对话系统。**任务型对话将用户请求视为必须填充的结构化槽位(如位置、时间、资格),以满足信息需求(Cohen, 2019 (https://arxiv.org/html/2608.10176#bib.bib22); Louvan and Magnini, 2020 (https://arxiv.org/html/2608.10176#bib.bib15))。最近,对话式信息检索(IR)社区强调系统必须 (i) 解释未明确指定的查询(Malaviya 等,2025 (https://arxiv.org/html/2608.10176#bib.bib19)),(ii) 在关键约束缺失时提出澄清问题(Zamani 等,2020 (https://arxiv.org/html/2608.10176#bib.bib20); Majumder 等,2021 (https://arxiv.org/html/2608.10176#bib.bib21)),以及 (iii) 在整个对话过程中保持约束一致性(Gao 等,2020 (https://arxiv.org/html/2608.10176#bib.bib16))。先前关于澄清问题生成和对话式搜索的研究表明,显式识别缺失的方面并引导用户补充它们,比直接猜测或返回松散相关的结果更有价值(Tavakoli, 2020 (https://arxiv.org/html/2608.10176#bib.bib17); Sekulić 等,2021 (https://arxiv.org/html/2608.10176#bib.bib18))。
**可靠的公共服务问答(QA)。**公共服务助手面临独特的可靠性要求:答案应当基于经过验证的目录,而不是从开放网络来源生成(Hasan 等,2026 (https://arxiv.org/html/2608.10176#bib.bib40); Arends and Mawela, 2024 (https://arxiv.org/html/2608.10176#bib.bib23); Stamatis 等,2020 (https://arxiv.org/html/2608.10176#bib.bib24))。基于文档的对话基准如 doc2dial(Feng 等,2020 (https://arxiv.org/html/2608.10176#bib.bib25))和 MultiDoc2Dial(Feng 等,2021 (https://arxiv.org/html/2608.10176#bib.bib26))将这一设定形式化,要求系统从文档中检索支持证据来生成答案。与此同时,近期工作表明,通用 LLM 会产生流畅但不正确的陈述,并自信地呈现没有依据的论断,这进一步凸显了显式溯源和验证的必要性(Tripathi 等,2025 (https://arxiv.org/html/2608.10176#bib.bib28))。这些发现在社区援助场景中尤其相关,因为未经核实的推荐会直接降低信任度和实用性(Aoki, 2020 (https://arxiv.org/html/2608.10176#bib.bib27); Zhou 等,2025 (https://arxiv.org/html/2608.10176#bib.bib29))。
**用于检索的知识图谱(KG)。**KG 已被广泛研究,用于组织实体和关系以支持搜索和问答(Huang 等,2019 (https://arxiv.org/html/2608.10176#bib.bib30); Khan, 2023 (https://arxiv.org/html/2608.10176#bib.bib31))。在 IR 中,以实体为中心的表示和图结构支持精确过滤,并减少错误实体检索(Reinanda 等,2020 (https://arxiv.org/html/2608.10176#bib.bib32); Dietz 等,2018 (https://arxiv.org/html/2608.10176#bib.bib33))。在 QA 中,混合方法将图遍历与文本相结合,以同时处理关系约束和自由文本细节(Agarwal 等,2025 (https://arxiv.org/html/2608.10176#bib.bib34); Polignano 等,2021 (https://arxiv.org/html/2608.10176#bib.bib35)),近期的“图增强”检索框架使用图结构在排序证据之前指导候选选择(Li 等,2025 (https://arxiv.org/html/2608.10176#bib.bib36); Yu 等,2026 (https://arxiv.org/html/2608.10176#bib.bib37); Zhu 等,2025 (https://arxiv.org/html/2608.10176#bib.bib38); Xu 等,2024 (https://arxiv.org/html/2608.10176#bib.bib39))。
**我们工作的独特性。**虽然先前工作已经研究了 (i) 引导缺失槽位和约束的对话系统,(ii) 基于文档的 QA 以减少无依据答案,以及 (iii) 用于检索和混合 QA 的 KG 表示,但它们很少在用户提出明确约束且错误推荐代价高昂的公共服务目录场景中被放在一起评估。我们的工作有三方面不同。第一,我们将公共服务援助定义为约束感知的对话式检索,并实现了一个双重约束流水线,以强化证据检索和候选核查。第二,我们没有假设固定的 KG 模式,而是针对公共服务数据进行了 KG 结构消融,量化表示选择如何影响检索质量。第三,我们通过评估多个 LLM 来研究“检索在该场景下主导生成”这一假设。
## 3. 提出的框架
如图 1 (https://arxiv.org/html/2608.10176#S2.F1) 所示,我们提出了 TRACE(Trustworthy Retrieval-Augmented Conversational Engine,可信检索增强对话引擎),用于公共服务对话式搜索。给定一个用户查询,TRACE (a) 提取结构约束;如果没有结构约束,则提出澄清问题;(b) 检索满足约束的 top-k 候选集;(c) 对检索到的候选执行语义过滤;(d) 如果没有候选满足语义约束,则获取下一批 top-k 候选。一旦语义约束得到满足,TRACE 基于检索到的候选集生成最终回复。
### 3.1 解析用户约束
该框架围绕两类约束设计:(i) 结构约束和 (ii) 语义约束。给定输入用户查询 \(q\),我们提取:
- 结构约束 \(C_s\):需要精确执行的属性(例如,城市/县/ZIP)。这些约束定义了候选空间,并采用严格的 AND 语义进行求值。当 \(q\) 中不存在结构约束时,系统会提出有针对性的澄清问题(例如,“您附近的 ZIP、城市或县是什么?”)以获取结构约束。
- 语义约束 \(C_m\):以自然语言表达,通常出现在非结构化文本字段中(例如,资格要求)。这些约束通过从候选文本字段中检索到的证据进行检查。
示例:对于查询“Show me pantries in Sedgwick County that need ID” (q),我们提取结构约束 \(C_s=\{\text{county}=\text{Sedgwick County}\}\) 和语义约束 \(C_m=\{\text{need ID}\}\)。我们首先使用 \(C_s\) 查询 KG 检索候选,然后根据候选的资格字段中的文本证据验证 \(C_m\)。
### 3.2 双重知识表示
我们构建公共服务目录的双重表示:
1. (1) 知识图谱(结构视图):每个服务提供者(如食品库)都链接到结构化实体(如城市、县、ZIP)。我们将多种知识图谱(KG)变体作为消融,与无 KG 基线进行比较。
2. (2) 向量嵌入(语义视图):对每个提供者,我们保留非结构化字段(如资格要求)。这些字段被嵌入以支持语义检索。
### 3.3 检索与约束检查
给定用户查询 \(q\),系统分两个阶段进行:
#### 阶段 1:候选生成(结构过滤)。
使用 \(C_s\),我们查询图以检索 top-k 候选集:
\[
\mathcal{P}_k = \mathrm{TopK}\big(\{p\in\mathcal{P}\mid p \models C_s\}\big),
\]
其中 \(p \models C_s\) 表示 \(p\) 满足*所有*结构约束。
#### 阶段 2:基于证据的语义过滤(在检索到的候选内)。
我们用语义约束过滤检索到的候选 \(\mathcal{P}_k\):
\[
\mathcal{P}_k^{\text{sem}} = \{\, p\in\mathcal{P}_k \mid \mathrm{check}(p,C_m)=1 \,\}.
\]
这里,\(\mathrm{check}(p,C_m)\) 是一个语义约束检查器,基于从候选文本字段检索到的证据计算得出。如果 \(\mathcal{P}_k^{\text{sem}}=\emptyset\),则获取下一批 top-k 候选并重复*阶段 2*。
## 4. 实验设置
### 4.1 数据集构建
我们在一个经过整理的食品库目录上评估,其中包含约 800 个食品库,具有结构化字段(名称、地址、城市、县、ZIP 码、电话、营业时间)和非结构化字段(资格要求)。我们使用一个公开可用的堪萨斯州目录[^1],因为它提供全州覆盖并可访问经过验证的食品库列表。该流水线适用于任何公共服务目录,并可扩展到其他领域(如诊所、庇护所、交通服务)。在评估中,该目录被视为本研究中唯一期望的信息来源;任何不在该数据集中出现的内容都被计为数据集外幻觉。
### 4.2 知识图谱变体
为了研究通过知识图谱(KG)进行的知识表示如何影响检索,我们比较以下变体:
- KG-0(无 KG 基线):仅对食品库进行文本索引。
- KG-1(位置 KG):一个位置建模图,将 Pantry 节点连接到 City/County/Zipcode。
- KG-2(营业时间 KG):一个将 Pantry 连接到 Hours 的图。
- KG-3(位置 + 营业时间 KG):一个同时包含位置和营业时间关系的组合图(KG-1 + KG-2)。
### 4.3 查询基准与参考答案
我们构建了一个包含 1,000 个用户查询的合成基准,以反映常见的公共服务信息需求。查询分为五类(见表 1 (https://arxiv.org/html/2608.10176#S4.T1)):(i) 仅地点请求(城市/县/ZIP),(ii) 资格问题(ID),(iii) 营业时间查询(星期/时间),(iv) 召回式查询(提及特定食品库名称),以及 (v) 将地点与资格和/或营业时间约束相结合的查询。在评估中,我们通过以下方式得出基于目录的“黄金”答案:(1) 针对查询中的结构约束,对食品库目录应用严格的结构过滤;(2) 返回 top 候选作为参考上下文。
[^1]: Kansas Food Source. Find Food in the Sunflower State. https://kansasfoodsource.org/相似文章
TRACE: 基于时间证据图的对话数据状态感知查询处理
本文提出 TRACE,一种查询处理框架,将对话数据建模为时间证据图,以支持对不断演进的用户状态进行状态感知推理,从而提高长对话问答中的时间推理和多跳推理能力。
MTR-Suite:一个用于评估和合成对话检索基准的框架
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。
我构建了一个信任引擎,帮助AI智能体逐步实现自主运行
一个开源信任引擎(测试版),帮助AI智能体从引导模式逐步过渡到协同工作再到自主状态,具备决策理由记录和人在回路审批功能,目前正在寻找早期采用者。
TRACER:面向任务型对话的早期失败检测
TRACER通过分析部分对话,利用信念状态变化和文本表示预测任务型对话是否会失败,从而在全面崩溃之前发出早期预警。
与您协同进步:将用户修正编译为编码代理的运行时强制
TRACE 是一个技能层管道,通过从交互式编码代理中挖掘用户修正,编译为运行时检查,在减少重复偏好违反方面显著优于仅靠记忆,这一点在 ClawArena 和 MemoryArena 任务中得到验证。