ShopEase: 基于生成式AI的多智能体框架,用于智能企业客户支持,采用混合检索增强生成
摘要
本文介绍了ShopEase,这是一个基于生成式AI的多智能体框架,用于企业客户支持,采用混合检索增强生成。研究评估了检索配置,发现使用FAISS的稠密检索实现了最佳准确率。
arXiv:2609.13856v1 公告类型:新
摘要:企业客户支持系统必须正确回答客户问题,检索正确的政策信息,使用客户上下文,并在需要时将困难案例转交给人工客服。本文介绍了ShopEase,这是一个基于生成式AI的多智能体框架,用于企业客户支持。系统结合了六个组件:Intent、CRM、Memory、Hybrid RAG、Escalation和Supervisor,使用本地运行的LLaMA 3.2通过Ollama进行响应生成。检索模块结合了FAISS(稠密检索)和BM25(稀疏检索),并评估了六种配置:BM25-only、FAISS-only、Fair RRF、Weighted RRF、带Cross-Encoder的RRF和Top-10 Hybrid带Cross-Encoder。系统没有使用意图和政策之间的固定映射,而是直接从检索文档中决定政策类别。在2632个保留的客户查询上对系统进行了评估,涵盖六个类别:Refund、Return、Shipping、Cancellation、Damaged Product和Unknown。FAISS-only达到了85.37%的最高准确率(2247个正确预测),其次是Weighted RRF的85.07%。BM25-only仅达到55.74%的准确率。添加Cross-Encoder重排序没有改善结果:带Cross-Encoder的RRF达到83.24%,Top-10 Hybrid带Cross-Encoder达到81.88%,同时增加了响应延迟。类别分析显示,在Shipping、Cancellation和Return上表现强劲,而Unknown查询仍是主要错误来源。使用McNemar检验的统计测试显示FAISS-only和Weighted RRF之间没有显著差异,尽管两者都显著优于Fair RRF和Cross-Encoder配置。总体而言,在该数据集上,稠密检索提供了最佳准确率,而额外的重排序增加了处理时间,但没有改善分类性能。
查看缓存全文
缓存时间: 2026/09/15 08:44
# ShopEase:基于生成式AI的智能企业客户支持多智能体混合检索增强生成框架 来源:https://arxiv.org/html/2609.13856 期刊:专家系统及其应用 Aakash Kumar Tiwari 邮箱:[tiwariaakash1025@kgpian\.iitkgp\.ac\.in](mailto:[email protected])通讯作者:通讯作者\.地址:印度西孟加拉邦哈拉格普尔,印度理工学院哈拉格普尔分校数学系 Somesh Kumar 邮箱:[smsh@maths\.iitkgp\.ac\.in](mailto:[email protected])地址:印度西孟加拉邦哈拉格普尔,印度理工学院哈拉格普尔分校数学系 ###### 摘要 企业客户支持系统必须正确回答客户问题、检索正确的政策信息、利用客户上下文,并在需要时将疑难案例转交人工客服。本文提出了ShopEase,一个基于生成式AI的企业客户支持多智能体框架。该系统结合了六个组件:意图识别、CRM、记忆、混合检索增强生成、问题上报和监督器,并使用通过Ollama本地运行的LLaMA 3.2进行响应生成。检索模块结合了FAISS(稠密检索)和BM25(稀疏检索),并评估了六种配置:仅BM25、仅FAISS、公平倒数排名融合、加权倒数排名融合、带交叉编码器的倒数排名融合、以及带交叉编码器的Top-10混合检索。系统未采用意图与政策间的固定映射,而是直接从检索到的文档中确定政策类别。该系统在2632个保留的客户查询(涵盖退款、退货、物流、取消、商品损坏和未知六类)上进行了评估。仅FAISS实现了最高的85.37%准确率(2247次正确预测),加权倒数排名融合以85.07%的准确率紧随其后。仅BM25仅达到55.74%的准确率。增加交叉编码器重排序并未提升效果:带交叉编码器的倒数排名融合达到83.24%,带交叉编码器的Top-10混合检索达到81.88%,同时还增加了响应延迟。类别层面分析显示系统在物流、取消和退货类别表现强劲,而未知类别查询仍是主要的错误来源。使用麦克尼马尔检验进行的统计测试表明,仅FAISS与加权倒数排名融合之间无显著差异,但两者均显著优于公平倒数排名融合及交叉编码器配置。总体而言,在该数据集上,稠密检索提供了最佳准确率,而额外的重排序增加了处理时间,却未改善分类性能。 ###### 关键词: 企业客户支持,生成式AI,多智能体系统,检索增强生成,混合检索,大型语言模型,人机协同 ## 1引言 企业客户支持系统需要正确回答客户问题,并在交互过程中使用相关客户信息。传统的聊天机器人系统能够处理常见问题,但当查询需要政策信息、客户历史记录、先前对话上下文或人工支持时,它们可能会遇到困难。最近的一项关于客户支持聊天机器人的综述也表明,聊天机器人系统已被广泛研究用于改善客户服务和客户满意度[14 (https://arxiv.org/html/2609.13856#bib.bib1)]。然而,一个完整的企业支持系统需要的不仅仅是响应生成。检索增强生成被广泛用于在响应生成期间为语言模型提供外部信息[11 (https://arxiv.org/html/2609.13856#bib.bib4)]。稠密检索方法如DPR使用向量表示来查找语义相关的文档[10 (https://arxiv.org/html/2609.13856#bib.bib23)],而BM25使用查询和文档之间的词汇匹配[15 (https://arxiv.org/html/2609.13856#bib.bib7)]。这些方法各有优势。稠密检索可以处理不同的措辞,而词汇检索在重要术语直接与政策文本匹配时表现良好。检索增强生成研究还探索了如自我检索和纠正性检索等方法,以提高检索信息的质量[1 (https://arxiv.org/html/2609.13856#bib.bib19), 20 (https://arxiv.org/html/2609.13856#bib.bib20)]。然而,这些方法主要关注检索和生成过程,而非完整的企业客户支持工作流。多智能体系统提供了将复杂任务分解为更小组件的另一种方式。近期研究探讨了使用多个智能体进行查询解决和其他AI任务[18 (https://arxiv.org/html/2609.13856#bib.bib14)]。AutoGen等框架也展示了多个语言模型智能体如何协同工作以解决任务[19 (https://arxiv.org/html/2609.13856#bib.bib21)]。但是,客户支持系统还可能需要访问客户记录、先前对话、政策文档和人工干预。这些需求并非总能在单一工作流中得到处理。当查询无法被安全或正确地自动处理时,人工参与对客户支持系统也至关重要。人机协同AI将人类决策纳入AI系统[23 (https://arxiv.org/html/2609.13856#bib.bib2)]。类似地,基于智能体的系统也通过多智能体协作处理复杂任务而受到研究[9 (https://arxiv.org/html/2609.13856#bib.bib16), 7 (https://arxiv.org/html/2609.13856#bib.bib17)]。这些研究启发我们使用多个专门化组件,而不是依赖单一的语言模型。 ### 1\.1研究空白 现有研究通常只关注客户支持问题的一个或两个部分,例如聊天机器人响应生成、检索增强生成、多智能体系统或人机协同处理。需要一个能够将这些组件与客户信息和对话记忆相结合,并在相同实验设置下评估不同检索策略的系统。另一个重要问题是政策分类。客户查询中使用的词语可能与相应政策文档的措辞不同。同时,某些政策可能包含相似的术语。因此,仅依赖词汇匹配或意图与政策间的固定映射可能会产生错误的结果。对词汇、稠密、混合以及基于重排序的检索方法进行比较,可以更清晰地了解它们在企业政策检索中的性能表现。 ### 1\.2动机 本工作的主要动机是构建一个客户支持系统,该系统在生成响应前能够利用不同来源的信息。客户信息可以从CRM数据库获取,先前的消息可以提供对话上下文,而政策文档则可以提供所需的企业信息。然后,这些输入可以由生成式AI模型使用以产生最终响应。基于此动机,我们开发了ShopEase,一个结合了客户上下文、对话记忆、政策检索、响应生成和问题上报的多智能体客户支持框架。该系统使用FAISS和BM25进行检索,并评估了这些方法的不同组合。研究还考察了额外的倒数排名融合和交叉编码器阶段是否能提高最终的政策分类准确性。 ### 1\.3研究贡献 本工作的主要贡献包括: - 1.我们开发了ShopEase,一个基于生成式AI的企业客户支持多智能体框架,它结合了客户上下文、对话记忆、政策检索、响应生成和问题上报功能。 - 2.我们实现并比较了六种检索配置:仅BM25、仅FAISS、公平倒数排名融合、加权倒数排名融合、带交叉编码器的倒数排名融合以及带交叉编码器的Top-10混合检索。 - 3.我们在一个包含2632个客户查询(涵盖退款、退货、物流、取消、商品损坏和未知六类)的保留数据集上评估了这些检索配置。 - 4.我们使用准确率、正确与错误预测、类别层面性能、混淆矩阵、延迟和统计显著性检验对结果进行了分析。 - 5.我们通过组件消融实验研究了移除CRM、记忆和上报组件的影响。 论文的其余部分描述了相关工作、提出的方法论、系统架构、实验设置、结果、局限性以及未来工作。 ## 2文献综述 客户支持、检索增强生成和多智能体系统领域的近期研究表明,语言模型可用于处理复杂的用户查询。然而,这些领域大多被分开研究。本节回顾了与ShopEase相关的主要方法。 ### 2\.1企业客户支持系统 客户支持聊天机器人已被广泛研究,用于提高服务质量并减轻支持人员的工作负担。Rahman等人对聊天机器人在客户服务中的应用进行了系统性综述,并讨论了其在客户交互和满意度方面的应用[14 (https://arxiv.org/html/2609.13856#bib.bib1)]。这些系统可以处理常见的客户问题,但企业支持通常需要访问客户记录、订单信息、公司政策和先前的对话。大型语言模型提高了聊天机器人理解和生成自然语言的能力。GPT-3展示了大型语言模型通过上下文学习执行不同语言任务的能力[3 (https://arxiv.org/html/2609.13856#bib.bib9)]。LLaMA 3进一步提供了可用于本地语言模型应用的开源模型[5 (https://arxiv.org/html/2609.13856#bib.bib8)]。然而,仅凭语言模型可能无法访问最新的企业信息。这就产生了对外部知识检索的需求。 ### 2\.2检索增强生成 检索增强生成将信息检索与语言生成相结合。Lewis等人引入了RAG作为一种检索外部文档并在生成过程中使用它们的方法[11 (https://arxiv.org/html/2609.13856#bib.bib4)]。这种方法有助于语言模型使用其模型参数中未包含的信息。稠密检索将查询和文档表示为向量,并基于语义相似性检索文档。稠密段落检索是这种重要的方法示例[10 (https://arxiv.org/html/2609.13856#bib.bib23)]。FAISS为稠密向量的相似性搜索提供了高效的方法[8 (https://arxiv.org/html/2609.13856#bib.bib6)]。词汇检索直接使用查询和文档中的词语。BM25是一种广泛使用的基于词频和逆文档频率的词汇检索方法[15 (https://arxiv.org/html/2609.13856#bib.bib7)]。当查询中的重要术语直接匹配文档文本时,这类信息检索方法仍然有用[12 (https://arxiv.org/html/2609.13856#bib.bib13)]。近期的检索增强生成方法增加了额外步骤以提高检索质量。自我检索在生成过程中使用检索和自我反思[1 (https://arxiv.org/html/2609.13856#bib.bib19)],而纠正性检索在检索信息不足时添加纠正步骤[20 (https://arxiv.org/html/2609.13856#bib.bib20)]。Gao等人对检索增强生成方法及其主要设计选择进行了更广泛的综述[6 (https://arxiv.org/html/2609.13856#bib.bib22)]。这些工作展示了检索质量的重要性,但它们并未直接解决ShopEase所使用的完整客户支持工作流。 ### 2\.3多智能体系统 多智能体系统将复杂任务分配给多个智能体或组件。早期的多智能体系统研究探讨了不同智能体如何协作解决问题[9 (https://arxiv.org/html/2609.13856#bib.bib16)]。近期研究将这一思想扩展到大型语言模型。Wang等人研究了用于查询解决的多智能体方法,而He等人则回顾了大型语言模型在多智能体系统中的应用[18 (https://arxiv.org/html/2609.13856#bib.bib14), 7 (https://arxiv.org/html/2609.13856#bib.bib17)]。AutoGen等框架为协调多个语言模型智能体提供了机制[19 (https://arxiv.org/html/2609.13856#bib.bib21)]。ReAct结合了推理和行动,允许语言模型与外部工具交互[22 (https://arxiv.org/html/2609.13856#bib.bib10)]。Toolformer也探索了语言模型对外部工具的使用[16 (https://arxiv.org/html/2609.13856#bib.bib11)]。这些方法表明,分离任务和使用外部工具可以提高语言模型系统处理复杂任务的能力。对于企业客户支持,不同的任务可以分离到专门化的组件中。例如,一个组件可以识别客户请求,另一个可以检索客户信息,还有一个可以检索所需的政策信息。ShopEase遵循这一思想,为意图识别、CRM、记忆、检索、上报和流程控制使用专门化的智能体。 ### 2\.4人机协同系统 完全自动化的客户支持并不适合所有情况。某些查询可能由于其复杂性、不确定性或客户特定要求而需要人工审核。人机协同AI将人类决策作为AI工作流的一部分[23 (https://arxiv.org/html/2609.13856#bib.bib2)]。这一思想也适用于智能体AI系统,即智能体在做出最终决定之前可能会执行多个操作[13 (https://arxiv.org/html/2609.13856#bib.bib15), 2 (https://arxiv.org/html/2609.13856#bib.bib18)]。在ShopEase中,上报智能体在自动解决不适用时提供了一条人机协同的路径。这使得系统能够同时支持自动处理和人工干预。 ### 2\.5客户信息与对话记忆 客户支持通常需要当前查询之外的信息。客户资料、订单历史、客户等级和先前的投诉都可能影响查询的处理方式。同样,先前的消息可以为当前交互提供有用的上下文。因此,记忆对于在对话中保持信息非常重要。在多智能体系统中,客户信息和对话历史可以在生成最终响应之前提供给相关的智能体。ShopEase包含单独的CRM和记忆组件来处理这两种上下文信息来源。 ### 2\.6现有方法对比 所回顾的研究解决了客户支持和检索问题的不同方面。有些专注于客户支持聊天机器人,而另一些则研究检索、多智能体系统或人机协同AI。表1(https://arxiv.org/html/2609.13856#S2.T1)使用与所提系统相关的主要组件,将这些方法与ShopEase进行了比较。 表1:现有方法与ShopEase的对比 此处,“–”表示相应的能力在被引作品中未报告或未涉及。比较基于被引研究中讨论的能力。比较表明,现有研究主要解决了问题的各个部分。客户支持研究专注于支持交互,检索增强生成研究专注于外部知识检索,多智能体研究专注于任务协调,人机协同研究则专注于人工参与。ShopEase在一个客户支持工作流中将这些组件与客户信息和对话记忆相结合。除了结合这些组件外,ShopEase还在相同的保留数据集上评估了六种检索配置。这提供了在相同的企业客户支持场景下对BM25、FAISS、倒数排名融合和基于交叉编码器检索的直接比较。
相似文章
迭代优化搜索:用于评估电商中智能搜索架构的双智能体模拟框架
eBay的这篇论文提出了一个模块化的双智能体模拟框架,用于评估对话式购物助手架构,能够对响应器设计进行受控比较。关键发现包括:滚动窗口内存在速度上比意图提取内存快35%,系统性故障分析将故障率降低了62%。
适应不断变化的需求:用于零售供应链运营的代理AI
本文提出了一种图约束的代理AI框架,利用大型语言模型适应零售供应链运营的不断变化需求,并在与零售合作伙伴的评估中显示,与直接LLM重构相比,提高了正确性和端到端成功率。
用于自动化企业分析和洞察生成的多代理平台
本文提出了一种基于CrewAI构建的多代理框架,用于自动化对话式商业智能。该框架使用五个专门的AI代理来处理查询、检索数据并生成洞察。评估显示,在准确性和质量上较基线有显著提升。
QueryAgent-R1: 桥接查询生成与商品检索的电商查询推荐
QueryAgent-R1是一个智能体框架,利用强化学习和记忆抽象桥接电商中的查询生成与商品检索,在线测试中查询点击率提升2.9%,转化率提升3.1%。
代理搜索份额:用于LLM电子商务竞争决策的多代理AI系统
本文介绍了一种多代理AI系统,用于测量和诊断LLM电子商务中的竞争可见性,采用代理搜索份额指标,并通过消融研究验证了其可行性。