基于LLM的服务反馈新兴主题检测模型
摘要
本文提出了一种新颖的方法论,整合了LLM、统计技术和人机协同,用于检测多语言服务反馈中的新兴主题,旨在提升公共部门组织的服务质量和公平性。
arXiv:2606.26595v1 公告类型:新
摘要:加强服务反馈分析对于公共部门组织(尤其是税务管理机构)至关重要,因为信任与合规依赖于公平有效的服务交付。随着反馈量增长,识别新兴的服务质量问题以及不同人群间的潜在差异变得越来越具有挑战性。传统方法通常依赖人工评审或静态的专家定义指标,限制了可扩展性以及捕捉文本反馈中复杂模式的能力。
本文提出了一种新颖的方法论,整合了大型语言模型(LLM)、统计技术和人机协作,以改进多语言客户反馈分析。主要目标是检测新兴的服务质量主题,这些主题可能同时揭示服务交付中的潜在不平等。我们的框架结合了微调量化LLM与专家监督,以生成准确、计算高效且上下文感知的分析结果。
所提出的方法通过相似性分析和来自经验丰富的税务官员的评估进行了验证,结果显示其与专家判断的一致性优于基线模型。通过引入人在回路中的框架,该方法减少了LLM的捏造,同时提高了生成洞察的可靠性和相关性。
结果证明了将LLM与人类专业知识相结合以支持公共部门组织中可扩展、基于证据的决策的实用性。这项工作有助于开发负责任的人工智能系统,通过更有效地分析多语言客户反馈来提升服务质量、响应能力、公平性和公众信任。
查看缓存全文
缓存时间: 2026/06/26 05:14
# 基于LLM的服务反馈中新出现主题检测模型
来源:https://arxiv.org/html/2606.26595
Ruth Bankey,Cristián Bravo
统计与精算科学系,西安大略大学,伦敦,安大略省,加拿大
{mtavako5, cbravoro}@uwo.ca
加拿大税务局,[email protected]
###### 摘要
提升服务反馈数据分析质量对于公共部门组织(特别是税务管理机构)至关重要,因为信任与合规性依赖于公平有效的服务交付。该领域的一个关键挑战是确保服务质量在多元人口群体中保持一致且包容,尤其是在反馈量不断增加的情况下——这种动态变化可能揭示不同群体在服务体验上的差异,而这一议题在旨在促进公平交付的公共服务分析中日益重要。传统的服务反馈分析方法(包括支持潜在偏差或歧视检测的方法)通常依赖人工流程或静态的专家驱动指标,这些方法不易扩展,且难以捕捉文本数据中的细微模式。相比之下,利用实际反馈的数据驱动方法能够提供更稳健、更动态的手段,以识别新出现的服务质量问题并促进公平服务交付。本文提出了一种新颖的方法,整合了大语言模型、统计技术和人机协作,以改进多语言客户反馈分析,主要目标是检测服务质量领域中出现的新主题——这些领域也可能指示潜在偏见。通过结合AI驱动工具与专家监督,我们的目标是识别服务交付趋势,并支持在不同人口群体中实现公平和响应性的结果。我们的方法采用了针对准确性优化且计算需求较低的微调量化大语言模型。通过相似性分析和由具有税务服务反馈操作直接经验的税务官员开展的评估调查进行验证,结果表明与基线模型相比,模型与专家评估的一致性有所提升。本研究通过有针对性的微调方法,解决了将大语言模型适应特定组织环境的挑战。通过融入人在回路的方法,我们减少了LLM的编造问题,确保了可靠且具有上下文意识的输出。结果突显了该方法在改进公共部门运营中的服务质量、响应性和决策方面的实用性和有效性。本研究有助于开发负责任的人工智能系统,在自动化服务交付中优先考虑公平性、包容性和公众信任。
###### 关键词:多语言反馈分析,客户服务,大语言模型(LLM),趋势检测,微调,量化,公平性,人在回路评估,主题分类。
## 1 引言
提升客户服务质量已成为现代组织成功的基石,因为它直接影响客户满意度、忠诚度和信任[45](https://arxiv.org/html/2606.26595#bib.bib1)。在公共服务领域(如税务管理),其重要性更是不言而喻。高效且响应迅速的服务能确保合规性,并促进公众满意度,这对于维持对政府机构的信任至关重要。然而,加拿大和美国税务服务的公众满意度处于中等水平,仍有改进空间。在加拿大,总体客户满意度指数(CSI)得分为63分(满分100分),反映出中等偏上的满意度[25](https://arxiv.org/html/2606.26595#bib.bib2)。在美国,2024年公民对联邦政府服务的满意度达到69.7分(满分100分),为2017年以来的最高水平[11](https://arxiv.org/html/2606.26595#bib.bib3)。这些数字凸显了公共组织需要确保公平对待不同人口群体,并及时有效地响应客户需求。评估公平性的一种方法是分析不同人口群体反馈中更频繁出现的主题。主题频率的显著差异可能表明服务体验存在差异,这是潜在偏见的重要信号。尽管本文并非旨在直接检测偏见,但识别此类模式有助于实现公平性目标,并与偏见的广义定义(即群体间不均等的对待或结果)相一致。解决这些差异——无论源于无意识的个人偏见还是自动化系统中的系统性问题——对于维护公众信任和确保公平服务交付至关重要。
尽管需求迫切,但公共服务组织现有的方法通常依赖人工流程或非数据驱动的定量指标,这些方法不足以捕捉纳税人关切的复杂性,也无法应对不同人口群体中出现的细微偏见和不平等模式[32](https://arxiv.org/html/2606.26595#bib.bib17)。人工方法缺乏系统检测和解决不同人口群体间偏见所需的效率和广度,尤其是在反馈数量和多样性不断增加的情况下。这些流程通常缓慢、资源密集,且易受人为错误和内在变异性的影响,难以及时识别模式或趋势。在拥有多种官方语言的国家,这一问题可能更为严重。当大规模分析反馈时,这一局限性尤为关键,因为诸如不同人口群体间服务交付差异等细微洞察可能被遗漏。此外,基于客户行为自动进行实时服务质量评估已证明能显著提升用户参与度、评估准确性和服务运营的整体效率[29](https://arxiv.org/html/2606.26595#bib.bib72), [7](https://arxiv.org/html/2606.26595#bib.bib66)。这些进步确保组织不仅能解决潜在偏见,还能简化流程,大规模提供个性化和公平的服务,从而进一步提升客户满意度和运营绩效。为实现这一目标,整合先进工具(如人工智能,特别是与统计技术结合)可以非常有效。这些工具能够分析大型数据集,检测不平等模式,并确保决策过程在大规模上公平且包容。
认识到这一需求,我们旨在开发一种整合大语言模型、统计技术和人类专业知识的方法。先前的研究日益强调识别服务体验差异和偏见的重要性,因为这对社会各领域的公平和平等具有深远影响[19](https://arxiv.org/html/2606.26595#bib.bib7)。这一日益增长的关注源于开发更公平系统和数据驱动决策过程的需求。众多研究强调了处理偏见的重要性[18](https://arxiv.org/html/2606.26595#bib.bib117), [60](https://arxiv.org/html/2606.26595#bib.bib5),展示了有针对性的干预措施如何促进包容性并提高影响日常生活和机构运营的系统的整体有效性。通过全面调查差异,学者们为构建更公正、更公平的社会做出了贡献[19](https://arxiv.org/html/2606.26595#bib.bib7)。最近的研究越来越强调检测客户反馈中的新兴趋势(跨人口群体)作为评估公平性的基础。虽然我们的研究不直接检测偏见,但识别出群体层面持续存在的关切差异可能表明潜在的不平等。常用方法包括统计技术(如因子分析、方差分析和回归分析)来检验可能反映系统性服务差距或意外偏见的差异。例如,Linzmajer等人[30](https://arxiv.org/html/2606.26595#bib.bib9)采用实验室和现场实验来评估身份因素如何影响服务互动中的客户感知。随着人工智能和机器学习的进步,研究人员越来越多地转向更复杂的计算技术来支持差异检测和促进公平性。除了通用语言处理任务外,研究人员还将注意力转向分析客户反馈和评论,以揭示不同人口群体在体验服务质量方面的差异[54](https://arxiv.org/html/2606.26595#bib.bib53)。由于客户评论在塑造服务绩效认知方面发挥着重要作用,识别不同人口群体主题普遍性的模式可以支持更公平的评估,并帮助组织解决不平等的服务结果[20](https://arxiv.org/html/2606.26595#bib.bib12)。这些新兴主题趋势提供了一种间接但有意义的方式来揭示可能反映潜在偏见的差异。研究已证实,反馈和评论显著影响运营决策,使其成为以公平为重点分析的重要领域[6](https://arxiv.org/html/2606.26595#bib.bib13)。随着文本数据在客户体验评估中的日益使用,自然语言处理技术对于大规模分析变得至关重要。
最近,大语言模型已被用于建模主题分布和探索上下文偏见,如Kumar等人[27](https://arxiv.org/html/2606.26595#bib.bib16)所示。虽然先前工作强调显式偏见检测,我们的研究聚焦于新兴的多语言反馈模式——当按人口群体分析时,这些模式可能突显公共服务交付中的差异。尽管先前研究在客户服务中推进了自动偏见检测,但将方法学与组织的具体目标和背景相结合仍是一个挑战。现有的统计方法往往忽视了服务交付的细微现实。按人口群体检测新兴反馈主题提供了一种更可扩展且更具上下文敏感性的方法来揭示差异。虽然未明确标记为偏见,但此类模式可以突出不平等体验或未满足的需求——这对于提高公共机构的公平性和服务质量至关重要。许多基于文本分析的研究仍局限于单语,忽视了服务多样化人群的组织的多语言需求。特别是公共部门实体,需要能够跨语言检测偏见和趋势的工具,以增强可访问性和包容性[42](https://arxiv.org/html/2606.26595#bib.bib84)。尽管先进的NLP和基于LLM的方法在速度和准确性上具有优势,但它们在偏见检测中的应用仍有限。许多研究依赖通用的预训练模型,这些模型通常无法捕捉特定领域的细微差别[21](https://arxiv.org/html/2606.26595#bib.bib74)。针对特定领域(如客户服务和金融)定制的微调模型已显示出更高的准确性,但其采用受到计算需求的限制[58](https://arxiv.org/html/2606.26595#bib.bib86)。为了解决这个问题,开发量化、资源高效的模型对于更广泛的普及至关重要。此外,将人类专业知识整合到评估过程中至关重要,因为自动化系统可能错过微妙的上下文线索。混合人机方法通过将大规模自动化与专家监督相结合,提高了公平性和可靠性[41](https://arxiv.org/html/2606.26595#bib.bib121)。AI驱动的工具,特别是NLP,在分析大规模客户反馈和识别不同人口群体的新兴趋势方面前景广阔。这些趋势可以揭示服务感知或交付中的差异[1](https://arxiv.org/html/2606.26595#bib.bib87), [46](https://arxiv.org/html/2606.26595#bib.bib88)。Miraz等人[33](https://arxiv.org/html/2606.26595#bib.bib133)强调了AI聊天机器人在通过改善沟通、可用性和用户信任来增强客户服务方面的有效性,并对运营和用户参与产生广泛影响。然而,此类技术的部署必须解决算法偏见——由偏见数据或设计引起的系统性不公平。为了减轻这些风险,符合伦理的AI原则至关重要,它促进AI驱动应用中的公平性、透明度和问责制[35](https://arxiv.org/html/2606.26595#bib.bib81)。符合伦理的AI原则是负责任AI开发的基础,强调透明度、问责制、可解释性和公平性等关键属性[5](https://arxiv.org/html/2606.26595#bib.bib122)。**公平性**确保AI系统为所有人口群体提供平等对待,防止歧视,促进包容性。**问责制**将人类监督引入AI决策过程,允许验证和完善AI生成的结果。**透明度**在确保AI过程保持开放和可理解方面发挥着重要作用,使用户能够了解决策是如何做出的。此外,**可解释性**通过提供清晰、可论证的决策理由来增强信任,确保用户和利益相关者能够自信地解释AI驱动的结论。通过整合这些原则,组织可以开发出既有效又符合道德标准的AI系统。这种方法有助于减轻偏见,培养公众信任,并确保AI技术以公平和负责任的方式服务于社会。
为了弥补现有差距,我们的方法使用微调的大语言模型将客户反馈分类为预定义的类别(服务质量要素,SQE),并分析跨人口群体的趋势(新兴、持续或消失)。通过关注公平、多样性和包容性(EDI)以及组织目标,该工具能够捕捉传统反馈系统经常忽略的问题。该方法将统计建模与量化大语言模型相结合,以实现概念相关性和资源效率。与基线模型相比,我们的LLM与专家判断的一致性更强,这一点通过相似性分析和专家调查得以证实。基于上述目标,本研究旨在探索以下关键研究问题:
1. 如何开发一个自动化的、人在回路的主题分析系统,用于分析纳税人反馈,确保透明度和可解释性,同时实现跨不同人口群体的公平和包容性服务评估?
2. 如何设计一个模型,能够准确识别反馈中不同人口群体间的新兴模式?
3. 如何实施用于反馈分析的自动主题建模,以将回复分类到具体的预定义类别?
我们的方法旨在解决部署LLM以改进运营时常面临的三个关键挑战。首要问题之一是将LLM适应特定的组织环境。许多组织使用的领域特定语言或专业术语与日常语言有显著差异。标准的预训练LLM可能难以准确解释或处理这种专业词汇,导致潜在的误解或效率低下。为克服这一点,我们的方法纳入了微调过程,即在组织数据集上训练LLM。通过这样做,模型获得了相似文章
形式化方法遇上大语言模型:面向先进AI系统合规性的审计、监控与干预
本文提出了一种将形式化方法(线性时序逻辑)与大语言模型相结合的技术,用于审计、监控和干预AI系统以确保其符合行为约束。研究表明,即便是小模型标注器在检测违规行为方面也能媲美前沿大语言模型裁判。
现实世界中的LLM:评估紧急情况下的“AI”
本文探讨了基于LLM的机器翻译系统在文本到911紧急服务中的部署情况,指出了常见的误解,并为利益相关者提供了建议,以确保人工智能在关键场景中的安全有效使用。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
WildFeedback: 通过原位用户交互和反馈对齐大语言模型
WildFeedback是一个新颖的框架,它利用真实LLM对话中的原位用户反馈来自动创建偏好数据集,用于将语言模型与人类偏好对齐,解决了传统基于标注的对齐方法中的可扩展性和偏差问题。
当模型意见相左时:重新思考公众评论分析中的LLM评估
本文提出了一种Interpretive Audit Pipeline,利用多模型分歧来检测基于LLM的公众评论分析中的解释复杂性,并认为基于分歧的评估是标准准确性指标的必要补充。