KSE-Web:针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析
摘要
本文介绍了KSE-Web,一项针对低资源柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析研究。研究通过构建一个数据集,评估了BM25、稠密检索以及混合检索方法,发现BM25表现最佳,同时LLM查询扩展在柬埔寨语应用中存在局限性。
arXiv:2608.21365v1 公告类型:新
摘要:作为低资源语言,柬埔寨语在检索方面面临诸多挑战,包括标注数据有限、词边界模糊、多语言嵌入模型支持薄弱,以及柬埔寨语与英语的频繁混用。本文介绍了KSE-Web,一项针对柬埔寨语语义搜索的混合检索与LLM辅助查询扩展分析。我们从约17,000个柬埔寨语候选标题中构建数据集,并通过过滤、规范化、去重和文档长度控制,保留了3,000份清洗后的柬埔寨语全文文档。该数据集包含300个经人工审核的用户风格柬埔寨语搜索查询,以及经过部分人工验证的相关性银标签。我们评估了基于字符n-gram的BM25、多语言稠密检索、混合BM25+稠密检索,以及使用Qwen2.5模型的LLM辅助查询扩展。实验结果显示,BM25取得了整体最佳性能,召回率达到0.943,nDCG达到0.876。混合BM25+稠密检索性能与之相当,召回率为0.929,nDCG为0.871,而单独使用稠密检索的表现则较低。LLM辅助查询扩展并未优于未扩展的检索;然而,Qwen2.5-3B在扩展查询结果上显著优于Qwen2.5-0.5B,这表明在低资源柬埔寨语检索中,LLM模型的规模和扩展质量至关重要。我们的分析进一步显示,直接的LLM扩展可能引入主题漂移、通用术语和噪声化的改写,而简单的过滤可能会移除有用的语义线索。这些发现揭示了LLM辅助检索在柬埔寨语语义搜索中的潜力和局限,并为未来构建具有更强人工验证标注和柬埔寨语感知检索模型的数据集提供了基础。数据集和文档将在github.com/back-kh/KhmerSemantic-Search发布。
查看缓存全文
缓存时间: 2026/08/25 04:09
# KSE-Web:混合检索与LLM辅助查询扩展在低资源高棉语语义搜索中的分析 来源:https://arxiv.org/html/2608.21365 ###### 摘要 作为低资源语言,高棉语面临多项检索挑战,包括标注数据有限、词边界模糊、多语言嵌入模型支持较弱以及高棉语与英语混用频繁等问题。本文提出KSE-Web,对面向高棉语语义搜索的混合检索与LLM辅助查询扩展进行分析。我们基于约17,000个候选高棉语标题构建数据集,经过过滤、规范化、去重和文档长度控制后,保留了3,000篇清洗后的高棉语全文文档。该数据集包含300个经人工审核的用户风格高棉语搜索查询,以及经过部分人工验证的银标准相关性标签。我们评估了字符n-gram BM25、多语言稠密检索、混合BM25+稠密检索以及基于Qwen2.5模型的LLM辅助查询扩展。实验结果表明,BM25在整体性能上表现最优,Recall@10达到0.943,nDCG@10达到0.876。混合BM25+稠密检索表现相当,Recall@10为0.929,nDCG@10为0.871,而单独使用稠密检索的效果较低。LLM辅助查询扩展并未超越非扩展检索;然而Qwen2.5-3B生成的扩展查询效果显著优于Qwen2.5-0.5B,表明LLM规模与扩展质量对低资源高棉语检索至关重要。进一步分析显示,直接LLM扩展可能引入主题漂移、泛用术语和嘈杂重组,而简单过滤可能同时移除有用的语义线索。这些发现揭示了LLM辅助检索在高棉语语义搜索中的潜力与局限,为未来构建具备更强人工验证标注和高棉语感知检索模型的高棉语检索数据集奠定了基础。数据集和文档将在 github.com/back-kh/Khmer-Semantic-Search (https://github.com/back-kh/Khmer-Semantic-Search) 发布。 ## 1引言 大语言模型(LLMs)近期在自然语言处理、计算机视觉和文档理解任务中表现出色。其生成同义表述、重构问题及提供上下文扩展的能力,推动了其在检索相关应用中的使用,包括语义搜索和检索增强系统[22 (https://arxiv.org/html/2608.21365#bib.bib6),21 (https://arxiv.org/html/2608.21365#bib.bib13),5 (https://arxiv.org/html/2608.21365#bib.bib20)]。然而,LLM辅助检索的有效性在不同语言间存在差异。特别是低资源语言往往缺乏大规模检索数据集、高质量相关性判断、健壮的分词工具以及强大的预训练表征。因此,为英语或其他高资源语言表现良好的方法,可能无法直接应用于数字资源有限的语言[1 (https://arxiv.org/html/2608.21365#bib.bib14),12 (https://arxiv.org/html/2608.21365#bib.bib18),13 (https://arxiv.org/html/2608.21365#bib.bib19)]。 参见标题图1:KSE-Web检索框架概述。离线阶段从清洗后的高棉语文档构建稀疏和稠密索引。推理时,高棉语查询经过规范化并可选择性使用LLM扩展。原始或扩展查询随后用于稀疏BM25检索、基于Multilingual-E5的稠密检索,并通过混合分数融合生成前k个排序的高棉语文档。高棉语即属此类语言。尽管在柬埔寨广泛使用,高棉语在现代信息检索和语义搜索研究中仍较少被探索。高棉语网页检索面临多重实际挑战[16 (https://arxiv.org/html/2608.21365#bib.bib11),17 (https://arxiv.org/html/2608.21365#bib.bib12)]。首先,现有高棉语语义搜索工作主要聚焦于领域特定检索和传统预处理,对混合检索策略或LLM辅助语义搜索模型关注有限[19 (https://arxiv.org/html/2608.21365#bib.bib8),18 (https://arxiv.org/html/2608.21365#bib.bib9)]。其次,高棉语不以空格作为可靠的词边界,使得标准词级分词和检索变得复杂。第三,现实中的高棉语网络查询常包含非正式表达、拼写变体、命名实体及高棉语-英语混用。最后,多语言稠密检索模型可能无法充分捕捉高棉语的语义相似性,因为高棉语在许多多语言训练和评估资源中代表性不足。这些挑战使得高棉语成为研究低资源语言环境下检索的宝贵案例[3 (https://arxiv.org/html/2608.21365#bib.bib16),9 (https://arxiv.org/html/2608.21365#bib.bib17)]。 本文提出KSE-Web,针对使用高棉语网络检索数据集的低资源高棉语语义搜索,分析混合检索与LLM辅助查询扩展。整体框架如图1 (https://arxiv.org/html/2608.21365#S1.F1)所示。KSE-Web将离线语料处理与在线查询处理分离。离线阶段,清洗后的高棉语文档用于构建稀疏和稠密索引。在线阶段,用户查询经规范化并可选使用LLM扩展后,传递至稀疏检索、稠密检索及混合分数融合。 为支持本分析,我们基于约17,000个候选高棉语网页标题构建高棉语网络检索数据集,经过过滤、规范化、去重和文档长度控制后,保留3,000篇清洗后的高棉语全文文档。数据集构建流程概括于图2 (https://arxiv.org/html/2608.21365#S2.F2)。数据集包含300个经人工审核的用户风格高棉语查询,以及通过银标准标注与部分人工验证生成的5,412个查询-文档相关性标签。查询涵盖多种搜索风格,包括短关键词查询、问题式查询、非正式用户风格查询及高棉语-英语混合查询。 我们评估了字符n-gram BM25、多语言稠密检索、混合BM25+稠密检索以及使用Qwen2.5模型的LLM辅助查询扩展。结果显示,字符n-gram BM25仍是整体最强的方法,Recall@10达到0.943,nDCG@10达到0.876。混合检索表现相当,Recall@10为0.929,nDCG@10为0.871,而单独使用稠密检索效果显著较低。主要性能趋势总结于图3 (https://arxiv.org/html/2608.21365#S5.F3)。LLM辅助查询扩展未超越非扩展检索,但Qwen2.5-3B生成的扩展查询效果显著优于Qwen2.5-0.5B。图4 (https://arxiv.org/html/2608.21365#S6.F4)中的定性示例进一步表明,LLM扩展可能引入主题漂移、泛用术语和嘈杂重组,而简单过滤可能在去除噪声的同时移除有用的语义线索。 本工作主要贡献如下: - •构建了包含3,000篇清洗后高棉语全文文档、300个经人工审核的用户风格查询以及5,412个经部分人工验证的银标准相关性标签的高棉语网络检索数据集。 - •提出KSE-Web,一个统一分析框架,涵盖稀疏、稠密、混合及LLM辅助检索设置,用于低资源高棉语语义搜索研究。 - •证明字符n-gram BM25是高棉语网络检索中强大且必要的基线,混合BM25+稠密检索表现接近但未超越BM25。 - •分析了基于Qwen2.5模型的LLM辅助查询扩展,表明较大的LLM比小型LLM产生更有用的扩展,但直接查询扩展仍不及非扩展检索。 - •提供了LLM扩展行为的定性分析,包括有益扩展、主题漂移、过度扩展、泛用术语插入及过滤效应。 ## 2相关工作 ### 2.1低资源与多语言信息检索 低资源语言的信息检索仍具挑战性,因为许多语言缺乏大规模语料、标准化查询集、相关性判断及特定语言预处理工具。近期基准如BEIR、Mr. TyDi、mMARCO和MIRACL推动了跨领域和语言的检索评估[15 (https://arxiv.org/html/2608.21365#bib.bib25),23 (https://arxiv.org/html/2608.21365#bib.bib24),2 (https://arxiv.org/html/2608.21365#bib.bib22),24 (https://arxiv.org/html/2608.21365#bib.bib23)]。然而,与高资源和研究更充分的多语言环境相比,高棉语在检索研究中的代表性仍远不足。这推动了构建高棉语特定检索数据集和评估协议的需求。 高棉语检索存在语言和实践双重挑战[3 (https://arxiv.org/html/2608.21365#bib.bib16),19 (https://arxiv.org/html/2608.21365#bib.bib8)]。高棉语不以空格作为可靠词边界,使得词级分词困难。此外,现实中的高棉语网络内容常包含高棉语-英语混用术语、音译名称、命名实体、非正式表达和拼写变体。这些问题既影响依赖词汇重叠的稀疏检索方法,也影响依赖习得语义表征的稠密检索方法[11 (https://arxiv.org/html/2608.21365#bib.bib1),10 (https://arxiv.org/html/2608.21365#bib.bib2)]。近期混合和LLM辅助检索方法为低资源检索提供了有前景的方向[21 (https://arxiv.org/html/2608.21365#bib.bib13),6 (https://arxiv.org/html/2608.21365#bib.bib26),8 (https://arxiv.org/html/2608.21365#bib.bib27),14 (https://arxiv.org/html/2608.21365#bib.bib28)]。本工作聚焦高棉语网络检索,并构建数据集以控制分析稀疏、稠密、混合及LLM辅助检索方法。 ### 2.2稀疏、稠密与混合检索 稀疏词汇检索在信息检索中仍是强大基线。BM25因其高效、可解释且利用词汇证据有效排序文档而被广泛使用[11 (https://arxiv.org/html/2608.21365#bib.bib1)]。然而对于高棉语等语言,词级BM25受分词难度影响。字符n-gram BM25提供了实用替代方案,因其无需显式分词即可捕捉查询与文档间的部分词汇重叠。这使字符级稀疏检索适用于高棉语网络搜索。 稠密检索将查询和文档表征为连续向量,并按向量相似度排序文档。稠密段落检索(DPR)展示了双编码器检索在开放域问答中的有效性[10 (https://arxiv.org/html/2608.21365#bib.bib2)]。更新的嵌入模型如E5,为检索、聚类和分类提供通用文本表征[20 (https://arxiv.org/html/2608.21365#bib.bib3)]。多语言嵌入模型对低资源语言有用,因为无需训练特定语言检索器即可应用。但其性能取决于目标语言在训练中的代表性。对于高棉语,现成的多语言嵌入可能在语义相似性、命名实体和混合文字使用方面仍面临困难。 混合检索结合稀疏和稠密检索信号。稀疏检索在精确词汇匹配、命名实体和罕见术语方面有效,而稠密检索可捕捉释义和语义相关表达。本文采用字符n-gram BM25与Multilingual-E5稠密检索间的简单分数融合策略。这使我们能够检验稠密检索是否为高棉语搜索增加了超出字符级词汇匹配的有用语义信号。 ### 2.3LLM辅助查询扩展与相关性标注 查询扩展通过重构查询或添加相关术语以更好匹配相关文档来提升检索效果。传统方法包括相关性反馈、伪相关性反馈和术语选择[4 (https://arxiv.org/html/2608.21365#bib.bib4),5 (https://arxiv.org/html/2608.21365#bib.bib20)]。近期研究也探索了基于LLM的查询扩展。Query2doc生成伪文档以扩展查询用于稀疏和稠密检索[21 (https://arxiv.org/html/2608.21365#bib.bib13)],而HyDE生成假设文档用于无需相关性标签的零样本稠密检索[7 (https://arxiv.org/html/2608.21365#bib.bib5)]。这些方法表明生成文本可提供有用的检索上下文,尤其对于短或模糊查询。 但LLM辅助扩展可能引入错误。生成文本可能拓宽原始意图、添加泛用术语或包含相关但无区分性的词语。这些风险对低资源语言更为重要,因为LLM可能具备较弱的特定语言知识,且生成术语可能不匹配目标语料库[12 (https://arxiv.org/html/2608.21365#bib.bib18),13 (https://arxiv.org/html/2608.21365#bib.bib19)]。本工作通过比较Qwen2.5-0.5B和Qwen2.5-3B,分析了基于Qwen2.5的高棉语检索查询扩展[22 (https://arxiv.org/html/2608.21365#bib.bib6)]。较大模型比较小模型产生更有用的扩展,但直接扩展仍不及强大的非扩展检索基线。 可靠的相关性标签对检索评估必不可少,但完整人工标注成本高昂,尤其对低资源语言。因此许多检索数据集采用池化方法,即由一个或多个系统检索候选文档,然后判断其相关性。在资源受限环境下,银标准标签提供了实用起点,尽管可能引入针对池化所用系统的偏差。在KSE-Web中,我们通过源文档匹配、基于BM25的候选检索、基于规则的相关性分配和部分人工验证构建银标准相关性标签。因此,我们将实验视为对高棉语网络检索行为的控制分析,而非最终金标准基准。 参见标题图2:KSE-Web检索数据集构建流程。数据集基于约17,000个候选高棉语网页标题构建,过滤清洗为3,000篇高棉语全文文档,并与300个经人工审核的用户风格查询配对。候选检索、源文档匹配、银标准相关性标注和部分人工验证产生了5,412个查询-文档相关性标签。 ## 3 KSE-Web数据集构建 本节描述KSE-Web的构建过程,这是一个高棉语网络检索数据集,旨在控制分析稀疏、稠密、混合及LLM辅助检索方法。由于公开可用且包含用户风格查询与相关性标签的高棉语检索数据集有限,我们构建了新的资源,包含清洗后的高棉语文档、经人工审核的查询以及经部分人工验证的银标准相关性标签。整体流程如图2 (https://arxiv.org/html/2608.21365#S2.F2)所示。 ### 3.1文档收集、类别与预处理 我们从公开可用的高棉语网络内容构建文档集合。从约17,000个候选高棉语网页标题开始,收集相应页面并处理成清洗后的全文语料。嘈杂、重复
相似文章
高棉语检索增强问答的语言模型比较研究
本文对电信领域高棉语检索增强问答中的嵌入模型和生成器后端进行了比较评估,发现BGE-M3在检索方面表现最佳,而生成器的优势因指标而异。
多模态大语言模型真的理解低资源高棉文档吗?关于高棉文档视觉问答的一项初步研究
本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。
低资源语言农业文档中有效文本嵌入的分块策略评估
本文评估了四种用于高棉语农业文档检索增强生成(RAG)的文本分块策略,发现基于字符的递归分块(300字符)在检索和相关性方面表现最佳。
HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。
KhatianDoc:一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败
本文介绍了KhatianDoc,一个人工验证的基准,用于诊断多模态LLM在孟加拉语法律土地记录上的失败,揭示了当前模型在符号识别和文档问答等任务上的失败。