土耳其语RAG系统中分块与嵌入策略的比较

arXiv cs.CL 论文

摘要

本文针对土耳其语RAG系统,比较了分块与嵌入策略,并通过多配置系统研究评估了其对文档问答的影响。

arXiv:2608.26192v1 公告类型:新 摘要:文档如何分割成可检索的分块以及这些分块如何嵌入,强烈影响检索增强生成(RAG)的质量,但针对形态丰富的语言如土耳其语,两者均未被系统研究。我们通过三个分块策略(固定长度、语义和布局感知的Docling)、五个嵌入模型和两个生成式大型语言模型,对三份布局对比鲜明的文档进行土耳其语文档问答比较。全交叉设计产生了9,000个分级问答评估,每个由独立评判模型评分,组件比较通过霍尔姆校正下的配对麦克尼马尔检验进行测试。以下得出四个发现。分块策略决定了嵌入选择的重要性:布局感知分块将现代嵌入模型之间的差异压缩到约一个点。三个领先的嵌入模型在统计上无显著差异,因此语言专业化未带来可测量的检索优势。更快的生成器并非更准确的那个。并且首选配置取决于内容类型,因为布局感知分块对包含表格的文档帮助远大于散文。因此,最佳单个组件并不能组合成最佳完整配置,该配置达到87.0%。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:24

# 比较土耳其语RAG系统的分块与嵌入策略
来源:https://arxiv.org/html/2608.26192
Mustafa Sertaç Türkel 单位:数据科学与创新,Ata技术平台,土耳其伊斯坦布尔 sertac\.turkel@atptech\.com Fatma Nur Korkmaz 单位:数据科学与创新,Ata技术平台,土耳其伊斯坦布尔 fatmanur\.korkmaz@atptech\.com Ahmet Tuğrul Bayrak 单位:数据科学与创新,Ata技术平台,土耳其伊斯坦布尔 tugrul\.bayrak@atptech\.com

###### 摘要

文档如何被分割为可检索的块,以及这些块如何被嵌入,极大地影响着检索增强生成的质量,然而对于形态丰富的语言如土耳其语,这两者都尚未被系统地研究。我们比较了三种分块策略(固定长度、语义和布局感知Docling)、五种嵌入模型和两种生成式LLM在具有不同布局的三个文档上进行的土耳其语文档问答。完全交叉的设计产生了9,000个评分问答评估,每个都由独立的评审模型打分,组件比较通过Holm校正下的配对McNemar检验进行测试。得出四个发现:分块策略决定了嵌入选择的重要性程度:布局感知分块将现代嵌入模型之间的差异压缩到约一分。三个领先的嵌入模型在统计上无法区分,因此语言专业化没有带来可衡量的检索优势。更快的生成器并非更准确的那个。而首选配置取决于内容类型,因为布局感知分块对包含表格的文档的帮助远大于纯文本文档。因此,最佳的单个组件并不能组合成最佳的完整配置,其最高达到87.0%。

###### 关键词:

检索增强生成,大语言模型,文本分块,嵌入模型,土耳其语NLP,问答

已收录于INTCEC 2026。这是作者的预印本版本。最终认证版本将通过会议论文集提供。

## I引言

检索增强生成将从文档集合中选择相关段落的检索组件与基于这些段落进行条件生成的生成式大语言模型相结合。由于LLM从检索到的上下文中回答,质量取决于生成前的决策:如何将文档分割为可检索的单元,以及如何将这些单元和查询映射到向量空间以进行相似性搜索。这些选择彼此之间以及与文档属性相互作用,但在实践中通常通过惯例而非测量来确定。

这对土耳其语很重要。作为一种黏着语,土耳其语通过广泛的后缀添加语法信息,因此一个词干会以多种形式出现。这种影响首先体现在分词上:与土耳其语形态匹配不佳的子词词表会不一致地拆分屈折形式,降低下游土耳其语模型的性能,并且形态稀疏性是形态丰富语言的一个反复出现的障碍。继承这种不匹配的嵌入模型可能会将语义相似的段落置于向量空间中相隔很远的位置。文档布局增加了第二个因素:机构文档混合了正文和表格,而跨越边界分割表格的分块方法会使相应的事实难以检索,无论使用何种嵌入模型。

本文通过直接测量,为土耳其语文档问答确定了有效的RAG配置。我们将此视为跨越分块策略、嵌入模型和生成器LLM的受控比较,在相同的问题集上评估每种组合,并报告准确性之外的运营指标,因为部署的系统必须在质量与成本和延迟之间取得平衡。我们的贡献有四点。首先,我们描述了一个可重复的测试框架,对完全交叉设计的9,000个问答对进行评分,报告所有14个计划的组件比较,并在Holm校正下进行配对显著性检验。其次,我们表明三个领先的嵌入模型在统计上无法区分,因此语言专业化本身并不会带来检索优势。第三,我们分析了分块与嵌入的交互作用,表明分块策略决定了嵌入选择的重要性程度。第四,我们证明了首选配置取决于内容类型。

## II相关工作

RAG将语言模型的参数知识与对外部语料库的非参数检索相结合,无需重新训练即可使用最新或特定领域的内容。Fusion-in-Decoder等生成式阅读器表明,将生成建立在多个检索到的段落上可以联合改进开放域问答。检索已从稀疏词汇匹配转向稠密检索,其中查询和段落被嵌入到共享空间中,并通过内积或余弦相似度进行比较;在大规模情况下,这使用FAISS等近似最近邻索引。因此,嵌入质量对端到端性能至关重要。

使用孪生或对比目标训练的句子级编码器,如Sentence-BERT,以及语言无关模型如LaBSE,比基于令牌的掩码语言模型或经典的子词词嵌入更适合语义相似性。大型多语言编码器如multilingual-e5和商业嵌入服务将稠密表示同时扩展到多种语言,但强大的平均多语言性能并不保证任何单一语言的结果。对于土耳其语,专用的预训练模型如BERTurk在分类和冒犯性语言检测等下游任务上优于多语言模型,并且分词研究证实,子词词表与土耳其语形态之间的匹配度对模型质量有可衡量的影响。这是否从分类转移到检索(其目标是相对排序而非标签预测)是一个有待我们直接研究的开放问题。

分块受到的系统性关注较少,尽管它决定了检索器实际能看见哪些单元。这个问题早于RAG,作为文本分割:词汇连贯性方法如TextTiling在相邻窗口之间的词汇重叠度下降时设置边界,而有监督的神经分割器从带标签的文档中学习边界放置。固定长度分割仍然是已部署系统中的常见基线,语义分割是基于连贯性方法的实用后续,而布局感知解析则保留诸如表格和标题等结构元素,Docling等工具包扮演着这一角色。在评估方面,基于模型的协议如RAGAS可以大规模评估RAG输出,并且综述文章审视了设计空间。我们贡献了一个针对混合了正文和表格内容的土耳其语文档的受控、完全交叉比较,包含运营指标和显著性检验。

## III数据

语料库由三个文档组成,涵盖了代表土耳其语机构内容的布局特征,每个文档都有一个固定的问题集,其参考答案是预先已知的。文档根据以表格而非连续文本呈现的内容比例进行区分,按文档类型称为:重表格、平衡和重文本。由于对所有三个文档都应用了相同的分块和嵌入方法,因此隔离了布局的影响。

每个文档有100个不同的问题,总计300个,每个问题都根据回答它所需的信息是否位于表格中进行了标注。这支持了第V节的单独分析。在300个问题中,105个是基于表格的,195个是基于文本的,在重表格、平衡和重文本文档中分别分布为80、22和3个。这种不均匀的分布是有意的:它允许在三种不同的表格内容密度下检查基于表格的准确性。这也意味着重文本文档的表格问题数字仅基于三个问题,报告它是为了完整性而非解释。

交叉3种分块策略、5种嵌入模型和2种生成器,得到30种管道配置,在每种配置下回答所有300个问题,产生300×30=9,000个评分评估。每种配置的准确率是300个问题上的平均值,每个嵌入级别的数字是1,800个评估上的平均值,每个分块级别的数字是3,000个上的平均值,每个生成器级别的数字是4,500个上的平均值。由于设计是完全交叉的,组件比较不受问题或文档分配不均的影响,并且由于每个配置都基于相同的300个问题,因此第IV-F节的配对检验适用。

## IV方法

### IV-A RAG管道

每种配置遵循相同的管道,仅在被比较的组件上有所不同。每个文档通过选定的分块策略进行分割;每个块通过选定的嵌入模型编码为稠密向量,并存储在FAISS索引中。在查询时,问题用相同的模型进行嵌入,通过余弦相似度检索最相似的块,并将它们与问题一起插入固定的提示模板中。选定的生成器产生答案,该答案根据第IV-E节所述的参考答案进行评分。图1显示了单个配置及其相应流程的架构。检索的块数、提示模板和相似度度量保持不变,因此第V节中的差异归因于所研究的三个因素,而不是检索或提示中的偶然变化;这允许将3×5×2设计视为受控实验,而非单独调整的系统的集合。

参见图注

1:索引

←←FAISS(嵌入模型(分块器(文档)))

2:对每个问题进行循环

3:答案

←←生成器(提示(问题,top-k(索引,问题)))

4:判定

←←评审员(问题,答案,参考答案)∈{0,1}

5:结束循环

图1:一个RAG配置的架构和流程。只有分块策略、嵌入模型和生成器变化;检索深度、提示模板、相似度度量和评审员保持不变。对所有3×5×2=30种配置在300个问题上重复此过程,得到9,000个判定。

### IV-B分块策略

固定长度分块将文本按固定目标字符长度分割成段,不考虑内容,作为基线。语义分块在相邻句子之间的主题相似度下降时设置边界;它是基于词汇连贯性分割的实用后续,通常产生较短的块。Docling分块是布局感知的,解析文档结构并将结构连贯的元素,特别是表格,保持在一个块内,这产生较大的块。因此,这三种策略代表了对结构意识的增强,从无意识到主题结构,再到显式布局。

### IV-C嵌入模型

FastText是一种经典的基于子词的词嵌入方法,作为轻量级基线包含在内。TurkEmbed和Mursit-large是公开可用的面向土耳其语的嵌入模型,前者在土耳其语自然语言推断和句子相似性数据上训练,后者在土耳其语主导的预训练语料库上针对检索进行调整。multilingual-e5-large是一个大型多语言文本嵌入模型,而text-embedding-3-small是一个通过托管API访问的通用商业模型。所有五种模型在相同的管道中进行评估,因此只有嵌入步骤不同。此类稠密句子编码器在很大程度上取代了用于检索的词级表示;选择这些模型让我们测试这是否适用于土耳其语,以及语言专业化模型是否带来额外的好处。

### IV-D生成器LLM

比较了两个生成器:GPT-4o mini和qwen-plus,来自不同提供商的紧凑型商业模型。两者都使用相同的模板和检索到的上下文,因此比较反映了生成质量和延迟,而非检索质量。

### IV-E评估协议和运营指标

每个答案都根据其问题的参考答案被评分正确或错误,准确率是相关集合中正确的百分比。评分是自动的,由LLM评审员Llama 3.3 70B Instruct执行,该评审员被提示输入问题、参考答案和候选答案,并被指示返回二元判定;这种基于参考答案的模型评估协议遵循为可扩展RAG评估确立的实践。评审员故意选自第三方,与两个生成器都不同,因此评分不会因自我偏好而偏向任何一个生成器。在这项研究中,评审员的判定未与人类标注进行验证,因此下面报告的每个准确率都是相对于此评审员的准确率,而非人类仲裁;分层的人类验证留待未来工作。

每次评估记录三个运营指标:平均块大小,检索块的平均字符长度,作为上下文令牌数以及因此每次查询成本的代理;平均答案长度,生成答案的平均字符长度;以及平均响应时间,端到端API延迟的平均值。一个配置可能在

相似文章

Adaptive Chunking:为RAG优化分块方法选择

Papers with Code Trending

介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。