面向检索增强生成的查询自适应语义分块:一种结合上下文窗口扩展的动态策略

arXiv cs.CL 论文

摘要

提出了一种面向检索增强生成的查询自适应语义分块方法,通过上下文窗口扩展动态调整分块边界,以提升检索精度。

arXiv:2605.22834v1 公告类型:新论文 摘要:检索增强生成系统严重依赖文档分块质量来检索相关上下文。固定分块将文档分割成统一单元,不考虑语义或用户意图,导致精度-召回率权衡无法仅通过调整块大小解决。语义和智能体方法部分解决了这些限制,但未在分块阶段整合用户查询。我们提出查询自适应语义分块(QASC),该方法通过三种机制将查询整合到分割中动态构建块:句子与查询嵌入之间的余弦相似度评分以识别种子句子、围绕种子的上下文窗口扩展以保持连贯性、以及块级得分聚合以确保整体相关性。我们在100份技术文档上对QASC进行了评估,涵盖200个查询(分四类),并与五种粒度的固定分块、递归分割、语义分块和智能体分块进行了比较。QASC的F1分数为0.85,相对于固定分块提高了18-27%,相对于语义和智能体替代方案提高了8-12%。消融实验确认了每个组成部分的显著贡献。由三位标注员进行的人工评估(Cohen kappa系数=0.82)证实,QASC生成的块比现有方法更相关、更连贯。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:54

# 查询自适应语义分块用于检索增强生成:一种结合上下文窗口扩展的动态策略
来源:https://arxiv.org/abs/2605.22834  
书目工具

## 书目与引用工具

书目浏览切换

代码、数据与媒体

## 本文关联的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于 arXivLabs

## arXivLabs:与社区协作者共同开展的实验项目

arXivLabs 是一个框架,允许协作者直接在我们的网站上开发和共享新的 arXiv 功能。

所有与 arXivLabs 合作的个人和组织都接受并认同我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 致力于这些价值观,并只与遵守这些价值观的合作伙伴合作。

您是否有能为 arXiv 社区带来价值的项目想法?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。

相似文章

Adaptive Chunking:为RAG优化分块方法选择

Papers with Code Trending

介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

文本块大小对检索增强生成性能的影响

arXiv cs.CL

本文研究了检索增强生成系统中文本块(句子、段落、章节)大小对生成质量、检索精度和计算效率的影响,实验采用了相同的教科书,按不同粒度进行分割。