EAR:用于检索增强生成开发的实体感知分区方法
摘要
本文介绍EAR,一种用于多项选择题问答的检索增强生成中的实体感知分区方法,它从问题和语料库中提取锚点,以检索紧凑窗口而非固定大小的块。
arXiv:2609.12268v1 公告类型:新
摘要:检索增强生成(RAG)可以改善知识密集型问答,但第一个设计选择容易被忽视:源语料库应如何分区为可检索单元?固定大小的块通常返回长段落,其与问题的关系仅是隐式的。我们引入EAR,一种用于多项选择题问答(MCQA)的实体感知分区方法。EAR从问题、答案选项和语料库中提取标准化的表面锚点;检索匹配语料库锚点周围的局部窗口;并通过抽取式摘要附加较大的父段落。我们在一个清理过的、类似大规模多任务语言理解(MMLU)的子集上评估EAR,该子集包含153个问题,由自动语料库支持启发式选择,并使用去污染的公共教科书文本。在Mistral、Gemma和DeepSeek的相同协议下,top-k = 3和top-k = 8的扫描中,EAR实体窗口相对于块减少了37.5-40.2%的检索词数。观察到的准确率变化在top-k = 3时为+5.2、+1.3和-3.9个百分点,在top-k = 8时为+5.9、-3.3和-4.6个百分点;实体窗口差异均不显著。范围贡献是方法论的:EAR提供了一个紧凑且可检查的检索单元,而其基于规则的锚点提取器仍然是特定于领域的,在转移前需要单独验证。
查看缓存全文
缓存时间: 2026/09/14 08:31
# EAR:面向检索增强生成开发的实体感知分割方法 来源:https://arxiv.org/html/2609.12268 出版标识:pubid:979\-8\-3195\-4709\-5/26/$31\.00 ©2026 IEEECenab Batu Bora1, Oylum Alatlı2, Sebnem Bora2, Oğuz Dikenelli2 所属机构:1美国佐治亚理工学院,亚特兰大;cenab@gatech\.edu 2土耳其爱琴大学,伊兹密尔 oylum\.alatli@ege\.edu\.tr; sebnem\.bora@ege\.edu\.tr; oguz\.dikenelli@ege\.edu\.tr ###### 摘要 检索增强生成(RAG)能提升知识密集型问答效果,但首要设计选择常被忽视:应将源语料库如何分割为可检索单元?固定大小的文本块常返回与问题仅存在隐式关联的长段落。我们提出EAR——一种面向多选问答(MCQA)的实体感知分割方法。EAR从问题、选项和语料库中提取标准化表层锚点;检索匹配锚点周围的局部上下文窗口;并可通过抽取式摘要附加更大父段落。我们在经清洗的153题Massive Multitask Language Understanding(MMLU)风格子集上评估EAR,这些问题通过自动语料库支持度启发式筛选,并使用去污染的公开教材文本。在使用Mistral、Gemma和DeepSeek模型进行的top\-k=3和top\-k=8相同协议扫描中,EAR实体窗口相比文本块减少37.5–40.2%的检索词量。观察到的准确率变化在top\-k=3时为+5.2、+1.3和\-3.9点,在top\-k=8时为+5.9、\-3.3和\-4.6点;实体窗口的差异均无统计显著性。其方法论贡献在于:EAR提供了紧凑且可检视的检索单元,而基于规则的锚点提取器具有领域特定性,迁移前需单独验证。 ###### 索引术语: EAR、检索增强生成、实体感知分割、MMLU风格基准测试、多选问答 ## I 引言 大型语言模型(LLMs)现常通过多选知识基准进行评估,包括Massive Multitask Language Understanding(MMLU)及其同类评估风格的本地化变体\[1、2、3\]。检索增强生成(RAG)可使此类任务基于源文档生成,但大多数轻量级系统在见到问题前就已分割文档:页面被划分为固定或滑动文本块,检索器对这些预设片段进行排序\[4、5\]。在本文使用的教材案例中,题干和选项通常已明确指出应指导检索的条约、统治者、改革、政体、战役、地点或日期。 EAR通过从问题和选项中提取标准化表层锚点,将其与语料库锚点匹配,并检索匹配点周围的紧凑窗口来构建实体感知检索单元。在多选问答(MCQA)中,这使检索单元响应具体题目,而非仅遵循文档分割规则。通用文本块可能混合答案线索、干扰项和无关叙述;更长的上下文也增加了推理成本并可能降低证据使用的可靠性\[7\]。因此核心问题十分直接:当用实体感知窗口替代通用文本块时,会产生怎样的准确率与上下文成本表现? 我们在基于教材的单一课程设置中测试EAR。检索架构可复用,但当前的表层锚点规则针对本语料库的语言和学科定制;本文未建立跨领域迁移能力。我们在相同数据划分、模型、提示方案和清洗语料库下,将EAR与基于词汇的文本块基线进行比较。我们的贡献包括: - •引入并形式化EAR,包含可审计的基于规则的表层锚点模式、实体窗口检索及可选父级扩展变体。 - •构建清洗评估协议,移除经自动检查标记的基准题目及检索语料库中的练习材料。 - •在153题支持划分上,跨两个本地模型和一个托管模型,比较无RAG提示、文本块、EAR实体窗口和EAR父级扩展检索。 - •报告准确率、配对不确定性、上下文容量、锚点覆盖率、计算成本和窗口半径敏感性。 ## II 相关工作 RAG检索外部证据并基于其进行条件生成\[4\]。综述工作围绕索引、检索、证据表示、增强和生成时集成组织RAG系统\[5\]。许多系统索引固定大小文本块,并通过词汇相似性、稠密嵌入、混合评分或Okapi最佳匹配25(BM25)进行排序\[6\]。固定文本块易于缓存,但其边界独立于问题。 检索单元的选择至关重要,因为LLMs可能无法有效利用长上下文中的相关信息\[7\];自反思检索增强生成(Self\-RAG)同样评估段落实用性而非机械插入证据\[9\]。临床实体检索展示了专用实体选择方案\[8\]。层级和图系统则构建更广泛的表示:用于树组织检索的递归抽象处理(RAPTOR)检索树组织摘要,而图检索增强生成(GraphRAG)使用实体图和社区摘要\[10、11\]。EAR在此设计空间中占据更简单的位置:标准化表层锚点选择局部窗口,父级上下文作为可选扩展进行测试。 土耳其语RAG研究现已涵盖通用流程和教育语料库。Bikmaz等人比较土耳其检索和生成模型\[12\];Atagün等人评估四种LLMs在土耳其语RAG问答中的表现\[13\];RAGTurk评估七个流程阶段,发现添加生成模块可能增加成本而无稳定收益\[14\]。最接近的是Öner等人在土耳其教育部教材上比较嵌入、生成器和集成方法\[15\]。TurkishMMLU和TR\-MMLU提供了本文使用的基准环境\[2、3\]。这些研究优化模型或流程阶段;EAR探究确定性表层锚点窗口能否作为MCQA的紧凑检索单元。 ## III 方法 ### III\-A 任务与评估协议 任务为五选一MCQA。每个输入包含题干和选项A–E,生成器必须返回一个选项标签。全文中,chunk指代固定段落基线,EAR entity\-window指主要方法,EAR parent\-expanded指更广上下文变体,BM25 page指诊断性高召回率检索器。 所有直接比较在运行内保持生成器、提示方案、数据划分、检索语料库和top\-k设置固定。主要比较探究EAR实体窗口在匹配条件下与文本块检索的差异。EAR父级扩展测试更广上下文,而BM25页检索仅在Mistral诊断性测试中出现。 ### III\-B 数据清洗与语料库构建 初始基准经审核以确保实验衡量检索单元性能而非提取工件。审核生成临时清洗划分(保留标记待审行)和严格划分(仅保留通过自动审核的行)。严格测试集包含672个问题。由于公开语料库未包含每个项目的证据,自动支持度启发式在金标准选项与同一保留语料块中足够多题干术语重叠时保留问题。这产生了153题支持划分。该启发式控制语料库不匹配问题,但未针对完整人工证据判断进行验证。 检索语料库基于四份公开课程教材纯文本文件构建:9至12年级材料。去污染处理在索引前移除练习材料和多选题块。最终语料库审计报告1108页、772页保留叙事文本、3955个保留块和4429个丢弃块。表I总结评估数据概况。 表I:清洗评估与语料库摘要。 ### III\-C 提出方法:EAR EAR使用确定性表层锚点模式。此处“实体”指标准化文本锚点的操作术语,而非通用命名实体识别(NER)模型的输出。文本遵循图1:算法1定义实体窗口检索,算法2定义父级扩展变体。同一提取器处理语料库文本(算法1步骤3)和查询(步骤5)。它提取年份、首字母大写短语及由Savaşı、Antlaşması、Fermanı等后缀标记的事件类短语;最多包含六个内容词的选项也作为锚点保留。归一化处理考虑地区大小写折叠、标点变体、数字、空格和领域后缀。 EAR无需本体论或学习型链接器/嵌入模型。算法1步骤3–6将表层锚点视为可审计检索键,并通过词汇重叠评分窗口,每个匹配锚点加3分,每个匹配年份/日期额外加1.5分。若无查询锚点匹配索引,步骤6对所有窗口进行词汇评分。平局保留语料库索引顺序,步骤7移除重复窗口。 语料库端流程清洗页面并移除练习块(算法1步骤1),将其分割为260词父块(60词重叠)(步骤2),提取语料库锚点(步骤3),并存储锚点两侧各80词的子窗口(步骤4)。推理时,EAR从问题和选项提取锚点(步骤5),对候选窗口评分(步骤6),返回top\-k去重窗口(步骤7)。 EAR父级扩展重用算法1输出(算法2步骤1),检索每个父块(步骤2),按查询重叠度对句子排序(步骤3),选取最多两句构建抽取式摘要(步骤4)。步骤5附加子窗口、父文本摘要和锚点链接日志,步骤6移除重复父上下文。 在支持划分上,步骤5为所有153题提取至少一个问题加选项锚点,其中151题(98.7%)找到至少一个精确标准化语料库索引匹配。在锚点层级,1331个提取锚点中676个匹配索引键(50.8%)。这些值衡量操作覆盖率,而非NER精确率/召回率:本研究未设人工标注实体集。 算法1:EAR实体窗口检索 输入:语料库C,问题q,选项O,top\-k预算k 输出:排序证据窗口Wk 1. 清洗语料库页面并移除练习/问题块 2. 将每页分割为重叠父块 3. 从每个父块提取标准化语料库实体 4. 为每个锚点存储两侧各80词的子窗口 5. 从q和O提取标准化查询实体 6. 按实体匹配、词汇重叠和日期匹配评分子窗口 7. 返回top\-k去重窗口作为证据 算法2:EAR父级扩展检索 输入:子窗口Wk,父块P,查询q,O 输出:父级扩展证据Ek 1. 运行算法1获取实体窗口子窗口 2. 为每个子窗口检索其父块 3. 按与问题选项的重叠度对父句排序 4. 从最佳句子构建简短抽取式父摘要 5. 附加子窗口、父摘要和实体链接日志 6. 去重重复父上下文 7. 返回扩展上下文供生成器回答 图1:形式化EAR算法。算法1为实体窗口方法,算法2为父级扩展变体。 ### III\-D 设计原理与范围 EAR测试一个狭窄的设计主张:有用的MCQA检索单元可以是问题相关锚点周围的局部证据,而非均匀大小的段落。文本块基线针对整个查询对段落排序。EAR首先识别可搜索锚点(图1,算法1步骤5),然后对语料库匹配点周围的局部窗口排序(步骤6–7)。 每个上下文可通过步骤3–7追溯到查询锚点、语料库锚点和窗口。因此,错误答案可检查为步骤5的查询提取缺失、步骤6–7的检索不良,或相关证据返回后的生成器失败。 检索架构可接受其他锚点提取器,但当前的首字母大写、后缀和归一化规则针对本语料库定制。因此迁移需重新设计和验证步骤3与5;本研究未建立跨领域泛化能力。 ### III\-E 基线、提示与回答协议 文本块基线将清洗文本分割为重叠220词块(30词重叠),并按问题加选项的词汇token重叠度排序。它跳过图1算法1的实体索引和子窗口构建(步骤3–4)。BM25页检索索引清洗页面并应用查询感知证据压缩;仅作为诊断性比较。 图2给出提示方案。直接行测试无检索的零样本、少样本和思维链(CoT)提示。检索行使用RAG+CoT:生成器接收上下文、问题、五个打乱选项和单标签约束。保留推理过程供检视;评分使用解析的A–E答案。扫描使用Ollama mistral:latest(不可变本地模型标识符6577803aa9a0,7.2B,Q4\_K\_M)、Ollama gemma:7b\-instruct(标识符a72c7f4d0a15,9B,Q4\_0)和OpenRouter deepseek/deepseek\-v3.2。每个模型在top\-k=3和8下运行,温度0,种子13,选项打乱,每题生成一次。 提示方案 简答 问题及五个选项;返回单个带答案标签的JSON对象。 少样本 同直接回答指令,前置已解示例。 CoT 问题及选项;返回答案标签加简短推理。 RAG 检索上下文出现在问题和选项前;尽可能仅从提供的上下文回答。 RAG+CoT 检索上下文加问题选项;返回答案标签及基于证据的简短推理。 主模板骨架 上下文 检索的教材段落 问题 原始问题题干 选项 打乱的A-E选项 指令 精确选择一个标签,相关时使用上下文,返回带answer字段和简要rationale字段的紧凑JSON对象。 图2:提示方案。主要EAR比较使用RAG+CoT;其他模板定义相同协议下的直接、少样本和非推理基线。
相似文章
面向检索增强生成的查询自适应语义分块:一种结合上下文窗口扩展的动态策略
提出了一种面向检索增强生成的查询自适应语义分块方法,通过上下文窗口扩展动态调整分块边界,以提升检索精度。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
EmbGen:利用重组语料库进行教学
EmbGen 是一种合成数据生成流水线,它通过嵌入相似度将语料库重组为实体-描述配对,从而生成多样化的问答对,用于在专业领域微调小型语言模型,显著提升了事实准确性。
面向LongEval-RAG的候选约束检索增强生成:系统设计与实证分析
本文介绍了为CLEF 2026 LongEval-RAG任务设计的候选约束检索增强生成(RAG)系统,该系统结合了确定性溯源追踪与段落检索、查询扩展、伪相关反馈、互惠排名融合、证据重排序以及引文感知聚合。对十种流水线变体的消融研究表明,采用基于规则的分块流水线并辅以句子级神经选择的方案取得了最佳性能。