内部检索:注意力模型的内在能力
摘要
INTRA 表明,注意力模型可以直接从内部表示中进行检索,从而统一检索与生成,同时提高证据召回率和答案质量。
查看缓存全文
缓存时间: 2026/05/14 16:19
论文页面 - 从内部检索:注意力模型的内在能力
来源:https://huggingface.co/papers/2605.05806
摘要
INTRA 展示了基于注意力的模型可以直接从内部表示中进行检索,将检索与生成统一起来,同时提升证据召回与答案质量。
检索增强生成(Retrieval-augmented generation (https://huggingface.co/papers?q=Retrieval-augmented%20generation) ,RAG)通常将检索和生成视为独立的系统。我们探究基于注意力的编码器-解码器(attention-based encoder-decoder (https://huggingface.co/papers?q=attention-based%20encoder-decoder))是否可以直接从其自身的内部表示中进行检索。我们提出 INTRA(通过注意力进行内在检索(INTrinsic Retrieval (https://huggingface.co/papers?q=INTrinsic%20Retrieval)via Attention)),这是一个框架,其中解码器注意力查询(decoder attention queries (https://huggingface.co/papers?q=decoder%20attention%20queries))对预编码的证据块(pre-encoded evidence chunks (https://huggingface.co/papers?q=pre-encoded%20evidence%20chunks))进行评分,这些证据块随后被直接重用作为生成的上下文。通过这种设计,INTRA 统一了检索与生成,消除了 RAG 流水线中典型的检索器-生成器不匹配(retriever-generator mismatch (https://huggingface.co/papers?q=retriever-generator%20mismatch))问题。该设计还通过跨查询重用预计算的编码器状态,实现了上下文编码的分摊。在问答基准上,INTRA 在证据召回(evidence recall (https://huggingface.co/papers?q=evidence%20recall))和端到端答案质量(end-to-end answer quality (https://huggingface.co/papers?q=end-to-end%20answer%20quality))方面均优于强工程化的检索流水线。我们的结果表明,基于注意力的模型已经具备一种可以被激发出来的检索机制,而非需要添加外部模块。
查看 arXiv 页面 (https://arxiv.org/abs/2605.05806)查看 PDF (https://arxiv.org/pdf/2605.05806)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.05806)
在你的 agent 中获取此论文:
hf papers read 2605\.05806
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.05806 即可从此页面链接。
引用本论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.05806 即可从此页面链接。
引用本论文的 Space0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.05806 即可从此页面链接。
包含本论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
重新思考推理密集型检索:评估并提升智能体搜索系统中的检索器
本文引入了 BRIGHT-Pro,这是一个针对推理密集型检索的新基准,以及 RTriever-Synth,这是一个用于微调 RTriever-4B 以在智能体搜索系统中提升性能的合成语料库。
归因盲点:检测语言模型何时依赖记忆而非检索到的上下文
提出计算现实监测(Computational Reality Monitoring)方法,用于检测语言模型何时依赖预训练记忆而非检索到的上下文,从而解决检索增强生成中的归因盲点问题。
结构注意力税:检索格式如何独立于内容劫持上下文学习
本文识别并形式化了'结构注意力税'现象,即检索内容的格式(例如知识图谱三元组)独立于语义相关性扭曲了LLM的注意力分布,导致演示注意力压缩。它提供了正式框架、跨模型和基准的实证证据,并提出了结构感知的缓解策略。
Critic-R: 使用指令调优检索器与自然语言内省反馈改进Agentic Search
Critic-R引入了一个框架,使用评判模型在推理智能体和检索器之间提供内省反馈,在推理和训练时间同时提升智能体搜索性能,且无需重新训练智能体。
REAL:面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为
REAL引入了一种注意力行为矩阵,用于分析成功与失败案例中注意力头的行为,从而实现更有效的KV缓存驱逐。它在达到与最强基线相当准确度的同时,所需空间减少32倍。