RAG-Anything:全能型 RAG 框架

Papers with Code Trending 论文

摘要

RAG-Anything 是一个全新的开源框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂的基准测试中表现优于现有方法。

检索增强生成(RAG)已成为一种基本范式,用于突破大型语言模型静态训练的局限性。 然而,当前的 RAG 能力与现实世界的信息环境之间存在严重的错位。现代知识库本质上是多模态的,包含了丰富的文本内容、视觉元素、结构化表格和数学表达式的组合。但现有的 RAG 框架仅限于处理文本内容,这在处理多模态文档时造成了根本性的缺口。我们提出了 RAG-Anything,一个统一的框架,支持跨所有模态的全面知识检索。我们的方法将多模态内容重新概念化为相互关联的知识实体,而非孤立的数据类型。该框架引入了双图构建技术,在统一表示中捕捉跨模态关系和文本语义。我们开发了跨模态混合检索技术,将结构化的知识导航与语义匹配相结合。这使得针对异构内容的有效推理成为可能,即使相关证据跨越多个模态。RAG-Anything 在具有挑战性的多模态基准测试中表现出色,较最先进的方法取得了显著的性能提升。在处理长文档时,传统方法往往失效,而我们的性能增益尤为显著。我们的框架确立了多模态知识访问的新范式,消除了限制当前系统的架构碎片化问题。我们的框架已开源,地址为:https://github.com/HKUDS/RAG-Anything。
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:39

论文页面 - RAG-Anything:全能型 RAG 框架

来源:https://huggingface.co/papers/2510.12323 发布于 2025 年 10 月 14 日

摘要

RAG-Anything 是一个统一框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂基准测试上的表现优于现有方法。

检索增强生成(Retrieval-Augmented Generation)(https://huggingface.co/papers?q=Retrieval-Augmented%20Generation)(RAG (https://huggingface.co/papers?q=RAG))已成为一种基础范式,用于扩展大语言模型(Large Language Models)(https://huggingface.co/papers?q=Large%20Language%20Models),使其突破静态训练的局限性。然而,当前 RAG (https://huggingface.co/papers?q=RAG) 能力与现实世界信息环境之间存在关键错位。现代知识库本质上具有多模态(multimodal)(https://huggingface.co/papers?q=multimodal)特征,包含文本内容(textual content)(https://huggingface.co/papers?q=textual%20content)、视觉元素、结构化表格(structured tables)(https://huggingface.co/papers?q=structured%20tables) 和数学表达式(mathematical expressions)(https://huggingface.co/papers?q=mathematical%20expressions) 的丰富组合。然而,现有的 RAG (https://huggingface.co/papers?q=RAG) 框架仅限于处理文本内容(textual content)(https://huggingface.co/papers?q=textual%20content),在处理多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 文档时存在根本性差距。我们提出 RAG (https://huggingface.co/papers?q=RAG)-Anything,这是一个统一框架,可实现跨所有模态的全面知识检索。我们的方法将多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 内容重新概念化为相互连接的知识实体,而非孤立的数据类型。该框架引入双图构建,在统一表示中捕捉跨模态关系和文本语义。我们开发了跨模态混合检索(cross-modal hybrid retrieval)(https://huggingface.co/papers?q=cross-modal%20hybrid%20retrieval),将结构知识导航(structural knowledge navigation)(https://huggingface.co/papers?q=structural%20knowledge%20navigation) 与语义匹配(semantic matching)(https://huggingface.co/papers?q=semantic%20matching) 相结合。这使得对异质内容进行有效推理成为可能,其中相关证据跨越多个模态。RAG (https://huggingface.co/papers?q=RAG)-Anything 在具有挑战性的多模态基准(multimodal benchmarks)(https://huggingface.co/papers?q=multimodal%20benchmarks) 上表现出优越的性能,相比最先进方法取得了显著改进。在传统方法失效的长文档(long documents)(https://huggingface.co/papers?q=long%20documents) 上,性能提升尤为显著。我们的框架为多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 知识访问建立了新范式,消除了制约当前系统的架构碎片化(frag (https://huggingface.co/papers?q=rag)mentation)。我们的框架已在以下地址开源:https://github.com/HKUDS/RAG (https://huggingface.co/papers?q=RAG)-Anything。

查看 arXiv 页面 (https://arxiv.org/abs/2510.12323) 查看 PDF (https://arxiv.org/pdf/2510.12323) GitHub 19.9k (https://github.com/HKUDS/RAG-Anything) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.12323)

在你的 Agent 中获取这篇论文:

hf papers read 2510\.12323

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。

包含此论文的合集 37

浏览包含此论文的 37 个合集 (https://huggingface.co/collections?paper=2510.12323)

相似文章

HKUDS/RAG-Anything

GitHub Trending (daily)

HKUDS 发布 RAG-Anything:基于 LightRAG 的开源一站式多模态检索增强生成框架。

AgenticRAG:面向企业知识库的代理检索

arXiv cs.AI

本文介绍了 AgenticRAG,这是一个来自微软的框架,通过为大型语言模型(LLM)配备迭代搜索、文档导航和分析工具,增强了企业知识库的检索能力。它在多个基准测试中展示了相比标准 RAG 流水线在召回率和事实准确性方面的显著提升。