RAG-Anything:全能型 RAG 框架
摘要
RAG-Anything 是一个全新的开源框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂的基准测试中表现优于现有方法。
查看缓存全文
缓存时间: 2026/05/08 08:39
论文页面 - RAG-Anything:全能型 RAG 框架
来源:https://huggingface.co/papers/2510.12323 发布于 2025 年 10 月 14 日
摘要
RAG-Anything 是一个统一框架,通过整合跨模态关系和语义匹配来增强多模态知识检索,在复杂基准测试上的表现优于现有方法。
检索增强生成(Retrieval-Augmented Generation)(https://huggingface.co/papers?q=Retrieval-Augmented%20Generation)(RAG (https://huggingface.co/papers?q=RAG))已成为一种基础范式,用于扩展大语言模型(Large Language Models)(https://huggingface.co/papers?q=Large%20Language%20Models),使其突破静态训练的局限性。然而,当前 RAG (https://huggingface.co/papers?q=RAG) 能力与现实世界信息环境之间存在关键错位。现代知识库本质上具有多模态(multimodal)(https://huggingface.co/papers?q=multimodal)特征,包含文本内容(textual content)(https://huggingface.co/papers?q=textual%20content)、视觉元素、结构化表格(structured tables)(https://huggingface.co/papers?q=structured%20tables) 和数学表达式(mathematical expressions)(https://huggingface.co/papers?q=mathematical%20expressions) 的丰富组合。然而,现有的 RAG (https://huggingface.co/papers?q=RAG) 框架仅限于处理文本内容(textual content)(https://huggingface.co/papers?q=textual%20content),在处理多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 文档时存在根本性差距。我们提出 RAG (https://huggingface.co/papers?q=RAG)-Anything,这是一个统一框架,可实现跨所有模态的全面知识检索。我们的方法将多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 内容重新概念化为相互连接的知识实体,而非孤立的数据类型。该框架引入双图构建,在统一表示中捕捉跨模态关系和文本语义。我们开发了跨模态混合检索(cross-modal hybrid retrieval)(https://huggingface.co/papers?q=cross-modal%20hybrid%20retrieval),将结构知识导航(structural knowledge navigation)(https://huggingface.co/papers?q=structural%20knowledge%20navigation) 与语义匹配(semantic matching)(https://huggingface.co/papers?q=semantic%20matching) 相结合。这使得对异质内容进行有效推理成为可能,其中相关证据跨越多个模态。RAG (https://huggingface.co/papers?q=RAG)-Anything 在具有挑战性的多模态基准(multimodal benchmarks)(https://huggingface.co/papers?q=multimodal%20benchmarks) 上表现出优越的性能,相比最先进方法取得了显著改进。在传统方法失效的长文档(long documents)(https://huggingface.co/papers?q=long%20documents) 上,性能提升尤为显著。我们的框架为多模态(multimodal)(https://huggingface.co/papers?q=multimodal) 知识访问建立了新范式,消除了制约当前系统的架构碎片化(frag (https://huggingface.co/papers?q=rag)mentation)。我们的框架已在以下地址开源:https://github.com/HKUDS/RAG (https://huggingface.co/papers?q=RAG)-Anything。
查看 arXiv 页面 (https://arxiv.org/abs/2510.12323) 查看 PDF (https://arxiv.org/pdf/2510.12323) GitHub 19.9k (https://github.com/HKUDS/RAG-Anything) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.12323)
在你的 Agent 中获取这篇论文:
hf papers read 2510\.12323
没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2510.12323 即可从此页面链接它。
包含此论文的合集 37
浏览包含此论文的 37 个合集 (https://huggingface.co/collections?paper=2510.12323)
相似文章
HKUDS/RAG-Anything
HKUDS 发布 RAG-Anything:基于 LightRAG 的开源一站式多模态检索增强生成框架。
@DanKornas:传统的以文本为中心的RAG系统无法有效处理现代文档中的图像、表格、公式、图表以及多媒体…
RAG-Anything 是一个基于 LightRAG 构建的多模态文档处理 RAG 系统,它解析文档、构建多模态知识图谱,并使用混合向量-图检索来回答问题。
@tom_doerr: 基于语义聚合和层次化检索的RAG知识图谱框架 https://github.com/KnowledgeXLa…
LeanRAG是一个开源框架,它利用知识图谱结构,通过语义聚合和层次化检索增强检索增强生成(RAG),以提供上下文感知、高保真的响应。该论文已被AAAI-26接收。
AgenticRAG:面向企业知识库的代理检索
本文介绍了 AgenticRAG,这是一个来自微软的框架,通过为大型语言模型(LLM)配备迭代搜索、文档导航和分析工具,增强了企业知识库的检索能力。它在多个基准测试中展示了相比标准 RAG 流水线在召回率和事实准确性方面的显著提升。
LightRAG:简单高效的检索增强生成框架
本文介绍了 LightRAG,这是一个开源框架,通过整合图结构来提升检索增强生成(RAG)的上下文感知能力与信息检索效率。