OmniRetrieval: 跨异构知识源的统一检索
摘要
OmniRetrieval 是一个框架,通过将原生查询分派到适当的执行引擎,统一了跨异构知识源(文本、表格、图)的检索,在包含13个数据集和309个知识库的基准测试中,优于单源基线。
查看缓存全文
缓存时间: 2026/05/29 02:59
Paper 页面 - OmniRetrieval:跨异构知识源的统一检索
来源:https://huggingface.co/papers/2605.29250
摘要
OmniRetrieval 是一个框架,通过识别合适的知识仓库并将原生查询分派到各自的执行引擎,来处理多样化的知识源,其在多种数据集类型上均优于单源方法。
现实世界的信息需求需要访问结构多样的知识源(https://huggingface.co/papers?q=knowledge%20sources),从非结构化文本、关系表格到知识图谱和属性图。然而,现有的检索器每次只在一个源上,使用固定的查询语言进行操作,使得更广阔的知识源场景因不兼容的接口而碎片化。一种自然的统一尝试是将这些源压缩到一个共享空间中,但这会抹去每个源所特有的结构能力(如模式、本体、组合运算符),而这些能力正是每个源表达力的来源。因此,要在多样化的知识上进行有效检索,需要的不是同质化,而是一个超越层,能够以每个源自身的方式与之对接。为了实现这一目标,我们提出了 OmniRetrieval,该框架接收任意自然语言查询(https://huggingface.co/papers?q=natural-language%20query),识别合适的知识源(https://huggingface.co/papers?q=knowledge%20sources),并将源原生查询(https://huggingface.co/papers?q=source-native%20queries)分派到其原生执行引擎(https://huggingface.co/papers?q=execution%20engines)中。在一个涵盖 13 个数据集和 309 个不同知识库(包括文本、关系和图结构源)的广泛基准上,OmniRetrieval 超越了单源基线,表明它可以作为异构源(https://huggingface.co/papers?q=heterogeneous%20sources)的通用接口,同时保留使每个源具有价值的结构差异。
查看 arXiv 页面(https://arxiv.org/abs/2605.29250)查看 PDF(https://arxiv.org/pdf/2605.29250)GitHub(https://github.com/JinheonBaek/OmniRetrieval)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.29250)
在您的智能体中获取此论文:
hf papers read 2605\.29250
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.29250,以从该页面链接到此论文。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.29250,以从该页面链接到此论文。
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.29250,以从该页面链接到此论文。
包含此论文的收藏集0
没有包含此论文的收藏集
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以从该页面链接到此论文。
相似文章
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
OmniPro:面向全主动流式视频理解的综合基准
OmniPro 是首个用于评估全模态大语言模型中主动流式视频理解的基准,包含 2,700 个样本,覆盖多种任务和双模式评估协议。
我构建了一个开源知识图谱管道,结合混合检索以改进LLM多跳推理 [P]
一个开源的全栈管道,从原始文本构建知识图谱,使用混合搜索(密集向量+稀疏+图遍历)解决LLM中的多跳推理问题,并通过倒数排名融合和交叉编码器对结果进行重排序。
OmniPhys:一个统一的多模态物理理解与生成基准测试,源自中国教育语料库
OmniPhys 是一个大规模的多模态基准测试,专注于物理理解与生成,涵盖了从中学到大学级别的问题,源自中国教育语料库。其目标是评估并推动多模态大型语言模型在科学领域的发展。