ENTLORE:面向企业问答中潜在组织推理的基于图的基准
摘要
ENTLORE是一个基于图的基准框架,用于企业问答中的潜在组织推理评估,它表明即使拥有黄金文档来源,许多隐式关系问题仍然无法回答。
查看缓存全文
缓存时间: 2026/08/18 03:51
论文页面 - ENTLORE:企业问答中潜在组织推理的图谱基础基准
来源:https://huggingface.co/papers/2608.10679
摘要
ENTLORE是一个基准框架,通过要求从常规文档中恢复隐含的组织关系来评估企业问答能力,揭示出即使使用标准答案源,许多潜在推理问题仍未得到解决。
企业问答被定义为检索内部文档并生成基于依据的回答。然而,常规企业记录是工作的副产品,所需的组织关系在不同来源间保持隐含。现有基准提供真实的多源证据,但往往具象化预定义的答案路径,因此测试的是陈述事实的组合能力,而非从语料库中恢复目标关系的能力。我们将后者称为潜在组织推理(https://huggingface.co/papers?q=latent%20organizational%20reasoning)。我们引入ENTLORE,一个图谱基础基准(https://huggingface.co/papers?q=graph-grounded%20benchmark)构建框架,从常规文档、权威组织表格和运营记录中重建一个经过审计的企业世界。版本化的组织约定在真相图中认证派生关系,确保完整的标准答案和证明证书。对齐的匿名发布仅公开文档语料库,同时隐藏私有结构和目标关系。ENTLORE包含来自三种来源类型的2,341份文档和907个问题,涵盖显式查找、跨源合成(https://huggingface.co/papers?q=cross-source%20composition)和潜在组织推理(https://huggingface.co/papers?q=latent%20organizational%20reasoning),并在56个模型和访问配置下进行评估。将发布世界构建为诱导实体图(https://huggingface.co/papers?q=induced%20entity%20graph)或可导航知识库(https://huggingface.co/papers?q=navigable%20knowledge%20base)可获得最强的可部署结果。然而,即使提供标准文档,仍有30.4%的潜在问题未得到解决,而显式和合成问题的比例分别为12.6%和6.2%。因此,企业问答不仅依赖于文档召回,还取决于隐含组织关系是否变得可用。该基准、数据和代码可在ENTLORE公开获取。
查看arXiv页面(https://arxiv.org/abs/2608.10679)查看PDF(https://arxiv.org/pdf/2608.10679)GitHub2(https://github.com/scitix/entlore)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.10679)
在您的代理中获取本文:
hf papers read 2608\.10679
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.10679可从此页面链接。
引用本文的数据集1
Akrin-scitix/EntLORE Viewer• 更新于约1小时前 • 4.16k(https://huggingface.co/datasets/Akrin-scitix/EntLORE)
引用本文的空间0
没有空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.10679可从此页面链接。
包含本文的收藏集0
没有收藏集包含此论文
将本文添加到收藏集(https://huggingface.co/new-collection)可从此页面链接。
相似文章
AGORA: 基于档案的智能体工作场所文档推理基准
AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。
@_reachsumit: OBLIQ-Bench: 揭示现代检索器中因潜在和隐式查询而被忽视的瓶颈 @dianetc_ 等人提出…
OBLIQ-Bench 是一个新的基准测试,揭示了当前检索系统在处理需要潜在或隐式推理的间接查询时的弱点,表明即使复杂的检索流程也无法提供相关文档,而这些文档是推理型大语言模型容易验证的。
密集检索的检索锚定潜在推理
提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。
LaTER:通过潜在探索与显式验证实现高效的测试时推理
本文介绍了 LaTER,一种两阶段推理范式,它将潜在探索与显式思维链(Chain-of-Thought)验证相结合,从而在保持准确率的同时,降低大型语言模型的标记使用量并提升效率。
大型语言模型中的交互推理评估:基于可执行游戏的分层基准
本文介绍了一个用于推理评估的多轮交互框架,其中大型语言模型需要查询隐藏环境并整合部分观察结果。该框架实例化为一个包含474个可执行游戏、跨五个难度级别的基准,展示了区分能力并揭示了推理差异。