AISE-Bench:面向学术知识图谱信息检索的全流程精选基准
摘要
本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。
arXiv:2607.20498v1 公告类型:新论文
摘要:增强工具的大语言模型(LLM)正逐渐成为能够使用Web引擎、API和代码解决复杂长期任务的自主智能体。当前用于学术图谱信息检索的工具使用基准依赖于合成模板、简化解决方案空间或狭窄任务(如以论文为中心的任务),未能充分探索关键挑战——真实用户意图、复杂多步API规划、API的丰富参数填充、带引用的可信答案,以及对过程和结果的全面评估。我们提出了AISE-Bench,这是一个面向学术知识图谱信息检索的真实世界、全流程标注基准。AISE-Bench版本包含1,133个问答对,包括查询分类、完整API执行轨迹、验证参数以及带有参考链接的源可信答案。为支持高质量标注,我们设计了一个定制化的智能体工作流,使标注者能够高效地规划、执行和修改复杂的API工作流。我们开发了一套全面的评估协议,衡量答案质量、引用可信度、API规划正确性和执行成功率。在14种评估方法中,即使是最强的模型(PLAY2PROMPT with Gemini-3-Pro)也仅达到中等性能,并且在API规划和执行方面常常遇到困难。AISE-Bench为定量评估和改进多步API使用LLM智能体的步骤正确性、可信摘要和可追踪推理提供了一个具有挑战性的新测试平台。我们的代码和数据可在 https://aise-bench.github.io/ 获取。
查看缓存全文
缓存时间: 2026/07/24 05:03
# AISE-Bench:面向学术知识图谱信息检索的全周期精心设计的基准测试 来源:https://arxiv.org/html/2607.20498 Fanjin Zhang 中国人民大学信息学院数据库与商业智能工程研究中心 北京 中国 fanjinz@ruc\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Zhengyang Wang 安徽大学计算机科学与技术学院 合肥 中国 e125211019@stu\.ahu\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Ruixuan Huang Z\-Lab Z\.ai 北京 中国 hrx202211@163\.com (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Kefan Zhang 清华大学统计学与数据科学系 北京 中国 zkf25@mails\.tsinghua\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Amy Xin 清华大学计算机科学与技术系 北京 中国 xin\-x25@mails\.tsinghua\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Yuanchun Wang 中国人民大学信息学院数据工程与知识工程重点实验室 北京 中国 wangyuanchun@ruc\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Shu Zhao 安徽大学计算机科学与技术学院 合肥 中国 zhaoshuzs2002@hotmail\.com (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Evgeny Kharlamov Bosch 人工智能中心 雷宁根,德国;& 奥斯陆大学信息学系 奥斯陆,挪威 Evgeny\.Kharlamov@de\.bosch\.com (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) Jie Tang 清华大学计算机科学与技术系 北京 中国 jietang@tsinghua\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) 和 Juanzi Li 清华大学计算机科学与技术系 北京 中国 lijuanzi@tsinghua\.edu\.cn (https://arxiv.org/html/2607.20498v1/mailto:[email protected]) \(2026\) ###### 摘要。 大型语言模型(LLMs)结合工具,正逐渐成为能够利用网络搜索引擎、API和代码来解决复杂、长期任务的自主智能体。当前,针对学术图谱信息检索的工具使用基准测试主要依赖合成模板、简化解决方案空间或狭窄任务(如以论文为中心的任务),导致一些关键挑战未被充分探索——包括真实的用户意图、复杂的多步API规划、API的丰富参数填充、带引用的内容验证答案,以及对过程和结果的全方位评估。我们引入了AISE-Bench,这是一个面向学术知识图谱信息检索的真实世界、全周期标注基准测试。AISE-Bench 版本包含 1,133 个问答对,涵盖查询分类、完整 API 执行轨迹、已验证的参数以及带有参考链接且依据来源的答案。为了支持高质量标注,我们设计了一个定制的智能体工作流,使标注者能够高效地规划、执行和修改复杂的 API 工作流。我们开发了一套全面的评估协议,用于衡量答案质量、参考依据、API 规划正确性和执行成功率。在 14 种评估方法中,即使是最强的模型(PLAY2PROMPT with Gemini-3-Pro)也只达到了中等性能,并且在 API 规划和执行方面经常遇到困难。AISE-Bench 为定量评估和提升多步 API 使用的 LLM 智能体在逐步正确性、基于来源的摘要和可追溯推理方面的能力,建立了一个具有挑战性的新测试平台。我们的代码和数据已公开提供¹¹¹https://aise-bench.github.io/。 学术搜索,LLM 智能体,学术知识图谱 ††journalyear:2026††copyright:cc††conference:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2; August 09–13, 2026; Jeju Island, Republic of Korea††booktitle:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2 \(KDD ’26\), August 09–13, 2026, Jeju Island, Republic of Korea††doi:10\.1145/3770855\.3817492††isbn:979\-8\-4007\-2259\-2/2026/08††ccs:Information systems Information retrieval## 1\.引言 基础模型现在能够利用工具调用机制(例如,搜索(Jin 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib117))、编码(Jimenez 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib118))和 API(Qin 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib119)))来显著提升其在复杂和长期任务上的性能上限。值得注意的是,这些模型已经展现出作为通用领域(如 GUI 智能体 (Xu 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib121))、网络智能体 (He 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib125))和多智能体社会模拟 (Wang 等人,2025a (https://arxiv.org/html/2607.20498#bib.bib124)))中智能体的潜力。 基准测试 | 真实查询 | 实体 | 合成数据 | 分类法 | 评估指标 | 标注模块 --- | --- | --- | --- | --- | --- | --- PeerQA (Baumgärtner 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib2)) | ✓ | 论文 | ✗ | - | 正确性 | 答案文本,证据 ScholarQABench (Asai 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib5)) | ✓ | 论文 | ✗ | 任务,学科 | LLM,引用 | 答案文本,引用 SoAyBench (Wang 等人,2025c (https://arxiv.org/html/2607.20498#bib.bib147)) | ✗ | 多个 | ✓ | 解决方案库 | 过程和答案 | - DeepDive (Lu 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib151)) | ✗ | 多个 | ✓ | - | - | - AISE-Bench | ✓ | 多个 | ✗ | 意图,学科 | LLM,过程,引用 | API 路径,答案,引用 表 1\. 学术搜索基准测试的比较。实体列表示每个 QA 任务针对的学术实体类型(多个 = 多种)。在评估指标列中,LLM 是基于 LLM 的语义正确性,引用表示答案中使用的参考文献或链接需要被评估,过程表示推理过程评估。在标注模块列中,证据表示需要在原文中定位答案的支持性上下文。引用表示答案必须提供其引用的来源。API 路径表示需要标注 API 调用轨迹,包括 API 输入和输出。 尽管 LLM 工具使用取得了快速进展,但现有的基准测试在解决需要复杂输入参数和 API 规划的真实且专业化的学术问题方面仍显不足。如表 1 (https://arxiv.org/html/2607.20498#S1.T1) 所示,SoAyBench (Wang 等人,2025c (https://arxiv.org/html/2607.20498#bib.bib147)) 通过模板生成和增强构建了 <查询,解决方案,代码> 三元组。DeepDive (Lu 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib151)) 通过在学术图谱上随机游走合成复杂的推理路径。PeerQA (Baumgärtner 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib2)) 和 ScholarQABench (Asai 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib5)) 专注于论文理解,很大程度上忽略了作者和会议等其他实体。然而,在查询层面,先前的工作很少反映用户与学术知识图谱的真实交互,导致查询分布有偏差且与人类信息需求不一致。在 API 规划方面,许多方法依赖预设的简化解决方案空间,限制了探索性推理。在答案层面,现有数据集中自由形式的答案使人难以辨别是否有支持来源。 因此,我们提出了 AISE-Bench,一个用于学术知识图谱专门化信息检索的全周期标注、真实世界的 API 使用基准测试。它提供了针对论文、作者、会议和组织等实体的实体搜索、实体详情查询和实体关系查询的 API。该基准测试基于从 AMiner (Tang 等人,2008 (https://arxiv.org/html/2607.20498#bib.bib130)) 收集的复杂、真实的学术问题构建,并能够对 LLM 在意图理解、API 规划、复杂参数化以及基于来源的、对长上下文进行忠实摘要等方面的能力进行全方位评估。 AISE-Bench 包含 1,133 个经过严格标注、跨学科的问题,涵盖多种实体类型和知识水平,其中包括 250 个经过双重审核和 883 个经过单一审核的实例。我们设计了一个定制的智能体工作流,该工作流简化了标注过程,支持一键执行完整的 API 工作流或对单个 API 调用进行细粒度编辑。除了查询和答案,AISE-Bench 还包括查询分类、API 轨迹和带依据的参考链接,支持对推理过程、答案质量和引用准确性进行全面评估。 相应地,我们提出了一个全面的 API 使用 LLM 评估方案,使用评估答案质量、引用准确性、API 规划和执行成功率的指标。实验涵盖了 14 种最先进的方法,包括 6 个 LLM、4 个 API 使用智能体框架、2 个编码智能体和 2 个商业深度研究系统。结果表明,即使是最好的模型 PLAY2PROMPT with Gemini-3-Pro,在 LLM 评判中也仅达到 61.04% 的正确性和 60.9% 的完整性,突显了在理解、规划和执行专业化学术查询方面的持续局限性。我们的主要贡献如下: - • 我们引入了 AISE-Bench,一个面向学术图谱信息检索的、基于真实世界且全周期标注的 API 使用基准测试,包含带有分类类型的查询、API 轨迹、嵌入参考链接的答案。 - • 我们提出了一个精细的智能体框架,通过无缝建议 API 规划、执行单个或多个 API 调用以及总结答案来辅助标注。 - • 我们开发了一套全面的评估套件,用于衡量参考链接匹配性能、答案准确性、API 规划、参数准确性和执行成功率。 - • 我们对 14 种方法进行了深入评估,揭示了在复杂 API 规划、API 执行和相似 API 消歧方面的明显局限性。 ## 2\. 相关工作 ### 2\.1\. LLM API 使用方法 LLM API 使用方法可以分为大型基础模型、无需训练的智能体框架和基于训练的方法。许多旗舰 LLM 现在原生支持多轮工具调用,包括 GPT (Singh 等人,2026 (https://arxiv.org/html/2607.20498#bib.bib143))、DeepSeek (Liu 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib145))、Gemini (Comanici 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib144)) 等。 无需训练的工具使用方法使 LLM 能够在不进行额外模型训练的情况下调用外部工具。一个代表性范式是 ReAct (Yao 等人,2022 (https://arxiv.org/html/2607.20498#bib.bib108)),它交替进行自然语言推理和动作执行,使模型能够迭代地规划、调用工具并根据观察更新信念。另一条路线依赖提示工程来引发可靠的零样本或少样本工具调用,例如 DRAFT (Qu 等人,2025a (https://arxiv.org/html/2607.20498#bib.bib115))、PLAY2PROMPT (Fang 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib126))、SoAy (Wang 等人,2025c (https://arxiv.org/html/2607.20498#bib.bib147))、AvaTaR (Wu 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib148))、TURA (Zhao 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib122)) 和 CodeAct (Wang 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib149)) 等方法。例如,PLAY2PROMPT (Fang 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib126)) 通过自动探测工具来完善文档并生成示例,无需标注数据,实现了真正的零样本工具使用。 相比之下,基于训练的方法通过模型优化来改进工具使用。监督微调方法如 ToolLLM (Qin 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib119))、Granite (Abdelaziz 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib112)) 和 ToolGen (Wang 等人,2025b (https://arxiv.org/html/2607.20498#bib.bib123)) 使用精心策划的工具调用轨迹来增强工具适应性。基于强化学习的方法则进一步优化工具选择和动作规划,包括 ToolRL (Qian 等人,2026 (https://arxiv.org/html/2607.20498#bib.bib134))、ReTool (Feng 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib129))、Tool-Star (Dong 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib132)) 和 FunRL (Hao 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib136)),在准确性和决策质量方面取得了显著提升 (Qu 等人,2025b (https://arxiv.org/html/2607.20498#bib.bib153))。 参照图注 图 1\. AISE-Bench 构建流程。我们首先基于来自 AMiner 的真实用户查询进行过滤和采样。然后,使用定制的智能体工作流 (CAW),为每个查询生成初始 API 计划和答案。标注者对基于 CAW 的计划和答案进行细化,每个标注后的查询至少由一位审核者验证。 ### 2\.2\. 学术搜索基准测试 为了增强大型基础模型在学术信息检索、学术文献理解以及使用复杂学术 API 方面的能力,近年来出现了一些学术搜索基准测试 (Li 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib152); Chen 等人,2026 (https://arxiv.org/html/2607.20498#bib.bib1); Baumgärtner 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib2); Wang 等人,2025c (https://arxiv.org/html/2607.20498#bib.bib147); Patel 等人,(https://arxiv.org/html/2607.20498#bib.bib142); Singh 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib131); Zhang 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib3))。 这些基准测试可以根据其目标能力进行分组。PeerQA (Baumgärtner 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib2))、RPC-Bench (Chen 等人,2026 (https://arxiv.org/html/2607.20498#bib.bib1))、Scholar QA (Singh 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib131)) 和 PaperQA (Lála 等人,2023 (https://arxiv.org/html/2607.20498#bib.bib111)) 专注于以论文为中心的评估,强调在学术语料库上进行检索、依据验证和科学严谨的问答 (QA)。DeepResearch 系列基准测试 (Du 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib138); Wan 等人,2026 (https://arxiv.org/html/2607.20498#bib.bib141)) 与 DeepScholar-Bench (Patel 等人,(https://arxiv.org/html/2607.20498#bib.bib142)) 一起,为研究工作流程(包括问题分解)和专门任务(如生成相关工作章节)提供了更全面的评估。相比之下,LitSearch (Ajith 等人,2024 (https://arxiv.org/html/2607.20498#bib.bib113)) 针对复杂的文献搜索查询。与我们的工作更相关的是,SoAy (Wang 等人,2025c (https://arxiv.org/html/2607.20498#bib.bib147)) 和 DeepDive (Lu 等人,2025 (https://arxiv.org/html/2607.20498#bib.bib151)) 使用预定义路径或随机游走,在学术知识图谱上构建 QA 任务。 然而,现有的相关基准测试具有明显的局限性:(1) 它们主要侧重于论文理解和检索,对学术知识图谱上的 API 组合和调用的支持有限;(2) 学术 API 使用基准测试通常依赖自动构建的轨迹以及过度简化的 API 库和解决方案空间;(3) 它们的评估范围狭窄,通常仅评估短答案的准确性。 为了解决这些局限性,我们引入了 AISE-Bench。在方法层面,它针对学术知识图谱上的复杂 API 组合。在问题和规划层面,我们选择了真实的用户查询和丰富的 API 库,并提供了详细的标注,包括问题类型、多步 API 调用轨迹和基于引用的答案。在评估层面,
相似文章
通过基准构建教授AI:QuestBench作为负责任知识工作的课程实践
本文介绍了QuestBench,这是一个由学生构建的基准,用于评估人文和社会科学领域的深度研究系统。结果显示,即使是像GPT-5.5这样的先进系统也只能通过57.58%的问题,突显了可信度方面的失败。
KC-Bench: 一个用于评估LLM智能体中知识冲突的动态交互式基准
KC-Bench 是一个动态交互式基准,用于评估LLM智能体如何检测和解决用户指令、参数知识与环境观察之间的知识冲突,评估显示没有模型能可靠地处理所有冲突类型。
InferenceBench:面向AI代理的开放式LLM推理优化基准测试
InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。
K-Bench:评估模型在真实科学代理请求中的性能
论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。
A2RBench:一种自动化的可形式化验证抽象推理基准生成范式
本文介绍了A2RBench,一个用于为LLM生成可形式化验证的抽象推理基准的自动化流水线,它利用循环一致性来确保唯一解,并揭示当前LLM在3D推理任务上显著落后于人类。