Helicase:基于不确定性引导的自主多Agent LLM供应链知识图谱构建

arXiv cs.AI 论文

摘要

Helicase是一个自主多Agent LLM系统,通过不确定性引导构建供应链知识图谱。它将复杂查询分解为可执行计划,并在新的SCQA基准上优于基线方法。

arXiv:2605.26835v1 Announce Type: new Abstract: 基于LLM的多Agent系统已被广泛用于知识检索和报告生成,通过网页搜索和文本推理综合已知信息。然而,供应链中的许多关键信息任务并非简单的一次性查询:它们是结构性推理问题,需要跨复杂、碎片化的网络资源进行多跳推理。像\textit{“哪些特斯拉组件使用了来自澳大利亚矿山的锂?”}这样的问题在任何单一文档中都没有答案;必须通过从碎片化、异构来源中自主构建和分析动态知识图谱,以计算方式综合得出答案。此外,此类发现过程必须具有不确定性意识:决策不仅依赖于答案,还依赖于对可靠性进行校准的置信度,该置信度可追溯到来源质量和推理一致性。为了解决这一能力差距,我们提出了\textit{Helicase},一个用于不确定性引导供应链知识图谱构建的自主多Agent LLM系统。\textit{Helicase}将高级供应链查询分解为可执行的调查计划,通过迭代验证循环协调专门的网页搜索、推理和编码Agent,并逐步构建带有每个事实不确定性注释的查询特定供应链知识图谱。其三层不确定性框架在行动、轨迹和记忆层跟踪不确定性,实现结构性推理和校准置信度评估。为了评估全复杂度范围内的自主推理,我们引入了SCQA(供应链查询评估),这是一个包含80个供应链查询的基准,分为四个象限,涵盖高数据可见性和低数据可见性下的单跳到多跳推理。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:08

# Helicase: 不确定性引导的供应链知识图谱构建与自主多智能体大语言模型
来源:https://arxiv.org/html/2605.26835
Yunbo Longa,∗, Haolang Zhaoa, Ge Zhenga, Alexandra Brintrupa,b
aDepartment of Engineering, University of Cambridge, Cambridge, UK
bThe Alan Turing Institute, London, UK
yl892@cam\.ac\.uk
∗通讯作者

###### 摘要

基于LLM的多智能体系统已被广泛用于知识检索和报告生成,通过网页搜索和文本推理综合已知信息。然而,供应链中的许多关键信息任务并非简单的一次性查询:它们是结构性推理问题,需要跨越复杂、碎片化的网络资源进行多跳推理。诸如“特斯拉哪些组件使用澳大利亚矿山的锂?”这类问题,在单个文档中找不到答案;答案必须通过自主构建和分析由碎片化、异质来源组装而成的动态知识图谱,以计算方式综合得出。此外,此类发现过程必须对不确定性有意识:决策不仅取决于答案,还取决于对其可靠性的校准置信度,该置信度可追溯至来源质量和推理一致性。为弥补这一能力差距,我们提出Helicase,一种用于不确定性引导的供应链知识图谱构建的自主多智能体LLM系统。Helicase将高层供应链查询分解为可执行的调查计划,通过迭代验证循环协调专门的网页搜索、推理和编码智能体,并逐步构建带有每个事实不确定性注释的查询特定供应链知识图谱。其三层次不确定性框架在行动、轨迹和记忆层面追踪不确定性,实现结构性推理和校准置信度评估。为评估整个复杂性谱系上的自主推理,我们引入SCQA(供应链查询评估),一个包含80个供应链查询的基准,这些查询横跨单跳到多跳推理,并在高和低数据可见性下分为四个象限。我们的实验表明,前沿LLM和现有智能体框架在SCQA上表现失败:它们既无法生成或推理作为中间产物所需的网络模型,也无法产生可量化的不确定性估计。相比之下,Helicase成功自动化了端到端的发现过程,在四个象限的答案准确性上大幅超越所有基线,并且是唯一能对发现实体及其关系产生校准不确定性估计的系统。我们进一步通过电动汽车电池和消费化学品领域的两个现实供应链案例研究来说明实际用途。这项工作为供应链研究的自主信息发现开辟了新前沿,从被动的、检索增强的系统转向主动的、不确定性引导的、基于图的发现。代码可在https://github.com/Yunbo-max/Helicase获取。

## 1 引言

参考图标题
图1:SCQA研究基准数据集象限概览

像ChatGPT这样的大语言模型(LLM)的出现,彻底改变了我们从公共资源获取和综合信息的方式。这些模型擅长基于海量训练数据中的模式回答常见问题。然而,预训练模型对供应链管理中常寻求的专有信息(如配方或动态行业关系)没有内在的、可验证的知识。它们只能从通用公开文本中推导出查询答案,这使得它们在关键的生产研究场景中不可靠,例如确定特定商业产品的确切配方、追踪多层成分依赖关系,或评估跨行业依赖关系和产品瓶颈(Wu et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib8))。这一差距至关重要,因为关于产品组成的问题位于现代供应链韧性和战略的核心。自动回答关于成分依赖的复杂查询的能力,例如“如果某种特定乳化剂的供应中断,哪些其他产品会受影响?”或“在不重新配方的情况下,有哪些替代材料可以跨产品线替代这种聚合物?”,对于主动风险管理、道德和可持续采购以及战略产品开发至关重要。传统的供应链情报系统通常受限于它们对从不同来源收集分布式和碎片化产品数据的依赖。它们的分析通常局限于基于这些不完整的数据集构建静态产品网络。因此,它们无法满足动态、现实生产环境的需求,因为它们缺乏映射成品、品类和公司间隐藏脆弱性和机遇所需的配方级智能(Huang et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib16))。因此,超越这种静态、数据有限的范式,代表了供应链分析中的一个有前景的研究方向(Zhang et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib9))。

最近,多智能体深度研究系统的出现,通过主动搜索、检索和处理当前网络信息,承诺了一条通向生成式知识发现的路径(Xu et al., 2024 (https://arxiv.org/html/2605.26835#bib.bib15))。然而,应用于供应链或产品研究的现有多智能体框架仍然受到四个基本限制的严重制约。首先,它们缺乏真正的自主搜索能力。这些系统要么需要预处理过的干净文本数据(Jannelli et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib6)),要么通过僵化的、预定义的工作流程和固定提示来运行,这些提示旨在仅检索特定、已知的信息类型(例如,供应商新闻)(Quan and Liu, 2024 (https://arxiv.org/html/2605.26835#bib.bib7))。因此,它们无法动态确定搜索什么或调查多深,以应对模糊、复杂的问题。这些系统因此充当检索工具而非自主分析者,无法处理多样化的供应链查询(Dong et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib10))。

第二个关键缺陷是缺乏可验证的、量化的不确定性。即使是基于ChatGPT或Gemini的最先进的深度研究智能体,也会生成带有未经验证的引用的叙述性摘要,这些引用容易产生幻觉(Huang et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib16))。更根本的是,它们缺乏评估来源可靠性的机制。它们也无法量化每个智能体输出的不确定性如何在多智能体管道中传播,从而影响最终答案的置信度(Nahar et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib17))。因此,虽然可能引用单个来源,但最终建议本身没有携带其不确定性的量化,这对于供应链决策制定是一个致命的缺陷,因为管理决策必须基于具有明确、可追溯置信水平的证据(Tseng et al., 2018 (https://arxiv.org/html/2605.26835#bib.bib19); Simangunsong et al., 2012 (https://arxiv.org/html/2605.26835#bib.bib18))。

此外,第三个缺陷是缺乏可解释性和可审计性。这些系统的推理过程是一个黑盒。像OpenAI或Google的深度研究智能体这样的工具,无法展示它们的多智能体系统是如何得出关于材料瓶颈或替代路径的结论的(Chan et al., 2024 (https://arxiv.org/html/2605.26835#bib.bib20))。这使得它们不适合战略供应链规划,因为理解推荐背后的推理与推荐本身同样重要(Kosashi et al., 2024b (https://arxiv.org/html/2605.26835#bib.bib21))。

最后,另一个挑战是智能体结构性知识构建:供应链研究需要在复杂系统上进行构建和推理,而不仅仅是叙述性综合。这需要一个多智能体框架,该框架集成诸如编码智能体之类的工具,以构建结构化的中间模型(例如,知识图谱)并执行分析。现有的深度研究系统如OpenAI或Google的,仅限于网页搜索和推理(Zhou et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib22)),缺乏这种结构化分析能力,使它们不足以用于自主供应链研究。

为解决这些限制,我们提出Helicase,一个基于LLM的智能体多智能体系统,用于自主供应链发现。这个名称借鉴了生物学的解旋酶,它解开DNA以暴露其中编码的信息;类似地,我们的系统迭代地解开不透明的供应链查询,梳理模糊的术语、潜在的依赖关系和跨异构网络来源的碎片化证据。Helicase引入了供应链调查实际需要的*多模态证据*:PDF格式的监管文件和公司可持续发展报告、嵌入产品页面中的成分和组件披露、供应商目录和行业新闻电子表格中的表格数据,以及来自互动社交平台(例如,Twitter/X、LinkedIn帖子、行业论坛)的非结构化信号,这些平台上的供应商公告、召回通知和中断警报通常在正式索引之前出现。如图2所示,Helicase实现了一个闭环螺旋过程,融合了上下文查询扩展、多源证据收集与可靠性评分,以及通过编码智能体进行知识图谱构建。至关重要的是,它产生的不是叙述性摘要,而是一个经过验证的结构化知识图谱,带有实体及其实体间关系不确定性的注释,可直接用于下游的供应链分析。

为指导我们的研究,我们提出了三个与研究议程一致的研究问题:
- •RQ1(能力):自主AI系统如何回答答案分散在多个来源中且未记录在任何单个文档中的供应链问题?
- •RQ2(可信度):这样的系统如何产生可验证、可靠的答案,使从业者能够自信地用于决策?
- •RQ3(架构):如何设计自主供应链发现系统以适应不同难度和主题的问题,同时构建可靠、高质量的供应链知识?

为了回答这些问题,我们引入并在供应链查询评估(SCQA)基准上评估Helicase,该基准涵盖四个复杂性象限。我们的结果表明,前沿LLM和现有的智能体框架在结构性供应链推理上失败,而Helicase成功自动化端到端发现,并带有明确的不确定性量化。我们的贡献有三点:(1)Helicase架构,用于不确定性感知的结构性供应链发现,是对供应链MAS研究中长期识别的协调和信任挑战的智能体响应(Xu et al., 2021 (https://arxiv.org/html/2605.26835#bib.bib44));(2)一个三层次不确定性量化框架(行动、轨迹、记忆),解决了近期智能体SCM研究提出的幻觉和验证担忧(Jannelli et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib6); Menache et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib48));(3)发布SCQA,这是第一个旨在跨四个复杂性象限严格评估智能体供应链发现的基准。

## 2 相关工作

### 2.1 从经典多智能体系统到供应链管理中的智能体大语言模型

多智能体系统(MAS)自21世纪初以来就在供应链管理中得到了研究,其潜力在于自主决策,但Xu等人(2021 (https://arxiv.org/html/2605.26835#bib.bib44))记录到,由于四个持续存在的障碍,该研究计划在工业实践中基本停滞:(i)设计和调试定制智能体逻辑的高成本,(ii)可扩展性差,仅限于玩具场景,(iii)智能体之间协调脆弱,以及(iv)基于规则的智能体无法泛化到它们手工制作的知识之外。最近的智能体LLM进展直接解决了这些障碍:基于LLM的智能体从一开始就具有广泛的一般知识,用自然语言交流,灵活使用工具,并且无需专业编程即可组合(Bubeck et al., 2023 (https://arxiv.org/html/2605.26835#bib.bib46); Li et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib47))。早期应用于供应链谈判(Jannelli et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib6))和物流同步(Li et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib47))说明了前景,而最近的工作警告说,智能体LLM继承了管理偏见(Chen et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib49)),并且如果没有明确的验证,可能会产生自信但错误的决策(Menache et al., 2025 (https://arxiv.org/html/2605.26835#bib.bib48))。我们的工作处于这个交叉点:我们展示了智能体LLM可以驱动端到端的供应链发现,但前提是配备了明确的多层不确定性量化,以遏制幻觉并校准下游信任。

### 2.2 可见性、复杂性与发现问题

现代供应链存在结构性可见性差距:关于供应商产品组合、成分来源和隐藏依赖关系的智能信息散布在孤立、非结构化的来源中(Agrawal et al., 2024 (https://arxiv.org/html/2605.26835#bib.bib23); Kalaiarasan et al., 2023 (https://arxiv.org/html/2605.26835#bib.bib24))。供应链网络被认为是复杂自适应系统(Choi et al., 2001 (https://arxiv.org/html/2605.26835#bib.bib45)),其中间接的、跨层的依赖关系产生于没有任何单个参与者完全观察到的交互。这种不可见性掩盖了级联风险和可持续替代方案,需要数字供应链监控,积极揭示静态系统遗漏的内容。

为应对这种可见性差距,新兴的数字供应链监控(DSCS)领域倡导系统性地、技术驱动地监控和发现来自异构外部来源的供应链智能(Brintrup et al., 2024 (https://arxiv.org/html/2605.26835#bib.bib2))。DSCS超越了传统企业系统,后者跟踪已知关系中的已知实体,转向主动发现未知实体、未记录的联系和新兴风险。这种范式转变将供应链分析从被动报告转变为主动调查。然而,现有的DSCS方法仍然受到三个相互关联的限制的严重制约。首先,它们是被动的(Zheng and Brintrup, 2025 (https://arxiv.org/html/2605.26835#bib.bib25)),在固定的、预先收集的语料库上运行,而不是主动搜索新信息以填补知识空白(第2.3节)。其次,它们仅限于非复杂、高可见性查询,无法综合多跳、低可见性问题的答案,这类问题需要构建多步骤的结构性和逻辑知识(第2.4节)。第三,它们不是不确定性感知的,没有提供来源可靠性的量化或综合结论中的置信度(第2.5节)。

相似文章

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。