AgentFAIR:面向地理空间数据集FAIR原则评估的多智能体协作框架

arXiv cs.AI 论文

摘要

AgentFAIR是一个多智能体框架,利用LLM评估器和批评者来评估地理空间数据集的FAIR合规性,在专家研究中实现了89%的子原则一致性和Fleiss κ=0.71,每个数据集成本为0.054美元。

arXiv:2607.15781v1 公告类型:新 摘要:地理空间数据集支持从城市规划到气候建模的应用,但一致评估FAIR合规性却很困难。现有评估器使用不同的评分标准和证据来源,并且可能在JavaScript渲染页面或特定于存储库的标识符上失败。对于来自10个存储库的50个数据集,各工具归一化得分的标准差平均为15.0个百分点,其中一个数据集达到30.3个百分点。由于这些输出并非等效度量,我们将其用于描述不一致性和失败模式,而非比较准确性。我们提出了AgentFAIR,一个结合结构化元数据提取与13个特定子原则LLM评估器的多智能体框架。每个评估器产生0-3的成熟度分数、引用证据和建议;一个批评者检查证据和一致性,并可请求针对性重新评估。平均可发现性、可访问性、互操作性和可重用性得分分别为79.7%、70.4%、45.3%和72.0%。与四个基线工具的秩相关系数在0.31到0.61之间;FAIR-enough比较不具有统计显著性。在10个数据集的重复运行子集上,子原则一致性平均为89%(标准差:3个百分点),而无批评者时为71%。一项初步的15数据集专家研究得出Fleiss kappa为0.71,与专家共识的一致率为82%。API成本约为每个数据集0.054美元。这些结果支持了可审计性和可行性,但有限的基准、不完整的消融实验以及单一模型系列的验证限制了关于准确性和泛化性的论断。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:23

# AgentFAIR:面向地理空间数据集FAIR度评估的多智能体协作框架
来源:https://arxiv.org/html/2607.15781
以及Pranav Pai 墨尔本大学 澳大利亚维多利亚州墨尔本

\(2026\)

###### 摘要

地理空间数据集支撑着从城市规划到气候建模等应用,但其对FAIR原则(可查找性、可访问性、互操作性和可重用性)的遵守情况难以一致地评估。现有的评估工具采用不同的评分标准和证据来源,并且可能在JavaScript渲染的页面或特定于存储库的标识符方案上失败。在对来自10个存储库的50个数据集进行的诊断研究中,各可用工具的归一化分数平均标准差为15.0个百分点,在单个数据集上达到30.3个百分点。由于这些归一化输出并非等效测量,我们使用它们来刻画不一致性和失败模式,而非比较准确性。

我们提出AgentFAIR,一个多智能体框架,结合了结构化元数据提取与13个特定于子原则的大语言模型(LLM)评估器。每个评估器返回0–3的成熟度评分、引用证据和建议;一个批评者智能体应用证据和一致性检查,并可请求有针对性的重新评估。在50个数据集的样本中,平均可查找性、可访问性、互操作性和可重用性得分分别为79.7%、70.4%、45.3%和72.0%。AgentFAIR与四个基线工具之间的秩相关系数范围为ρ=0.31至0.61,与FAIR-enough的比较在统计上不显著。在10个数据集的重复运行子集上,子原则一致性平均为89%(报告标准差:3个百分点);批评者消融实验显示无批评者时一致性为71%。一项初步的15个数据集专家研究得到Fleiss' κ=0.71,子原则与专家共识的一致性为82%。测得的API成本约为每个数据集0.054美元。这些结果支持了框架的可审计性和可行性,但有限的基准、不完整的组件消融以及单一模型族验证制约了关于准确性和泛化能力的声明。

地理空间数据集,FAIR原则,多智能体系统,大语言模型,元数据质量

††版权:无††期刊年:2026††会议:修订稿经同行评审;2026††CCS:信息系统 数据管理系统 数据质量††CCS:计算方法 人工智能 自然语言处理 文本挖掘††CCS:信息系统 数据起源

## 1. 引言

FAIR数据原则——可查找性、可访问性、互操作性和可重用性——为数字研究输出的可重用性和机器可操作性提供了广泛采纳的指导(Wilkinson等人,2016 (https://arxiv.org/html/2607.15781#bib.bib1))。在地理空间科学中,FAIR度(FAIR合规性;*非*算法公平性)尤为重要:空间图层、栅格和时空产品经常跨机构、司法管辖区和科学社区进行整合。然而,由于不一致的元数据实践、异构格式(例如,Shapefile、GeoTIFF、NetCDF)以及不完整的空间参考信息,许多地理空间数据集仍然只是部分符合FAIR(Thompson等人,2023 (https://arxiv.org/html/2607.15781#bib.bib2); Paprotny and Mengel, 2023 (https://arxiv.org/html/2607.15781#bib.bib3))。根据欧盟委员会的成本效益分析,非FAIR实践估计每年因重复努力和失败的重用给欧盟研究经济造成102亿欧元的损失(PwC EU Services, 2018 (https://arxiv.org/html/2607.15781#bib.bib30))。

现有的自动化FAIR评估工具,如F-UJI(Devaraju and Huber, 2020 (https://arxiv.org/html/2607.15781#bib.bib5))和FAIR-Checker(Gaignard等人,2023 (https://arxiv.org/html/2607.15781#bib.bib6)),提供了重要的机制性检查(例如,持久标识符、许可、基本模式标记)。然而,确定性方法面临一些局限性,这些局限性在地理空间资源中被放大:(i) **动态元数据暴露**:存储库登录页面越来越依赖JavaScript渲染和API驱动的内容,这破坏了传统的爬虫并导致部分或缺失的证据收集;(ii) **存储库异质性**:标识符和元数据实践差异很大(DOI、Handle、内部URI;不同的模式配置文件),因此硬编码的假设(例如,DataCite中心化的解析模式)可能导致脆性失败;(iii) **有限的语义判断**:基于规则的检查无法可靠地评估元数据的定性和领域特定方面,例如坐标参考系统是否有效、访问约束是可选的还是强制的、或者术语是否反映社区标准;(iv) **低分数可比性**:最近的分析表明,不同工具对FAIR的操作化不同,导致显著的分数差异,并使管理决策依赖于工具(Candela等人,2024 (https://arxiv.org/html/2607.15781#bib.bib4); Krans等人,2022 (https://arxiv.org/html/2607.15781#bib.bib8))。

此外,地理空间FAIR度分析依赖于领域约定,通用工具通常将这些约定视为不透明字符串。例子包括ISO(国际标准化组织)19115元数据配置文件(International Organization for Standardization, 2014 (https://arxiv.org/html/2607.15781#bib.bib9))、坐标参考系统标识符(EPSG代码)以及OGC发现和访问约定(例如,WMS、WFS和STAC端点)。由于许多地理空间词汇未在通用本体注册中心注册,语义验证器可能系统性低估互操作性,即使数据集遵循社区实践。

为了应对这些挑战,我们提出AgentFAIR,一个多智能体协作框架,结合了:(i) 机器可读元数据和标识符的确定性提取,以及(ii) 特定子原则的LLM智能体,执行基于证据的语义评估。如图1 (https://arxiv.org/html/2607.15781#S1.F1)所示,该系统编排了一个流水线,处理数据集登录页面,提取元数据,使用专门智能体评估每个FAIR子原则,并通过运行批评者智能体应用基于批评的质量控制,以确保基于证据的评分和跨原则的一致性。当证据不足或内部不一致时,批评者智能体会触发有针对性的重新评估(重试机制)并附上细化指令,从而提高鲁棒性并保持可追溯性。总体而言,AgentFAIR评估所有13个FAIR子原则(F1–F4, A1.1–A2, I1–I3, R1.1–R1.3),采用0–3的成熟度等级,并输出Markdown报告、JSON评估、SQLite证据存储和本地执行跟踪。远程LangSmith跟踪是可选的,默认关闭。

我们在来自10个存储库的50个地理空间数据集上评估AgentFAIR,包括Zenodo¹¹¹https://zenodo.org/(提供DOI分配的研究输出开放存储库)、Dryad²²²https://datadryad.org/(支持已发表科学研究的数据集的策展存储库)、Harvard Dataverse³³³https://dataverse.harvard.edu/(用于共享和引用研究数据的通用存储库)、PANGAEA⁴⁴⁴https://www.pangaea.de/(地球和环境科学地理参考数据集存储库)、NOAA NCEI⁵⁵⁵https://www.ncei.noaa.gov/(气候、海洋和环境数据的全球存档)以及领域特定门户。我们与四个广泛使用的FAIR评估器(F-UJI(Devaraju and Huber, 2020 (https://arxiv.org/html/2607.15781#bib.bib5))、FAIR-Checker(Gaignard等人,2023 (https://arxiv.org/html/2607.15781#bib.bib6))、FAIRshake(Clarke等人,2019 (https://arxiv.org/html/2607.15781#bib.bib23))、FAIR-enough(Emonet and Dumontier, 2022 (https://arxiv.org/html/2607.15781#bib.bib21)))进行比较,并分析(i) 整体FAIR成熟度模式,(ii) 跨工具一致性和失败模式,(iii) 成本和运行时特征,以及(iv) 重复评估的一致性。

参照图注:系统图展示AgentFAIR的流水线:URL输入、编排、带批评者循环的智能体执行、审计轨迹的持久化以及报告。

图1. 提出的AgentFAIR多智能体协作FAIR度评估框架。

据我们所知,AgentFAIR是首个专门设计用于FAIR合规性评估的多智能体LLM框架。它将批评者知情的反馈循环与特定地理空间推理相结合。本工作的主要贡献如下:

- • **首个LLM驱动的多智能体FAIR评估器**。我们提出AgentFAIR,一个具有基于批评的质量控制和明确地理空间标准意识的协作多智能体框架。据我们所知,它是首个将LLM推理与领域特定FAIR评估相结合的系统。
- • **透明且细粒度的评分协议**。我们为每个FAIR子原则操作化了一个0–3的成熟度评分标准,并明确将地理空间指标映射到互操作性和可重用性的评估中。
- • **跨存储库的实证研究**。我们在10个存储库的50个地理空间数据集上进行了评估。样本显示出强的可查找性(79.7%)和弱的互操作性(45.3%),但无意建立长尾泛化。
- • **评估器不一致性和可行性的诊断分析**。我们量化了跨工具不一致性(每个数据集平均标准差15.0个百分点;最大30.3),记录了存储库特定的失败模式,并测得了平均API成本约为每个数据集0.054美元。这些比较并未将异构工具分数视为等效的准确性度量。

论文的其余部分组织如下。第2节回顾了FAIR评估工具、地理空间数据质量和多智能体LLM架构的相关工作。第3节形式化了任务定义和评分协议。第4节详细介绍了AgentFAIR框架的设计与实现。第5节展示了评估及其局限性,第6节总结全文。软件工件、数据集列表、提示结构以及LangGraph编排细节在附录中提供。源代码可在https://doi.org/10.5281/zenodo.18529560和https://github.com/MingCHEN-Github/AgentFAIR获取。

## 2. 相关工作

### 2.1. 自动化FAIR评估工具

自动化FAIR评估器通常将原则操作化为预定义的、机器可检查的指标(例如,持久标识符的存在、协议支持、机器可读许可),并将结果聚合为每个原则的分数。F-UJI实现了FAIRsFAIR评估指标,从数据集登录页面和暴露的元数据中收集证据,并辅以对外部注册中心的查询(Devaraju and Huber, 2020 (https://arxiv.org/html/2607.15781#bib.bib5))。FAIR-Checker强调通过利用知识图谱和SHACL/SPARQL约束进行语义验证(Gaignard等人,2023 (https://arxiv.org/html/2607.15781#bib.bib6))。FAIRshake提供社区策展的评分标准,针对不同的数字资源类型(Clarke等人,2019 (https://arxiv.org/html/2607.15781#bib.bib23)),而FAIR-enough提供一套更广泛的、主要是二值检验的套件,在证据部分或间接表达时可能较为保守(Emonet and Dumontier, 2022 (https://arxiv.org/html/2607.15781#bib.bib21))。一个反复出现的挑战是,工具在操作定义、证据来源和聚合规则上存在差异,导致跨评估器的分数不可直接比较(Candela等人,2024 (https://arxiv.org/html/2607.15781#bib.bib4))。

表1 (https://arxiv.org/html/2607.15781#S2.T1)总结了这些系统相对于AgentFAIR的代表性能力。对于基线,*覆盖率*表示一个工具——或者我们对其输出的映射——是否支持用于本论文所有13个FAIR子原则的评估。

表1. FAIR评估系统比较。LLM=评估循环中的LLM推理;Geo-aware=明确识别地理空间标准;Explain=基于证据的评分理由;Trace=持久化的审计轨迹;Cross-P=跨原则一致性检查;Coverage=支持此处使用的所有13个子原则评估的能力。

### 2.2. 地理空间数据的FAIR度和质量

地理空间数据集的FAIR度评估与经典的空间数据质量问题相交,包括空间参考一致性、分辨率/比例尺、时间范围以及对领域标准的遵守。元数据标准如ISO 19115(International Organization for Standardization, 2014 (https://arxiv.org/html/2607.15781#bib.bib9))使得对空间资源的丰富描述成为可能,但存储库在如何完整地以机器可读形式捕获和暴露这些元数据元素方面差异很大。因此,依赖通用模式、脆性模式匹配或不完整注册中心覆盖的自动化检查器可能会遗漏地理空间信号(例如,CRS标识符或地理空间服务端点),这可能会系统性降低空间数据集的互操作性——以及下游的可重用性分数。

### 2.3. 数据管理与评估中的LLM智能体

大语言模型在从异构来源提取、规范化和丰富元数据方面显示出潜力(Busch等人,2025 (https://arxiv.org/html/2607.15781#bib.bib13); Zhang等人,2025 (https://arxiv.org/html/2607.15781#bib.bib14))。近期的系统将LLM推理与工作流编排相结合,以自动化数据清洗、验证和质量评估(Li等人,2024 (https://arxiv.org/html/2607.15781#bib.bib16); Huang and Wu, 2024 (https://arxiv.org/html/2607.15781#bib.bib27); Narayan等人,2024 (https://arxiv.org/html/2607.15781#bib.bib36))。然而,将LLM应用于FAIR评估引入了额外的要求——一致的评分标准、基于证据的证明以及可审计的轨迹——而明确解决这些要求的系统性多智能体设计,特别是在地理空间标准下,仍然有限。

### 2.4. 多智能体LLM架构

多智能体框架将复杂任务分解为由专门智能体执行的协调子任务,通常通过结构化交互和自我批评来提高鲁棒性(Xi等人,2024 (https://arxiv.org/html/2607.15781#bib.bib34); Wang等人,2024 (https://arxiv.org/html/2607.15781#bib.bib38))。AutoGen(Wu等人,2024 (https://arxiv.org/html/2607.15781#bib.bib31))引入了对话式多智能体模式,实现灵活的智能体交互,而MetaGPT(Hong等人,2024 (https://arxiv.org/html/2607.15781#bib.bib32))展示了基于角色的软件工程任务协作。AgentBench(Liu等人,2024 (https://arxiv.org/html/2607.15781#bib.bib33))和TheAgentCompany(Xu等人,2024 (https://arxiv.org/html/2607.15781#bib.bib35))等基准评估了智能体在现实世界任务上的能力,提供了我们为FAIR合规性评估调整的评估思路。对于地理空间领域,基础模型应用(Mai等人,2024 (https://arxiv.org/html/2607.15781#bib.bib37))突出了将LLM应用于空间信息理解时的潜力和领域特定挑战。基于这些架构模式,AgentFAIR将批评者知情的反馈循环与基于证据的提示和明确的地理空间标准意识相结合,以支持透明、可审计的FAIR评分。

表2. 本文使用的13个FAIR子原则的操作化:

相似文章

AgentCompass: 统一智能体能力评估基础设施

arXiv cs.AI

AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。

基于多智能体协作推理与工具增强证据的城市区域画像

arXiv cs.AI

本文提出 UrbanAgent,一个将城市区域画像重新定义为基于推理的推断问题的智能体框架,利用多智能体协作推理和工具增强的证据检索。在全球城市数据集上的碳排放、GDP和人口估算任务中,该框架优于基线方法,R²平均提升8.1%。

ForeSci:评估LLM代理的前瞻性AI研究判断

arXiv cs.AI

介绍了ForeSci,一个时间控制基准,用于评估LLM代理是否能够基于历史证据做出前瞻性研究判断。它包含跨越四个AI领域的500个任务,结果表明显式的证据组织提高了可追溯性,但揭示了反复出现的证据-决策解耦。