EO-Agents:面向地球观测假设生成的三智能体LLM流水线
摘要
EO-Agents 提出了一种三智能体LLM流水线,用于生成地球观测假设,利用NASA知识图谱和图神经网络对候选数据集配对进行排序,LLM智能体负责筛选、生成和评估结构化研究假设。
arXiv:2607.01584v1 公告类型:新
摘要:大型语言模型近期被用于科学假设生成,但大多数先前工作依赖于非结构化文献和自由形式的文本声明。我们提出了一种面向地球观测的流水线,直接将假设生成建立在NASA地球观测知识图谱之上。一个基于历史共现关系训练的异构图神经网络对候选数据集配对进行排序,而一个三智能体LLM流水线则负责筛选、生成和评估结构化研究假设。将该系统应用于1475个NASA数据集后,生成了160个跨越多个地球科学领域的假设,包括生态水文学、冰川学、气溶胶-云相互作用、植被物候和平流层化学。模型预测的新颖数据集配对在可信度上几乎与文献中保留的真实共现关系相当,表明该流水线能够发掘科学上连贯但尚未探索的组合。一项在GPT-5.2和Claude Sonnet 4.6上进行的2×2×2因子实验显示,假设排名保持稳定,而绝对分数强烈依赖于评判者身份,这凸显了单评判者LLM评估的局限性。
查看缓存全文
缓存时间: 2026/07/03 05:44
D
相似文章
迈向可审计的AI科学家:面向LLM代理的假设演化协议
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
GeoNatureAgent Benchmark:跨前沿与开源权重基础模型的环境地理空间分析LLM代理基准测试
本文介绍了GeoNatureAgent Benchmark,这是首个通过结构化工具调用评估LLM代理在环境地理空间分析任务上表现的基准。它对18个类别的93项任务中的七个模型进行了评估,发现Claude Sonnet 4以60.8%的准确率领先,而DeepSeek V3.2等开源权重模型则提供了强大的性价比。
面向地理空间数据检索的风险感知LLM代理:设计与初步对抗性评估
介绍了一种基于LLM的框架,通过自然语言查询从基于云的地理空间目录中检索遥感数据,重点关注安全性和对抗鲁棒性。该系统集成了三个代理,用于意图解释、API调用生成和风险管理。
工具增强型LLM代理在实际能源分析任务中的表现如何?
本文介绍了一项实证研究和基准测试,用于评估工具增强型LLM代理在实际能源分析任务上的表现,包含243个由专家策划的问题,涵盖市场数据检索、知识解读和定量建模。
EurekAgent:智能体环境工程——自主科学发现的全部所需
本文介绍了EurekAgent,一个经过环境工程设计的智能体系统,用于指标驱动的自主科学发现。在数学、内核工程和机器学习任务上,它以极低的计算成本取得了最先进的结果。