工具增强型LLM代理在实际能源分析任务中的表现如何?
摘要
本文介绍了一项实证研究和基准测试,用于评估工具增强型LLM代理在实际能源分析任务上的表现,包含243个由专家策划的问题,涵盖市场数据检索、知识解读和定量建模。
arXiv:2606.26346v1 公告类型: 新
摘要:通用和特定领域的智能体基准测试已相继出现,涵盖金融、编程、法律和药物发现等领域,然而能源领域的评估仍然主要局限于静态知识回忆。这对于一个需要实时数据检索、专业监管和市场知识以及多步骤定量推理的行业来说,是一个关键缺口。
我们提出了一项关于工具增强型LLM代理在实际能源市场分析任务中的实证研究。我们的评估环境包含243个由专家策划的问题,分为三类:(1) 市场数据检索与分析,(2) 知识检索与解读,(3) 高级定量建模与决策分析。任务包括价格与需求分析、费率影响建模、资产收入与回报估算、对冲策略分析以及优化建模,问题涵盖多个难度级别。
代理配备了一套可配置的领域工具,包括美国主要独立系统运营商(ISO)的实时电力市场API、监管案卷搜索、公用事业费率数据库、资产优化模型以及能源市场文档的检索增强生成。我们使用多维评估协议评估代理的响应,该协议对方法的正确性、答案的准确性、属性对齐和来源有效性进行评分,并通过类别感知路由将评分标准与问题类型匹配。我们评估了闭源和开源LLM,提供了关于模型能力与领域工具在高风险专业领域如何相互作用的比较分析。关键工件已公开发布,以支持可重复性和未来研究。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 工具增强型LLM智能体在真实世界能源分析任务中的表现如何? 来源:https://arxiv.org/html/2606.26346 David Akinpelu 独立研究员 & Akintonde Abbas Tume AI & Rereloluwa Alimi Tume AI & Ayodeji Lana 独立研究员 ###### 摘要 尽管智能体基准测试已在通用领域和特定领域(包括金融、编程、法律和药物发现)中涌现,但能源领域的评估仍然局限于静态知识回忆。对于一个需要实时数据检索、专业监管和市场知识以及多步定量推理的行业来说,这是一个关键缺口,且需在真实世界约束下进行。尽管能源领域复杂且具有社会重要性,但其在动态、工具增强评估已相当成熟的领域中仍然服务不足。 我们提出了一个关于工具增强型LLM智能体在真实世界能源市场分析任务上的实证研究。我们的评估环境包含243个专家策划的问题,涵盖三大类别:(1)市场数据检索与分析、(2)知识检索与解读、(3)高级定量建模与决策分析,包括价格和需求分析、电价影响建模、资产收入与回报估算、对冲策略分析以及优化建模等任务,每个任务按多个难度级别评分。 智能体配备了一套可配置的领域工具,包括美国主要ISO的实时电力市场API、监管案卷搜索、公用事业电价数据库、资产优化模型以及能源市场文档的检索增强生成。为了从多个维度评估智能体表现,我们采用多维度评估协议,对回答的正确性、答案准确性、属性对齐和来源有效性进行评分,并根据问题类型采用类别感知路由匹配评分标准。我们评估了闭源和开源LLM,提供了关于模型能力与领域工具在高风险专业领域交互的比较分析,并公开发布了关键工件。 ## 1 引言 能源领域是AI辅助决策支持中分析需求最高的领域之一。能源市场专业人员通常需要综合处理异构、时间敏感的信息,涵盖实时市场价格、复杂的监管框架、资产级财务模型,以及来自ISO/RTO市场系统、公用事业电价、互联排队和气象服务的数据集。公用事业公司、独立发电商、监管机构和咨询公司的分析师在这些工作流中操作时,错误会带来实质性的财务和运营后果。大语言模型(LLM)在自然语言理解、知识检索和结构化推理方面展现出强大能力[28, 2, 16]。工具增强型智能体框架的出现——模型通过迭代调用外部工具来检索数据和执行计算——进一步扩展了LLM在专业分析工作流中的潜力[43, 33]。特定领域的基准测试已开始在金融、法律、软件工程和药物发现中评估此类系统[41, 8, 18, 21, 10]。 尽管取得了这些进展,能源领域仍然在很大程度上缺席严格的智能体评估。以往能源领域的AI工作大多集中于预测任务,如负荷预测、可再生能源发电估计和电力价格预测,使用监督学习基于历史数据[19, 38]。电力研究院(EPRI)的WattWorks基准测试评估了LLM在电力系统问题上的表现,但没有评估进行反映真实分析师实践的多步分析工作流的工具增强型智能体[15]。因此,目前尚无基准测试评估LLM智能体是否能在现实运营约束下执行端到端的能源分析工作流。为填补这一空白,我们引入EnergyEvals,一个用于工具增强型LLM智能体在真实世界能源分析任务上的评估框架。第一版聚焦于美国电力市场分析,未来版本将扩展到其他地区和能源子领域。本文做出以下贡献: - • 一个包含243个专家策划任务的领域基准,涵盖三大核心能力领域——市场数据检索与分析、知识检索与解读、高级定量建模与决策分析。每个类别包含三个难度级别(简单、中等、困难)的任务,由拥有博士水平培训且合计行业经验超过25年、曾在领先能源咨询和工程组织工作的从业者生成。 - • 一个可配置的智能体评估环境,为智能体提供九个领域工具,包括覆盖美国所有主要批发市场的实时ISO/RTO市场API、公用事业电价数据库、监管案卷搜索、可再生能源发电模拟、电池收入优化以及能源市场报告和市场协议文档的检索增强生成。 - • 一个多维度评估协议,采用类别感知评分规则路由,通过多个LLM作为评委的框架评估方法正确性、答案准确性、属性对齐和来源有效性,并根据能源分析领域专家定义的具体质量要求进行校准。 - • 对七个前沿LLM的实证研究,涵盖闭源和开源模型,揭示了模型特定的性能概况和失败模式,这些在高风险专业领域的现实智能体任务执行中才会出现。 - • 公开发布基准数据集、评估框架、评分代码以及部分智能体执行轨迹,以支持可复现性和社区扩展。 本文其余部分组织如下:第2节概述相关工作。第3节描述基准数据集。第4节介绍智能体架构和工具套件。第5节定义评估协议。第6节报告实验结果。第7节涵盖结论和后续步骤。 ## 2 相关工作 随着工具使用框架的成熟,针对智能体大语言模型(LLM)系统的基准测试研究迅速扩展。早期的通用基准测试表明,即使是前沿模型,现实世界中的多步推理仍然困难。GAIA评估了网络增强型推理任务,其中非专家人类解决了92%的问题,而最先进的模型得分低于30%[27],SWE-bench则衡量解决真实GitHub问题的软件工程智能体[21]。AgentBench、ToolBench、τ-bench和TheAgentCompany等基准测试一致揭示了模型推理能力与成功完成任务之间在交互环境、API生态系统和模拟企业设置中的巨大差距[26, 32, 42, 40]。AstaBench进一步表明,自主科学发现仍未解决[9]。 特定领域的智能体基准测试已在专业领域出现,表明通用能力的提升不能可靠地转移到专业领域。在金融和企业分析中,Finance Agent Benchmark和InvestorBench显示即使顶级模型也仅达到中等准确率[8, 24],而CLASSIC和EnterpriseBench则强调智能体在工作流编排和工具使用中的困难[39, 36]。PaperBench和ScienceAgentBench表明复制学术研究仍然极具挑战[35, 11],并且在生产力和专业领域——包括OdysseyBench、ContextBench、MedAgentBench和LegalAgentBench——随着任务需要更深的上下文理解或领域专业知识,性能显著下降[37, 23, 20, 22]。SkillsBench仅通过三个狭窄的电力系统任务覆盖能源领域,但即使使用策划的Skills智能体,一半以上的任务失败(通过率47.5%),领域知识差距成为主要失败模式,进一步激励了将领域特定工具与代表真实能源分析师工作流的任务相结合的自定义评估框架[25]。 在能源领域,大多数AI研究集中在预测任务上,如负荷预测、电价预测和可再生能源发电建模[19, 38, 30]。近期综述指出缺乏针对现实世界分析工作流的鲁棒智能体评估框架[1]。一些近期发表的作品表明填补这一缺口的初步步骤。EPRI的WattWorks显示前沿LLM在电力部门多项选择题上表现良好(约83-86%准确率),但在开放式技术任务上下降了约27个百分点[15]。ElecBench和智能电网智能体框架确认检索增强工具改善了但未完全解决运营挑战[47, 31]。PFBench提出了一个专注于潮流分析的基准数据集,并利用标准IEEE输电测试案例[34]。GridMind和GridAgent讨论了用于输电潮流和事故分析的智能体,并在基于模拟的测试案例上进行了评估[4, 45]。PowerDAG和PowerChain提出了用于配电网分析的智能体系统[5, 6]。然而,现有工作均未关注典型能源分析师和决策者日常活动中的实际工作流。 工具增强型语言智能体为此类工作流提供了一个有前景的范式。ReAct展示了将推理与工具调用交错进行可实现迭代解优化[43],Toolformer则表明模型可以学习自主工具调用[33]。沙盒代码执行和结构化工具访问进一步扩展了智能体能力[12],尽管糟糕的工具集成可能引入新的推理错误[44]。因此,近期框架强调多维度评分和LLM作为评委的方法以更好地诊断性能[46, 14, 7]。在这些贡献的基础上,EnergyEvals评估了工具增强型智能体在现有基准中缺失的真实世界能源分析任务上,涉及实时市场数据检索、监管分析和优化建模。 ## 3 基准数据集 ### 3.1 设计理念 该数据集旨在评估工具增强型LLM智能体是否能执行真实、端到端的能源分析工作流,在一个准确性、可追溯性和定量严谨性至关重要的专业领域。任务并非测试基准式的事实回忆,而是反映实践中的能源市场分析师的工作流,包括检索实时定价数据、解读正式监管和互联文档,以及在运营现实约束下执行多步财务模型。任务开发由拥有博士水平培训且在麦肯锡、ICF、LCG Consulting和通用电气等组织拥有专业经验的领域专家领导,合计行业经验超过25年。这种从业者根基体现在提示设计中使用了市场特定术语(例如,节点定价、辅助服务资格门槛、互联里程碑)和运营约束,如效率参数、退化成本、荷电状态限制和IRR目标,这些在客户参与中很典型而非学术练习。当前版本有意限定于美国电力市场——涵盖放松管制和垂直整合区域——以确保跨任务可比性,同时保留因市场设计、电价结构以及监管和互联文档差异而产生的真实世界复杂性。未来版本将扩展覆盖范围到其他地理区域、大宗商品和相邻能源子领域。 ### 3.2 能力领域 243个任务的语料库围绕三大广泛能力领域组织,跨越三个难度级别(简单、中等、困难),分别包含107个数据任务、86个知识任务和50个定量任务(完整分布见附录A.1)。 1. 1.**市场数据检索与分析(“数据”)**。需要从ISO/RTO数据库和API中提取、聚合、过滤和格式化结构化市场数据的任务。代表性分析师职能包括日前和实时价格分析、辅助服务绩效评估、负荷和发电调度报告以及跨市场比较。示例:“根据你的ERCOT数据库,显示2023年ERCOT Houston枢纽的月度日前平均价格。” 2. 2.**知识检索与解读(“知识”)**。需要浏览正式监管文档、公用事业电价申请、市场操作手册和互联程序以回答精确的程序性和结构性问题。这些任务测试智能体识别权威来源、定位相关条款以及准确解读监管语言而不捏造内容的能力。示例:“与eac相关的费用是多少?”(原文中此句不完整,翻译时保留原样?但原文是“Example:“What are the fees associated with eac”,可能少写了一个词,如“eac”可能是缩写。按原文翻译为“示例:‘与eac相关的费用是多少?’”但保留英文缩写。)
相似文章
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
ORAgentBench:LLM代理能否端到端解决具有挑战性的运筹学任务?
本文介绍ORAgentBench,一个用于评估LLM代理在端到端运筹学任务中表现的执行基准,包含107个经过人工审查的任务。实验表明,当前最佳代理仅通过35.51%的任务,揭示了在可靠决策制定方面的重大不足。
LLM代理已经知道何时调用工具——甚至无需推理
本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。
评估SageMath增强的LLM智能体在计算与实验数学中的应用
本文提出了一种ReAct风格的智能体设置,将LLM推理与SageMath的可验证反馈相结合,并在研究级数学问题上进行了评估。结果显示,各模型性能显著提升,其中GPT-5.5取得了最高的75.2%解题率。
从数字到判断:面向欧洲上市房地产的专家型LLM智能体与强化学习
本文介绍了Larix,一个面向欧洲上市房地产分析的专家型LLM智能体框架,表明专家分解能提升数值任务表现,而强化学习(GRPO)能提升综合判断能力,且收益可迁移至未见过的公司与监管体系。