用于工业4.0智能体评估的合成场景生成
摘要
本文扩展了AssetOpsBench,增加了智能电网变压器资产类别,并引入了ScenarioGeneratorAgent,一个用于合成工业智能体场景生成的流水线,在保持场景质量的同时实现了8倍的运行时间改进。
arXiv:2607.22563v1 公告类型:新
摘要:工业智能体基准测试需要集成了遥测、故障模式、维护记录和领域标准的真实评估场景。然而,现有基准测试(如AssetOpsBench)依赖于手动编写的场景,且覆盖的资产类别有限。我们扩展了AssetOpsBench,增加了智能电网变压器资产类别和四个基于IEC的诊断工具,用于健康指数预测、溶解气体分析、绕组温度评估和负载曲线评估。我们还引入了ScenarioGeneratorAgent,这是一个用于合成工业智能体场景生成的流水线。该流水线构建基于证据的资产配置文件,跨运营域分配覆盖感知的场景预算,并通过混合验证与修复循环生成候选场景,确保模式有效性、工具可达性、物理合理性、标准对齐和去重。为提高可扩展性,我们应用了两级缓存、并行焦点组生成、线程池卸载、批处理LLM调用和早期拒绝过滤。在智能电网变压器场景生成中,这些优化将50个场景的端到端运行时间减少了8倍,同时保持了质量,综合质量得分为74.2±1.9,而未优化基线为73.8±3.0。这些结果表明,基于标准的合成场景生成能够在不牺牲场景质量的情况下有效扩展工业智能体基准测试。
查看缓存全文
缓存时间: 2026/07/28 06:23
# 面向工业4.0智能体评估的合成场景生成 来源:https://arxiv.org/abs/2607.22563 查看PDF (https://arxiv.org/pdf/2607.22563) > 摘要:工业智能体基准测试需要集成遥测数据、故障模式、维护记录及领域标准的逼真评估场景。然而,现有基准如 AssetOpsBench 依赖人工编写的场景,且覆盖的资产类别有限。我们为 AssetOpsBench 扩展了智能电网变压器资产类别,并提供了四项基于 IEC 的诊断工具,用于健康指数预测、溶解气体分析、绕组温度评估和负载曲线评估。我们进一步提出了 ScenarioGeneratorAgent,一个用于合成工业智能体场景的生成流水线。该流水线构建基于证据的资产配置文件,跨操作域分配覆盖感知的场景预算,并通过混合验证-修复循环生成候选场景,确保模式有效性、工具可达性、物理合理性、标准一致性及去重。为提升可扩展性,我们应用了两级缓存、并行焦点组生成、线程池卸载、批量化 LLM 调用及早期拒绝过滤。在智能电网变压器场景生成中,这些优化措施将 50 个场景的端到端运行时间降低了 $8\times$,同时保持质量,综合质量得分为 $74.2 \pm 1.9$,而未经优化的基线为 $73.8 \pm 3.0$。这些结果表明,基于标准的合成场景生成能够高效扩展工业智能体基准,且不牺牲场景质量。 ## 提交历史 来自:Sagar Chethan Kumar [查看邮箱 (https://arxiv.org/show-email/de246e41/2607.22563)] **\[v1\]**2026年5月29日星期五 16:42:23 UTC (390 KB)
相似文章
Agent Seer:从规范理解合成场景
Agent Seer 是一个管道,它从工具规范中合成真实的 AI 代理评估场景,无需手动整理,从而提高多轮对话中工具调用的正确性和对话连贯性。
面向高效鲁棒电网调度的决策聚焦场景生成与选择
本文提出了一种面向电网调度中分布鲁棒优化的决策聚焦生成框架,用于生成相关场景。该框架基于下游运营成本而非预测准确性来优化场景。与不同生成模型下的精度导向方法相比,运营成本降低了0.80%-2.02%。
AgentMercury:您的代理能大规模合成业务场景的可验证环境
AgentMercury 引入了一个可扩展框架,用于从业务场景中合成可验证环境,使强化学习代理能够提升在企业工作流和域外基准测试中的性能。
通过Transformer揭示UTM安全关键场景
本研究论文提出了一种基于Transformer的强化学习框架,用于自动生成无人交通管理(UTM)系统的安全关键测试场景,在漏洞发现效率上比专家引导测试提高了8倍。
基于真实世界故障记录的自动驾驶系统测试场景生成
本文提出了一种模块化的LLM流水线,利用历史故障记录(例如NHTSA碰撞数据)生成多样化的自动驾驶系统测试场景,从而在有限的测试预算内实现有效的故障发现。