EngiAI:面向LLM驱动工程设计的 多智能体框架与基准套件
摘要
EngiAI 提出了一个用于LLM驱动工程设计的 多智能体框架和基准套件,评估工作流、RAG和HPC维度。专有模型在Beams2D上达到96-97%的任务完成率,而条件分支仍具挑战,在Photonics2D上为20-53%。
arXiv:2605.19743v1 公告类型:新
摘要:大型语言模型(LLM)智能体越来越多地应用于工程设计任务,但现有的评估框架未能充分涵盖结合模拟、检索和制造准备的多智能体系统。我们引入了一个包含三个评估维度的基准套件:(1)一个工作流基准,包含七种针对不同认知需求的提示风格——包括直接工具使用、语义消歧、条件分支和工作记忆任务;(2)一个检索增强生成(RAG)基准,采用门控评分来隔离检索对参数选择的贡献;(3)一个高性能计算(HPC)基准,评估在SLURM集群上的端到端机器学习训练编排。与基准一起,我们提出了EngiAI,一个基于LangGraph构建的多智能体系统(MAS)参考实现,通过监督者架构协调七个专门智能体,统一拓扑优化、文档检索、HPC作业编排和3D打印机控制。在四个LLM后端和两个EngiBench问题上,专有模型在Beams2D上实现了96-97%的平均任务完成率,而开源4B参数模型达到55-78%,并呈现明显的代际改进。条件分支最具挑战性,在Photonics2D上的条件风格任务完成率降至20-53%。RAG门控证实了检索增强得分接近完美($\approx 1.0$),而无检索时接近零,验证了评估设计。在HPC编排中,一个模型在100%的运行中完成了所有流水线步骤,而另一个模型降至50%,表明多步骤指令遵循在长时间工作流中会退化。
相似文章
BEAMS: AI在建模与仿真中的基准测试与评估
BEAMS倡议提出了一套基准测试集,用于评估建模与仿真中的AI工具,重点关注以人为本和负责任的AI实践。测试显示,基于LLM的引擎存在差异,在定性任务上的表现优于因果推理。
一种多AI智能体框架实现固体力学问题的端到端有限元分析
本文提出了AbaqusAgent,一个利用大语言模型实现固体力学有限元分析自动化的多智能体框架。在50个问题上实现了86%的成功率,降低了入门级用户的使用门槛,实现了人机仿真交互。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
MLE-bench:评估机器学习代理在机器学习工程中的表现
# MLE-bench:评估机器学习代理在机器学习工程中的表现 来源:[https://openai.com/index/mle-bench/](https://openai.com/index/mle-bench/) OpenAI 评估机器学习代理在机器学习工程中的表现 我们推出了 MLE-bench,这是一个用于衡量 AI 代理在机器学习工程中表现如何的基准。为此,我们从 Kaggle 精选了 75 个与 ML 工程相关的竞赛,创建了一个多样化的具有挑战性的任务集合,用于测试真实的 ML 工程
InferenceBench:面向AI代理的开放式LLM推理优化基准测试
InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。