little m:一个用于工业过程优化的AI智能体
摘要
本文介绍了little m,一个用于工业过程优化的AI智能体,并提出了IPC-Bench,一个多模态基准数据集,用于评估LLMs在从工业规范制定数学模型方面的表现。
arXiv:2609.16680v1 Announce Type: new
摘要:制造业消耗全球三分之一的能源,在能源效率方面仍有显著提升空间。最优过程控制对此至关重要。然而,从混乱的现实世界工业规范中综合数学优化模型,需要将非结构化自然语言和空间图表与严谨的数学语法桥接起来。这对通用大型语言模型(LLMs)构成了深刻挑战,因为在建模连续多物理动力学时,它们可能引入无效约束。为解决此问题,我们引入了little m,一个旨在辅助工业过程控制模型制定的AI智能体。结合领域特定知识库和LLM驱动的交互,所提出的框架将现实世界的优化问题形式化为数学模型。为了系统评估,我们推出了工业过程控制基准(IPC-Bench),一个包含50个规范场景的新型多模态数据集,要求对文本和过程图表进行联合推理。通过全面的自动化结构评估和双盲人工评估,little m显著优于最先进的LLMs,生成语义正确的模型。这些评估衡量的是模型制定质量,而非求解器可行性、形式物理有效性或闭环工业性能。little m的实现和IPC-Bench数据集可在以下地址获取:https://github.com/yeyongchao/process-modeling-benchmark。
查看缓存全文
缓存时间: 2026/09/16 09:02
# little m:一个用于工业流程优化的AI代理
来源:https://arxiv.org/html/2609.16680
叶勇超
单位:香港城市大学数据科学系,中国香港特别行政区
邮箱:[yongchao\.ye@my\.cityu\.edu\.hk](mailto:)
何欣宇
单位:香港城市大学数据科学系,中国香港特别行政区
邮箱:[x\.y\.he@my\.cityu\.edu\.hk](mailto:)
Dutliff Boshoff
单位:香港城市大学数据科学系,中国香港特别行政区
邮箱:[dboshoff2\-c@my\.cityu\.edu\.hk](mailto:)
郭位
单位:香港城市大学数据科学系,中国香港特别行政区
单位:香港城市大学香港高等研究院
邮箱:[way@cityu\.edu\.hk](mailto:)
李丽帅††
通讯作者。
单位:香港城市大学数据科学系,中国香港特别行政区
邮箱:[lishuai\.li@cityu\.edu\.hk](mailto:)
###### 摘要
制造业消耗了全球三分之一的能源,其在能源效率方面仍有显著的提升空间。最优过程控制对于实现这一目标至关重要。然而,从混乱、真实的工业规范中综合出数学优化模型,需要将非结构化的自然语言和空间图表与严谨的数学语法桥接起来。这给通用大语言模型(LLMs)带来了深远的挑战,因为它们在建模连续多物理场动力学时,可能会引入无效约束。为此,我们引入了 little m,一个旨在辅助工业过程控制模型构建的AI代理。该框架结合了领域特定知识库和LLM驱动的交互,将现实世界的优化问题表述为数学模型。为了系统化评估,我们引入了工业过程控制基准(IPC-Bench),这是一个由50个典型场景组成的新颖多模态数据集,需要联合推理文本和工艺流程图。通过全面的自动化结构评估和双盲人工评估,little m显著优于最先进的LLMs,能生成语义正确的模型。这些评估评估的是建模质量,而非求解器可行性、形式化的物理有效性或闭环工业性能。little m的实现和IPC-Bench数据集可在以下地址获取:https://github.com/yeyongchao/process-modeling-benchmark\。
## 1 引言
大语言模型(LLMs)在通用自然语言任务中展现出卓越的能力,这推动了人们对其应用于复杂数学推理和数学自动形式化的兴趣(Zhang et al\. \(2024\))。在此范围内,鉴于其对能源、制造和制药等关键部门的重要性,工业流程优化已成为AI评估的一个严峻前沿(Olsson et al\. \(2023\))。与基础算术应用题或通用代码生成不同,解决现实世界的工业问题需要将非结构化文本和空间拓扑转化为由多物理场现象和非线性动力学支配的严谨数学模型(Xu et al\. \(2024\))。对这类连续系统建模,其所需的结构预测和语义锚定水平,对纯自回归生成的固有极限提出了挑战(Wu et al\. \(2025\))。例如,一个有用的建模必须区分决策变量、测量值和固定参数,因为这些角色决定了模型的解释方式。
因此,研究已积极转向用于运筹学(OR)的专业LLM代理,利用结构化微调、多代理分解和求解器在环验证等技术来综合复杂逻辑(Jiang et al\. \(2025\); Tran et al\. \(2025\); Zhang and Luo \(2025\))。然而,尽管这些先进的框架在物流和线性编程等一般优化任务中显示出潜力,但在应用于连续多物理场过程时,它们暴露了关键的脆弱性。缺乏明确的过程锚定,整体式LLM可能生成数学上看似合理但物理上不一致的约束。直接用这些工具自动化工业建模是困难的,因为该任务是多模态的,并且层次化地交织着隐性的物理启发式方法(如热力学可行性),而这些在问题描述中很少详细说明(Le et al\. \(2026\); Qu et al\. \(2025\))。
此外,现有的AI驱动工业解决方案,包括数字孪生和基于控制理论的基础模型,主要关注在固定基础设施内的仿真或参数调整,而不是从模糊意图出发进行数学模型的新颖合成(Tao et al\. \(2024\); Maher \(2025\))。这一差距反映在当前的基准测试中。标准的多模态AI数据集通常将数学推理评估为纯粹的抽象逻辑或静态视觉几何(Huang et al\. \(2025a\); Xiao et al\. \(2024\))。然而,现实世界的工业建模需要显式处理物理和操作约束,然后进行工程验证。这种差异促使了可审计AI架构的发展,其中神经语言模型与结构化领域知识耦合,并暴露中间决策供人类审查(Raspanti et al\. \(2025\))。
表 1:数学和优化建模基准对比。
| 域名/问题类型 | 基准名称 | 输入模态 | 输出 | 评估 | 问题数量 | 复杂性 |
| --- | --- | --- | --- | --- | --- | --- |
| OR / MILP, LP | ComplexOR (Xiao et al\. \(2024\)) | 文本 | 求解器代码(Gurobi/Python) | 基于执行:目标值 vs. 真实值 | 37 | - |
| LP | NL4OPT (Ramamonjison et al\. \(2022\)) | 文本 | 设计模板 | 提取/生成:F1值 & 语法 | 1101 | - |
| 物流与调度 / LP, MIP, NLP | IndustryOR (Huang et al\. \(2025a\)) | 文本 + 表格数据 | 数学模型,代码 | 基于执行:涉及人类专家 | 100 | OR |
| ODEs, LP | MAMO (Huang et al\. \(2025b\)) | 文本 | 求解器代码(Python) | 基于执行:准确率 | 211 | - |
| 算术应用题 | GSM8K (Cobbe et al\. \(2021\)) | 文本 | 数值 | 准确率:精确匹配 | 8500 | - |
| 过程控制 | IPC-Bench (本文) | 文本 + 工艺流程图 | 数学模型 | 语义与结构锚定 | 50 | 过程控制 |
为了克服这一根本障碍,我们引入了 little m,一个旨在辅助工业过程控制模型构建的AI代理。little m 通过整合两个不同的组件,超越了通用AI的局限性:(1) 一个结构化的知识库,涵盖过程优化方向、控制策略、建模模板和常见的约束模式;(2) 一个作为交互式界面的大语言模型,它构建用户提供的信息,检索相关条目,并暴露中间输出供审查。这两个组件共同生成基于所提供过程信息和检索到的领域知识的结构化优化模型。在这项工作中,我们在 IPC-Bench 上评估了这种基于锚定的多模态架构,该基准专注于受跨连续过程行业共享的物理机制支配的过程工业案例。我们的主要贡献是:
- • little m 的架构与实现,一个用于工业过程控制模型构建的、基于知识的助手,将领域特定知识与LLM驱动的交互相结合。
- • 创建了工业过程控制基准(IPC-Bench),一个包含50个典型、教科书衍生的过程工业优化场景的初始基准。与现有的单模态数据集不同,IPC-Bench 需要跨多模态输入进行推理,以捕捉空间和拓扑上下文。
- • 结合自动化结构评估和双盲人工评估的全面验证。结果显示,与评估的 Qwen3 和 DeepSeek 基线模型相比,little m 具有更高的专家偏好和更好的建模质量。
## 2 相关工作
### 2.1 用于优化和运筹学的LLM代理
大语言模型(LLMs)在运筹学(OR)中的应用已从基础的提示工程转变为复杂的代理框架。为了满足精确求解器严格的语法和逻辑要求,近期文献强调结构化微调(例如,LLMOPT (Jiang et al\. \(2025\)))、模块化分解(例如,OptiMUS (AhmadiTeshnizi et al\. \(2023\)))和多代理协作(例如,Chain-of-Experts (Xiao et al\. \(2024\)))。一个显著的范式转变是采用闭环推理,它将优化求解器嵌入训练或部署循环中,作为目标验证器来强化数学上有效的推理路径(Zhang and Luo \(2025\); Chen et al\. \(2025\))。尽管在通用OR领域取得了这些进展,但工业过程控制由于其固有地依赖于非线性连续动力学和微分方程,提出了独特的挑战(Fakih et al\. \(2024\))。虽然新兴框架如 ControlAgent (Guo et al\. \(2024\)) 和 LLMPC (Maher \(2025\)) 已将LLMs集成用于控制参数调整和高级轨迹规划,但一个能够交互式引出基于物理的优化建模的统一架构仍有待探索。
### 2.2 基准测试与评估范式
优化代理的发展需要专门的评估框架,其中一些选择已在表1中进行比较。初始基准如 NL4OPT (Ramamonjison et al\. \(2022\)) 建立了线性规划提取的基线。随后的数据集如 IndustryOR (Huang et al\. \(2025a\)) 和 ComplexOR (Xiao et al\. \(2024\)) 引入了大规模物流和调度场景。然而,在工业过程控制方面仍然存在显著的基准测试差距。虽然像 MAMO (Huang et al\. \(2025b\)) 这样的数据集包含常微分方程,但它们在很大程度上将微分方程视为抽象数学,而不是将连续物理与离散操作约束相交。因此,执行率和语义相似度捕捉了建模质量的有用方面,但两者都不足以建立部署所需的物理有效性或操作安全性。
### 2.3 AI辅助流程优化
过程系统工程将过程建模与设计、操作优化和控制连接起来(Grossmann and Harjunkoski \(2019\))。在操作层面,RTO(实时优化)使用更新的稳态模型计算经济目标,而MPC(模型预测控制)执行有限时域的动态优化以实现约束控制(Darby et al\. \(2011\))。工业AI通过数字孪生、物理信息学习和过程工业基础模型架构补充了这些基于模型的方法(Tao et al\. \(2024\); Liu et al\. \(2025\); Ren et al\. \(2025\))。近期的AI辅助工程系统解决了从工艺流程图进行控制结构预测、经过外部验证的PLC代码生成以及计算在环控制器设计等问题,使语言模型更接近具体的工程制品(Fakih et al\. \(2024\); Guo et al\. \(2024\))。其他框架则利用结构化提示、工程工具或过程模拟器,通过迭代任务分解来支持流程图分析、仿真和优化(Tao et al\. \(2025\); Zeng et al\. \(2025\))。总的来说,这些研究反映了向结构化和工具支持的工程辅助的更广泛转变。
## 3 预备知识
我们将自动化工业建模任务定义为一个条件生成问题,将多模态上下文 X\\mathcal\{X\} 映射到形式化优化模型 M\\mathcal\{M\}。输入空间 X=\{Dtext,Dimg\}\\mathcal\{X\}=\\\{D\_\{\\textnormal\{text\}\},D\_\{\\textnormal\{img\}\}\\\} 封装了非结构化的工程意图,其中 DtextD\_\{\\textnormal\{text\}\} 包含描述操作目标的自然语言叙述,DimgD\_\{\\textnormal\{img\}\} 表示可视化的工艺拓扑。目标输出是一个结构化的三元组 M=\(V,F,C\)\\mathcal\{M\}=\(\\mathcal\{V\},\\mathcal\{F\},\\mathcal\{C\}\),代表一个典型的优化模型。这里,V\\mathcal\{V\} 定义了基于物理域的决策变量集(例如,质量流 f∈R≥0f\\in\\mathbb\{R\}\_\{\\geq 0\},二进制执行状态 z∈\{0,1\}z\\in\\\{0,1\\\});F\\mathcal\{F\} 表示标量或向量值的目标函数(例如,最小化能源成本);C\\mathcal\{C\} 构成等式和不等式约束集,代表质量/能量平衡、热力学限制和安全联锁。
此任务与标准代码生成不同,因为过程连接性和物理关系必须被显式表示。例如,候选约束集应遵循 DimgD\_\{\\textnormal\{img\}\} 中的连接图,并包含适用的守恒关系,如在稳态节点处的 ∑min=∑mout\\sum m\_\{in\}=\\sum m\_\{out\}。我们将这些视为需要审计的建模要求,而不是由生成器正式保证的属性。该代理近似于专家映射 f∗:X→Mf^\{\*\}:\\mathcal\{X\}\\rightarrow\mathcal\{M\} 并返回一个候选规范以供审查和后续的数值实现。我们的评估将 V\\mathcal\{V\}、F\\mathcal\{F\} 和 C\\mathcal\{C\} 与专家编写的参考,使用结构度量和专家判断进行比较。我们不在求解器中执行模型,也不验证闭环操作。
## 4 方法论
### 4.1 系统架构
图 1:little m 的架构。该系统采用由LLM-RAG核心驱动的三阶段认知管道,以将优化综合锚定在特定领域知识中。
little m 的设计如图 1 所示。我们没有尝试从 X\\mathcal\{X\} 到 M\\mathcal\{M\} 的直接、单步转换,而是实现了一个分层的认知工作流,模拟了人类工艺工程师的标准项目生命周期。采用这种多阶段设计的动机是...相似文章
EngiAI:面向LLM驱动工程设计的 多智能体框架与基准套件
EngiAI 提出了一个用于LLM驱动工程设计的 多智能体框架和基准套件,评估工作流、RAG和HPC维度。专有模型在Beams2D上达到96-97%的任务完成率,而条件分支仍具挑战,在Photonics2D上为20-53%。
BI-Agent 和 BI-Bench:迈向自动化端到端商业智能
本文介绍了 BI-Bench,首个用于评估 LLMs 在端到端商业智能任务上表现的基准,以及 BI-Agent,一个工具增强的智能体,它分解工作流并通过后训练显著提高准确性。
MLS-Bench:对 AI 系统在构建更优 AI 方面能力的全面与严格评估
本文介绍了 MLS-Bench,这是一个旨在评估 AI 系统能否发明具有通用性和可扩展性的机器学习方法,而非仅仅进行工程调优的基准测试。
AI SYSTEM DESIGN系列博客第二篇
本文讨论了如何针对特定生产用例对LLM进行基准测试,提出了一套全面的评估流程,包括任务特定指标、质量与成本的权衡,以及失败案例分析。
Agent Mini:一个极简、本地优先的AI代理,你能够真正阅读、理解和扩展。[P]
Agent Mini 是一个极简的开源AI代理,用约3000行Python代码编写,优先考虑可读性和使用Ollama的本地优先操作,提供实用工具,同时避免使用重型框架。