评估大语言模型作为动力系统的可解释控制器

arXiv cs.AI 论文

摘要

本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。

arXiv:2607.22609v1 公告类型:新 摘要:大语言模型(LLMs)越来越多地用于决策和推理任务,但它们作为物理系统控制器的潜力仍鲜有探索。本研究调查了LLMs是否能够作为动态热环境的可解释控制器,考察它们遵循设定点、解释自然语言命令、推理执行器效应以及整合先验基于模型知识的能力。在多种场景下评估了五种不同规模的LLMs,包括对加热器或风扇使用设置惩罚的情况,以及模型可访问基于物理的预测工具的情况。结果表明,控制性能取决于模型复杂度:低规模和中等规模的模型常常误解执行器动态或产生不一致的推理,而高复杂度模型如Qwen-3~14B和GPT-4o则实现了精确的温度跟踪、稳定的执行器使用以及符合物理原理的连贯解释。结合基于物理的模型,通过实现预期决策显著提高了控制平滑性和能源效率。详细的推理分类进一步揭示了从小模型中的因果误解到大模型中连贯且具有时间感知的推理的清晰演进。这些发现表明,当LLMs具有足够能力并适当植根于领域知识时,它们可以作为可解释控制器,突出了混合基于模型和语言驱动的控制策略(能够提供合理解释)的有前景的机会。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:26

# 评估大型语言模型作为动态系统的可解释控制器
来源: https://arxiv.org/abs/2607.22609
查看 PDF (https://arxiv.org/pdf/2607.22609)

> 摘要:大型语言模型(LLMs)越来越多地用于决策和推理任务,但它们作为物理系统控制器的潜力仍 largely 未被探索。本研究探讨了 LLMs 能否作为动态热环境的可解释控制器,考查其遵循设定值、解释自然语言指令、推理执行器效应以及整合基于先验模型知识的能力。在多种场景下评估了五个不同规模的 LLM,包括对加热器或风扇使用施加惩罚的设置,以及模型可以访问基于物理的预测工具的情况。结果表明,控制性能取决于模型复杂度:低等和中等规模的模型经常误解执行器动态或产生不一致的推理,而高复杂度模型(如 Qwen-3~14B 和 GPT-4o)则实现了精确的温度跟踪、稳定的执行器使用以及与物理原理一致的连贯解释。引入基于物理的模型通过预测性决策显著改善了控制的平滑性和能效。一个详细的推理分类进一步揭示了从较小模型中的因果误解到较大模型中连贯且具有时间意识的推理的清晰演进。研究结果表明,当 LLMs 具备足够能力并恰当地基于领域知识时,它们可以作为可解释控制器,这凸显了能够提供合理解释的混合基于模型和语言驱动控制策略的有前景的机会。

## 提交历史

来自:Adil Rasheed 教授 [查看邮件](https://arxiv.org/show-email/8a07570b/2607.22609) **\[v1\]** 2026年6月14日星期日 16:54:25 UTC(3,182 KB)

相似文章

理解大型语言模型

arXiv cs.CL

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。

在复杂隐藏角色游戏中评估大型语言模型

arXiv cs.CL

本文介绍了一个开源框架,用于评估大型语言模型在隐藏角色游戏《秘密希特勒》中的推理、说服和欺骗能力。研究发现,当前模型在持续的多轮操纵上表现不佳,而基于规则的智能体优于它们。

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。