评估大语言模型作为动力系统的可解释控制器

arXiv cs.AI 论文

摘要

本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。

arXiv:2607.22609v1 公告类型:新 摘要:大语言模型(LLMs)越来越多地用于决策和推理任务,但它们作为物理系统控制器的潜力仍鲜有探索。本研究调查了LLMs是否能够作为动态热环境的可解释控制器,考察它们遵循设定点、解释自然语言命令、推理执行器效应以及整合先验基于模型知识的能力。在多种场景下评估了五种不同规模的LLMs,包括对加热器或风扇使用设置惩罚的情况,以及模型可访问基于物理的预测工具的情况。结果表明,控制性能取决于模型复杂度:低规模和中等规模的模型常常误解执行器动态或产生不一致的推理,而高复杂度模型如Qwen-3~14B和GPT-4o则实现了精确的温度跟踪、稳定的执行器使用以及符合物理原理的连贯解释。结合基于物理的模型,通过实现预期决策显著提高了控制平滑性和能源效率。详细的推理分类进一步揭示了从小模型中的因果误解到大模型中连贯且具有时间感知的推理的清晰演进。这些发现表明,当LLMs具有足够能力并适当植根于领域知识时,它们可以作为可解释控制器,突出了混合基于模型和语言驱动的控制策略(能够提供合理解释)的有前景的机会。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:26

# 评估大型语言模型作为动态系统的可解释控制器
来源: https://arxiv.org/abs/2607.22609
查看 PDF (https://arxiv.org/pdf/2607.22609)

> 摘要:大型语言模型(LLMs)越来越多地用于决策和推理任务,但它们作为物理系统控制器的潜力仍 largely 未被探索。本研究探讨了 LLMs 能否作为动态热环境的可解释控制器,考查其遵循设定值、解释自然语言指令、推理执行器效应以及整合基于先验模型知识的能力。在多种场景下评估了五个不同规模的 LLM,包括对加热器或风扇使用施加惩罚的设置,以及模型可以访问基于物理的预测工具的情况。结果表明,控制性能取决于模型复杂度:低等和中等规模的模型经常误解执行器动态或产生不一致的推理,而高复杂度模型(如 Qwen-3~14B 和 GPT-4o)则实现了精确的温度跟踪、稳定的执行器使用以及与物理原理一致的连贯解释。引入基于物理的模型通过预测性决策显著改善了控制的平滑性和能效。一个详细的推理分类进一步揭示了从较小模型中的因果误解到较大模型中连贯且具有时间意识的推理的清晰演进。研究结果表明,当 LLMs 具备足够能力并恰当地基于领域知识时,它们可以作为可解释控制器,这凸显了能够提供合理解释的混合基于模型和语言驱动控制策略的有前景的机会。

## 提交历史

来自:Adil Rasheed 教授 [查看邮件](https://arxiv.org/show-email/8a07570b/2607.22609) **\[v1\]** 2026年6月14日星期日 16:54:25 UTC(3,182 KB)

相似文章

解读和引导社会模拟中的LLM智能体

arXiv cs.LG

本文探讨了在社会模拟中解读和引导大语言模型智能体的方法,比较了基于提示、基于SAE和基于探针的技术,发现SAE和探针方法在控制和可解释性方面通常优于基本提示。

理解大型语言模型

arXiv cs.CL

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。