衡量模拟到现实的差距:为AIoT系统中的强化学习设计一个经济实惠的真实世界基准平台

arXiv cs.AI 论文

摘要

本文介绍了一个为AIoT系统中的强化学习设计的经济实惠的真实世界基准平台,利用视频游戏来衡量模拟到现实的差距,并展示了将模拟训练出的智能体迁移到现实世界时性能显著下降的现象。

arXiv:2607.10309v1 公告类型:新 摘要:强化学习(RL)通常用于提升自主系统的性能,包括自主物联网(AIoT)。然而,RL的试错特性在真实环境中运行时成本高昂且在某些场景下存在危险。因此,大多数RL研究在模拟环境中进行。这种依赖带来了模拟到现实(Sim-to-Real)可迁移性的挑战。评估Sim-to-Real算法鲁棒性和Sim-to-Real差距是旨在提高RL在真实世界中表现的研究的关键前提。因此,机器人技术等行业开发了并行的模拟和物理平台以促进此类研究。然而,目前尚不存在通用的AIoT Sim-to-Real基准平台。为解决这些问题,我们开发了一个用于研究AIoT中RL的真实世界AIoT平台。在该平台上,部署在边缘设备上的智能体通过硬件模拟键盘,在视觉输入的引导下,在独立的主机上玩视频游戏。该平台使用市售组件,成本低于400美元,外加两台计算机。由于系统的目标是最大化游戏分数,它固有地减轻了与真实世界RL部署相关的安全风险。实验结果表明,模拟训练的智能体在真实世界部署后相对于人类水平的性能下降了1160%,表明存在显著的Sim-to-Real差距。使用深度Q网络(DQN)算法直接在真实世界训练,在1000万训练步后达到约38%的人类水平性能,展示了RL在真实世界条件下的可行性。这些结果表明,所提出的Sim-to-Real基准平台为真实世界AIoT系统中RL的定性和定量评估提供了坚实基础。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:20

# 测量模拟到现实的差距:为AIoT系统中的强化学习设计一个经济实惠的真实世界基准平台

**来源:** https://arxiv.org/html/2607.10309

周荣平(Rongping Zhou),Omid Tavallaie,陈帅军(Shuaijun Chen),Albert Y. Zomaya

周荣平、陈帅军、Albert Y. Zomaya 就职于悉尼大学计算机科学学院,澳大利亚新南威尔士州坎珀当,邮编2050(邮箱:[email protected]; [email protected]; [email protected])。Omid Tavallaie 就职于牛津大学工程科学系,英国牛津惠灵顿广场OX1 2JD,以及西澳大利亚大学计算机科学系,地址:35 Stirling Hwy, Crawley WA 6009(邮箱:[email protected]; [email protected])。

###### 摘要

强化学习(RL)通常用于提升自主系统(包括自主物联网(AIoT))的性能。然而,RL的试错本质在真实环境中实施时成本高昂,且在某些场景下存在危险。因此,大多数RL研究在模拟环境中进行。这种依赖带来了与模拟到现实(Sim-to-Real)迁移性相关的挑战。评估Sim-to-Real的算法鲁棒性以及Sim-to-Real差距,是旨在提升RL在真实世界中性能的研究的关键前提。因此,机器人等行业的已开发了同步模拟与物理平台来促进这类研究。然而,目前尚不存在一个通用的AIoT Sim-to-Real基准平台。为解决这些问题,我们开发了一个用于研究AIoT中RL的真实世界AIoT平台。在该平台上,部署在边缘设备上的智能体通过硬件模拟键盘,在另一台主机上玩电子游戏,并依靠视觉输入进行引导。该平台使用的商用组件成本低于400美元,外加两台计算机。由于系统的目标是最大化游戏得分,它固有地减轻了与真实世界RL部署相关的安全风险。实验结果表明,经过模拟训练的智能体在部署到真实世界后,其性能相对于人类水平下降了1160%,表明存在显著的Sim-to-Real差距。使用深度Q网络(DQN)RL算法直接在真实世界训练,经过1000万个训练步骤后,性能达到人类水平的大约38%,展示了RL在真实世界条件下的可行性。这些结果表明,所提出的Sim-to-Real基准平台为真实世界AIoT系统中RL的定性和定量评估提供了坚实的基础。

## I. 引言

强化学习(RL)[1](https://arxiv.org/html/2607.10309#bib.bib1)与深度学习[2](https://arxiv.org/html/2607.10309#bib.bib2)相结合,已成为提升自主系统性能的有效方法,这些系统包括机器人平台[3](https://arxiv.org/html/2607.10309#bib.bib3)、[4](https://arxiv.org/html/2607.10309#bib.bib4)、游戏智能体[5](https://arxiv.org/html/2607.10309#bib.bib5)、集成大语言模型(LLM)的人工智能系统[6](https://arxiv.org/html/2607.10309#bib.bib6)、托卡马克设备等专用系统[7](https://arxiv.org/html/2607.10309#bib.bib7),以及AIoT[8](https://arxiv.org/html/2607.10309#bib.bib8)、[9](https://arxiv.org/html/2607.10309#bib.bib9)、[11](https://arxiv.org/html/2607.10309#bib.bib11)、[12](https://arxiv.org/html/2607.10309#bib.bib12)。RL固有的迭代试错机制可能需要大量资源,并在某些真实世界场景中引入可能危及生命的安全隐患。因此,这些领域的研究采用模拟环境,为RL算法、智能体开发和评估提供经济高效、可控且可重复的条件。RL算法和智能体通常在模拟环境中设计、训练和测试,然后部署到真实环境。无论RL训练是在模拟还是真实世界中进行,其计算资源成本都很高。自2015年Google DeepMind使用RL智能体在Atari游戏上达到人类水平的表现以来,街机学习环境(ALE)一直是RL研究的基准平台[13](https://arxiv.org/html/2607.10309#bib.bib13)。在该平台上,训练一个RL智能体处理2亿帧是达到与原始RL算法突破性性能相当结果的标准方法[14](https://arxiv.org/html/2607.10309#bib.bib14)。这一训练过程需要大量的计算资源,在模拟中需要数天,在真实世界中则需要数月。考虑到真实世界游戏通常以每秒60帧(FPS)的速度运行,处理2亿帧需要超过38天,这还不包括训练过程消耗的额外计算时间。这种差异表明,在真实环境中进行RL训练的计算成本远高于模拟环境。因此,一种现实的方法是在模拟中训练RL智能体,然后在真实世界中进行评估。即使仅用于测试目的,RL测试也需要大量的设备、基础设施和物理空间投入。例如,评估用于数据中心冷却系统的RL智能体需要配备昂贵服务器和昂贵冷却系统的宽敞设施[15](https://arxiv.org/html/2607.10309#bib.bib15)。此外,在真实世界中训练和测试RL智能体会带来可能危及生命的安全隐患。例如,在电网领域,RL智能体不知道正确的断路器通断延迟时间。如果RL智能体试图在短时间内切换多个断路器,而未考虑真实世界系统中固有的较长延迟,则电网可能发生短路。此类事件可能导致火灾或整个系统断电,从而引发危及生命的情况并造成重大损害。

**参见图注**

图1:AIoT系统中的智能体-环境交互。

从这些例子中可以清楚地看出,大多数强化学习研究,无论是在AIoT领域还是其他领域,都是在模拟环境中进行的,而研究人员很少报告真实世界的结果[7](https://arxiv.org/html/2607.10309#bib.bib7)、[16](https://arxiv.org/html/2607.10309#bib.bib16)、[17](https://arxiv.org/html/2607.10309#bib.bib17)、[18](https://arxiv.org/html/2607.10309#bib.bib18)、[19](https://arxiv.org/html/2607.10309#bib.bib19)、[20](https://arxiv.org/html/2607.10309#bib.bib20)、[12](https://arxiv.org/html/2607.10309#bib.bib12)、[21](https://arxiv.org/html/2607.10309#bib.bib21)。因此,当将RL迁移到真实世界场景时,会出现与Sim-to-Real差距和算法鲁棒性相关的若干挑战,如图1所示。首先,尽管RL算法在模拟中表现完美,但其是否适用于真实世界应用尚不确定。其次,需要验证经过模拟训练的智能体在有噪声的物理环境中的运行可行性。最后,需要开发一个Sim-to-Real基准平台,以评估这两个领域之间的性能差异并精确测量Sim-to-Real差距。

在某些领域,包括机器人、托卡马克设备及类似系统,由于存在真实世界系统,研究人员可能首先研究RL在这些领域的可行性,然后开发模拟环境来支持这项工作。对于其他希望扩展或重现此类工作的研究人员来说,可用的选择要么是投入大量资源构建等效系统,要么是获得对现有系统的访问权限。这种情况极大地限制了这些领域研究人员所产生研究成果的可重用性。在实践中,AIoT系统表现出显著的多样性,包括智能建筑中的环境控制系统、交通网络中的交通控制系统以及电网中的电力分配等应用。大多数研究人员依赖从这些领域收集的数据来构建模拟环境。然而,在真实世界系统中验证RL算法或智能体仍然具有挑战性,因为许多研究小组难以获得足够的资金来构建或访问配备昂贵设备的真实世界系统。开展能够产生比模拟更准确结果而又不产生巨额成本的真实世界实验,仍然是RL在AIoT系统中应用的一个重大方法论障碍。

为解决这个问题,以下部分回顾了AIoT系统的架构以及RL在AIoT系统中的应用方式。在AIoT系统的RL范式中,如图1所示,AIoT系统由传感器、执行器和边缘设备组成[1](https://arxiv.org/html/2607.10309#bib.bib1)、[11](https://arxiv.org/html/2607.10309#bib.bib11)、[10](https://arxiv.org/html/2607.10309#bib.bib10)。传感器是检测环境变化的设备,例如摄像头。执行器是改变环境的设备,例如继电器和电机。边缘设备是承载RL智能体和算法的计算设备,接收传感数据,并向执行器发送命令。这些传感器、执行器和边缘设备通过多种通信技术连接,包括以太网和蓝牙。在这种架构中,边缘设备上的RL智能体试图通过试错过程最大化其获得的奖励。首先,传感器接收环境刺激并将其转换为边缘设备的输入。接下来,边缘设备上的RL智能体和算法将这些输入解释为状态和奖励,并随后生成命令。之后,边缘设备通过信号将命令传输给执行器。然后执行器根据收到的命令采取行动。最后,由此产生的行动改变环境,进而对传感器产生不同的刺激,从而改变智能体接收到的状态和奖励。RL算法使智能体能够在每个时间步根据当前状态探索不同的行动,而这些行动会导致环境变化,从而影响智能体在后续步骤中获得的奖励。当RL算法运行时,试错交互使智能体逐步增强其最大化长期累积奖励的能力[1](https://arxiv.org/html/2607.10309#bib.bib1)。

此外,模拟可以直接在边缘设备上执行。RL算法从模拟环境接收奖励和状态,处理来自模拟环境的输入,生成行动,并将行动传递给模拟环境。随着算法在模拟中更新,RL智能体的性能得到提升。在模拟环境中进行训练和测试后,RL智能体可以部署到真实环境中进行进一步测试。然后自然会检验RL智能体在模拟中的性能与在真实世界中的性能之间的差异,这就是Sim-to-Real差距测量问题。由于模拟与现实之间存在差异,研究人员始终需要检查RL算法是否能在真实环境中有效工作,这就是Sim-to-Real算法鲁棒性问题。为解决这两个问题,需要开发一个Sim-to-Real基准平台和一个Sim-to-Real评估程序。

基于前述对AIoT系统及其中的RL应用的考察,可以使用传感器、执行器和边缘设备构建一个功能性的AIoT系统。一个最小化的AIoT系统实例可能包括一个连接边缘设备、传感器和执行器的简单网络。从这个基本网络出发,AIoT系统可以扩展为包含多个组件的更复杂结构,组件数量从数十到甚至数百万个传感器、执行器和边缘设备不等。基于这种最小化架构,我们开发了一个经济实惠、易于获取的用于AIoT环境中RL的真实世界评估平台。玩电子游戏是RL研究中的标准做法;研究人员可以快速获得经验,而且在开发用于玩电子游戏的真实世界系统时没有安全问题。我们使用了摄像头、物理按键器、硬件模拟键盘和Atari游戏来构建一个真实世界系统。这个真实世界系统使研究人员能够进一步研究高性能算法,并开发新方法来改进RL智能体在真实世界设置中的表现。主要贡献总结如下:

- • 我们引入了一个平台,能够直接在真实世界设置中进行RL训练和评估。目前大多数RL研究依赖模拟环境,主要是为了避免真实世界实验的高昂成本和安全隐患。
- • 我们提出了评估RL智能体的Sim-to-Real差距以及Sim-to-Real算法鲁棒性的方法。这一点尤为重要,因为现有的真实世界AIoT系统差异很大,使得研究人员难以跨研究比较结果。
- • 我们的平台实现成本低廉,除计算机外,总价低于400美元,所有所需组件均可方便地在线购买。这种经济性与其它真实世界系统形成鲜明对比,后者通常需要大量投资、繁重的人力以及大量资源。

本文分为九个部分。第一部分是本研究引言。第二部分介绍RL在真实世界场景和AIoT中RL的应用的先前研究。第三部分阐述本文的研究问题。第四部分描述真实世界系统的实现。第七部分检验该系统的评估结果。第六部分讨论这些结果的意义。第七部分总结本文。第八部分介绍未来在真实世界AIoT中RL的研究工作。第九部分说明该平台资源的可用性。

## II. 相关工作

### II-A. 真实世界强化学习成本高昂

**表 I:强化学习应用对比**

| 系统 | IoT | 模拟/现实 | 成本 | 奖励 | 基准 | 基线 |
|------|-----|-----------|------|------|------|------|
| Atari游戏 [22](https://arxiv.org/html/2607.10309#bib.bib22), [23](https://arxiv.org/html/2607.10309#bib.bib23), [24](https://arxiv.org/html/2607.10309#bib.bib24), [25](https://arxiv.org/html/2607.10309#bib.bib25), [26](https://arxiv.org/html/2607.10309#bib.bib26) | ~✓ | ✓ | 低 | 该论文中报告的[26]系统在本研究开始时尚不可用,因此我们独立设计并实现了一个专用基准平台来支持本项目 | 游戏得分 | 经过训练的智能体在Gymnasium/ALE模拟环境中或在真实世界平台上玩Atari游戏,然后与人类玩家的表现进行比较 | 平均人类玩家或最佳人类玩家 |
| 机器人 [27](https://arxiv.org/html/2607.10309#bib.bib27) | ... | ... | ... | ... | ... | ... |

(注:表格中部分内容因原文不完整而保留原文格式,后续按需翻译完整表格内容。但要求中需保留表格结构,此处根据原文内容翻译表格中已有部分。由于原文表格在“机器人”一行后内容不完整,但根据要求,我们仅翻译现有文本。为确保完整,我们按原文提供的内容翻译。)

(实际表格翻译如下:)

| 系统 | IoT | 模拟/现实 | 成本 | 奖励 | 基准 | 基线 |
|------|-----|-----------|------|------|------|------|
| Atari游戏 [22], [23], [24], [25], [26] | ~✓ | ✓ | 低 如[26]中报告的系统在本研究开始时不可用,因此我们独立设计并实现了一个专用基准平台来支持本项目。 | 游戏得分 | 经过训练的智能体在Gymnasium/ALE模拟环境或真实世界平台上玩Atari游戏,然后将表现与人类玩家进行比较。 | 平均人类玩家或最佳人类玩家 |
| 机器人 [27] | ... | ... | ... | ... | ... | ... |

(注:为防止信息丢失,此处保留表格原文的翻译,但原文表格后续内容缺失,只显示了部分。我们按可见部分翻译。鉴于要求是翻译给定内容,我们翻译现有部分即可。)

相似文章

基础模型体的模拟-现实差距:统一的MDP视角

arXiv cs.AI

本文将基础模型体的模拟-现实差距形式化为马尔可夫决策过程问题,提出了统一的研究议程,以适应如领域随机化等经典解决方案,从而提升智能体在真实部署中的鲁棒性和可靠性。

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

用于衡量前沿AI能力的开放世界评估

arXiv cs.AI

本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。