《Game of Hidden Rules》中的人工智能学习与概念迁移
摘要
本文研究《Game of Hidden Rules》中的人工智能学习和概念迁移,重点关注基于Transformer的A2C框架的强化学习、规则难度分析、迁移学习和泛化。
arXiv:2608.21372v1 公告类型:新
摘要:本报告总结了在《Game of Hidden Rules (GOHR)》上进行的工作,重点关注通过试错反馈训练推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化和伪机器人辅助人类学习分析。报告重点介绍了基于Transformer的A2C框架、以特征为中心和以对象为中心的表示、实验发现以及人类学习数据的分类。
查看缓存全文
缓存时间: 2026/08/25 04:11
# 基于隐藏规则游戏的AI学习与概念迁移
来源:https://arxiv.org/html/2608.21372 \\DTMnewdatestyle monthyeardate
Wentian Wang南加州大学
Jacob Feldman罗格斯大学新布朗斯维克分校
Lazaros K. Gallos罗格斯大学新布朗斯维克分校
Paul B. Kantor罗格斯大学新布朗斯维克分校
Paul B. Kantor, 顾问
Vladimir Menkov罗格斯大学新布朗斯维克分校
Hao Wang罗格斯大学新布朗斯维克分校
###### 摘要
本报告总结了在*隐藏规则游戏*(GOHR)中开展的研究工作,重点涉及:基于试错反馈训练推断隐藏规则的强化学习智能体、表征设计、规则难度分析、迁移学习、泛化能力,以及基于伪机器人辅助的人类学习行为分析。报告聚焦于基于Transformer的A2C框架、以特征为中心与以对象为中心的表征方式、实验发现,以及人类学习数据的分类。
###### 目录
1. [1 引言](https://arxiv.org/html/2608.21372#S1)
1. [1.1 研究动机](https://arxiv.org/html/2608.21372#S1.SS1)
2. [1.2 问题陈述](https://arxiv.org/html/2608.21372#S1.SS2)
3. [1.3 贡献总结](https://arxiv.org/html/2608.21372#S1.SS3)
2. [2 隐藏规则游戏](https://arxiv.org/html/2608.21372#S2)
1. [2.1 GOHR 概述](https://arxiv.org/html/2608.21372#S2.SS1)
2. [2.2 游戏机制](https://arxiv.org/html/2608.21372#S2.SS2)
1. [2.2.1 棋盘布局](https://arxiv.org/html/2608.21372#S2.SS2.SSS1)
2. [2.2.2 棋子、桶与规则](https://arxiv.org/html/2608.21372#S2.SS2.SSS2)
3. [2.2.3 反馈与回合终止](https://arxiv.org/html/2608.21372#S2.SS2.SSS3)
3. [2.3 GOHR 环境](https://arxiv.org/html/2608.21372#S2.SS3)
3. [3 方法论](https://arxiv.org/html/2608.21372#S3)
1. [3.1 强化学习建模](https://arxiv.org/html/2608.21372#S3.SS1)
2. [3.2 状态与特征编码](https://arxiv.org/html/2608.21372#S3.SS2)
1. [3.2.1 以特征为中心的表征](https://arxiv.org/html/2608.21372#S3.SS2.SSS1)
2. [3.2.2 以对象为中心的表征](https://arxiv.org/html/2608.21372#S3.SS2.SSS2)
3. [3.2.3 时序历史编码](https://arxiv.org/html/2608.21372#S3.SS2.SSS3)
3. [3.3 动作空间](https://arxiv.org/html/2608.21372#S3.SS3)
4. [3.4 奖励函数](https://arxiv.org/html/2608.21372#S3.SS4)
5. [3.5 基于 Transformer 的 Actor-Critic 架构](https://arxiv.org/html/2608.21372#S3.SS5)
1. [3.5.1 输入投影与位置编码](https://arxiv.org/html/2608.21372#S3.SS5.SSS1)
2. [3.5.2 Transformer 编码器](https://arxiv.org/html/2608.21372#S3.SS5.SSS2)
3. [3.5.3 Actor 头](https://arxiv.org/html/2608.21372#S3.SS5.SSS3)
4. [3.5.4 Critic 头](https://arxiv.org/html/2608.21372#S3.SS5.SSS4)
6. [3.6 A2C 学习算法](https://arxiv.org/html/2608.21372#S3.SS6)
7. [3.7 评估指标](https://arxiv.org/html/2608.21372#S3.SS7)
4. [4 环境与训练设置](https://arxiv.org/html/2608.21372#S4)
1. [4.1 环境与规则集](https://arxiv.org/html/2608.21372#S4.SS1)
2. [4.2 模型配置与超参数](https://arxiv.org/html/2608.21372#S4.SS2)
3. [4.3 训练与评估协议](https://arxiv.org/html/2608.21372#S4.SS3)
5. [5 实验与结果](https://arxiv.org/html/2608.21372#S5)
1. [5.1 独立规则实验](https://arxiv.org/html/2608.21372#S5.SS1)
1. [5.1.1 规则属性的难度分析](https://arxiv.org/html/2608.21372#S5.SS1.SSS1)
2. [5.1.2 规则难度分析](https://arxiv.org/html/2608.21372#S5.SS1.SSS2)
3. [5.1.3 关键观察](https://arxiv.org/html/2608.21372#S5.SS1.SSS3)
2. [5.2 泛化分析](https://arxiv.org/html/2608.21372#S5.SS2)
1. [5.2.1 以特征为中心(FC)的泛化](https://arxiv.org/html/2608.21372#S5.SS2.SSS1)
2. [5.2.2 以对象为中心(OC)的泛化](https://arxiv.org/html/2608.21372#S5.SS2.SSS2)
3. [5.2.3 观察](https://arxiv.org/html/2608.21372#S5.SS2.SSS3)
3. [5.3 形状与颜色规则的相似性](https://arxiv.org/html/2608.21372#S5.SS3)
1. [5.3.1 规则内比较](https://arxiv.org/html/2608.21372#S5.SS3.SSS1)
2. [5.3.2 形状规则与颜色规则间的比较](https://arxiv.org/html/2608.21372#S5.SS3.SSS2)
3. [5.3.3 增加运行次数的影响](https://arxiv.org/html/2608.21372#S5.SS3.SSS3)
4. [5.3.4 总结](https://arxiv.org/html/2608.21372#S5.SS3.SSS4)
4. [5.4 迁移实验](https://arxiv.org/html/2608.21372#S5.SS4)
1. [5.4.1 简单到简单的迁移](https://arxiv.org/html/2608.21372#S5.SS4.SSS1)
2. [5.4.2 复合规则迁移实验](https://arxiv.org/html/2608.21372#S5.SS4.SSS2)
3. [5.4.3 迁移至 ordL1_Nearby](https://arxiv.org/html/2608.21372#S5.SS4.SSS3)
4. [5.4.4 迁移至 cm_RBKY_cw_0123](https://arxiv.org/html/2608.21372#S5.SS4.SSS4)
5. [5.4.5 总结](https://arxiv.org/html/2608.21372#S5.SS4.SSS5)
5. [5.5 多维尺度分析](https://arxiv.org/html/2608.21372#S5.SS5)
6. [5.6 迁移几何与聚类结构](https://arxiv.org/html/2608.21372#S5.SS6)
1. [5.6.1 行聚类:后继规则行为的相似性](https://arxiv.org/html/2608.21372#S5.SS6.SSS1)
2. [5.6.2 列聚类:前驱规则影响的相似性](https://arxiv.org/html/2608.21372#S5.SS6.SSS2)
3. [5.6.3 行结构与列结构比较](https://arxiv.org/html/2608.21372#S5.SS6.SSS3)
6. [6 基于伪机器人建模的人类学习分析](https://arxiv.org/html/2608.21372#S6)
1. [6.1 动机](https://arxiv.org/html/2608.21372#S6.SS1)
2. [6.2 数据集与问题设置](https://arxiv.org/html/2608.21372#S6.SS2)
3. [6.3 行为建模方法](https://arxiv.org/html/2608.21372#S6.SS3)
1. [6.3.1 结果序列表征](https://arxiv.org/html/2608.21372#S6.SS3.SSS1)
2. [6.3.2 马尔可夫 / 回退模型](https://arxiv.org/html/2608.21372#S6.SS3.SSS2)
3. [6.3.3 序列分类](https://arxiv.org/html/2608.21372#S6.SS3.SSS3)
4. [6.4 评估协议](https://arxiv.org/html/2608.21372#S6.SS4)
5. [6.5 结果](https://arxiv.org/html/2608.21372#S6.SS5)
1. [6.5.1 机器人辅助侧分类](https://arxiv.org/html/2608.21372#S6.SS5.SSS1)
2. [6.5.2 步数的影响](https://arxiv.org/html/2608.21372#S6.SS5.SSS2)
3. [6.5.3 规则层面的差异](https://arxiv.org/html/2608.21372#S6.SS5.SSS3)
6. [6.6 讨论](https://arxiv.org/html/2608.21372#S6.SS6)
7. [7 总体讨论与结论](https://arxiv.org/html/2608.21372#S7)
1. [7.1 主要发现](https://arxiv.org/html/2608.21372#S7.SS1)
2. [7.2 局限性](https://arxiv.org/html/2608.21372#S7.SS2)
3. [7.3 未来工作](https://arxiv.org/html/2608.21372#S7.SS3)
8. [8 致谢](https://arxiv.org/html/2608.21372#S8)
9. [参考文献](https://arxiv.org/html/2608.21372#bib)
10. [附录 A 兼容 Gymnasium 的 GOHR 环境](https://arxiv.org/html/2608.21372#A1)
1. [A.1 设计目标](https://arxiv.org/html/2608.21372#A1.SS1)
2. [A.2 Gymnasium 接口](https://arxiv.org/html/2608.21372#A1.SS2)
3. [A.3 对多表征的支持](https://arxiv.org/html/2608.21372#A1.SS3)
4. [A.4 遗留兼容性封装器](https://arxiv.org/html/2608.21372#A1.SS4)
5. [A.5 重构实验的观察](https://arxiv.org/html/2608.21372#A1.SS5)
6. [A.6 渲染与可视化](https://arxiv.org/html/2608.21372#A1.SS6)
7. [A.7 可用性](https://arxiv.org/html/2608.21372#A1.SS7)
11. [附录 B 规则描述](https://arxiv.org/html/2608.21372#A2)
12. [附录 C 基于规则实验中使用的规则](https://arxiv.org/html/2608.21372#A3)
13. [附录 D 规则属性难度排名](https://arxiv.org/html/2608.21372#A4)
14. [附录 E FC 和 OC 模型的总体规则难度](https://arxiv.org/html/2608.21372#A5)
15. [附录 F 迁移图](https://arxiv.org/html/2608.21372#A6)
16. [附录 G 聚类与 MDS 结果](https://arxiv.org/html/2608.21372#A7)
1. [G.1 层次聚类结果](https://arxiv.org/html/2608.21372#A7.SS1)
2. [G.2 多维尺度分析结果](https://arxiv.org/html/2608.21372#A7.SS2)
3. [G.3 缠结图比较](https://arxiv.org/html/2608.21372#A7.SS3)
17. [附录 H 补充材料](https://arxiv.org/html/2608.21372#A8)
## 1 引言
### 1.1 研究动机
人类和智能体经常遇到环境底层规则未明确提供的情形。相反,这些规则必须通过交互、观察和反馈来推断。学习此类隐藏结构是许多现实世界问题的基础,包括科学推理、战略决策、机器人学和自适应控制。*隐藏规则游戏*(GOHR)为研究此类学习提供了一个受控环境。在 GOHR 中,智能体观察包含多个对象的棋盘,并必须推断一个未知的潜在规则,该规则决定特定动作是被接受还是被拒绝。智能体不会收到关于规则本身的直接监督;相反,学习仅通过稀疏的反馈进行,该反馈表明尝试的动作是否满足隐藏约束。这种设定对机器学习系统提出了几个重要挑战。首先,智能体必须从有限的反馈中发现抽象的关联结构。其次,它必须在复杂性和表征各异的不同规则族之间进行泛化。第三,它有机会将先前学到的知识迁移到新的但结构相关的任务中。这些挑战与强化学习和表征学习中关于抽象、组合性和迁移的更广泛问题密切相关。GOHR 特别适合研究这些问题,因为该环境包含具有可解释结构的多样化规则族。一些规则依赖于对象特征,如形状或颜色,而另一些则依赖于空间关系、桶排序或多个规则组件的组合。这种多样性使得能够在受控条件下对规则难度、泛化和迁移行为进行系统分析。除了强化学习分析,GOHR 还提供了一个机会来比较人工学习行为与人类决策模式。111事实上,它的设计和构建就是基于这种比较目的\[1 (https://arxiv.org/html/2608.21372#bib.bib8)\]。理解机器学习表征是否捕获了与人类使用的相似结构,可能为可解释和可迁移的学习策略提供见解。
### 1.2 问题陈述
本研究的核心问题是在 GOHR 环境中从稀疏的接受/拒绝反馈中学习潜在规则(第2节 (https://arxiv.org/html/2608.21372#S2);另见\[7 (https://arxiv.org/html/2608.21372#bib.bib11)\])。在每个步骤,智能体观察当前棋盘状态并选择一个动作,对应于将一个对象放入几个桶之一。环境根据一个隐藏规则评估该动作,并仅返回有限的反馈,表明该动作是被接受还是被拒绝。因此,智能体需要通过与环境的交互间接推断潜在规则。由此产生了几个研究问题:
- •内部状态表征如何影响学习性能和泛化能力?
- •哪些规则属性对学习难度影响最大?
- •先前学习的规则是否能促进结构相关规则的学习(概念迁移)?
- •不同的规则族是否能引发一致的迁移学习结构?
- •强化学习智能体在多大程度上表现出与人类学习者相似的行为模式?
为了研究这些问题,本工作比较了两种状态表征:
1. 1\.一种*以特征为中心(FC)*的表征,将棋盘编码为空间位置上的特征图。
2. 2\.一种*以对象为中心(OC)*的表征,显式表示单个对象及其属性。
两种表征都使用基于 Transformer 的 Actor-Critic 强化学习框架进行训练。由此产生的智能体在独立规则学习、泛化、迁移学习和迁移几何分析等方面接受了检验。
### 1.3 贡献总结
本工作的主要贡献总结如下:
1. 1\.我们开发了一种基于显式对象属性的以对象为中心(OC)状态表征,并系统性地将其学习、泛化和迁移行为与先前提出的以特征为中心(FC)表征进行比较(\[6 (https://arxiv.org/html/2608.21372#bib.bib9)\])。
2. 2\.我们开发了一种基于 Transformer 的 Actor-Critic(\[4 (https://arxiv.org/html/2608.21372#bib.bib27)\])强化学习架构,用于从稀疏反馈中学习隐藏规则。
3. 3\.我们分析了多个规则族的规则难度,并研究了规则的结构属性如何影响学习系统的性能。
4. 4\.我们研究了在 FC 和 OC 两种表征下,跨相关形状和颜色规则的泛化行为。
5. 5\.我们进行了广泛的迁移学习实验,包括简单到简单的迁移和复合规则迁移设置。
6. 6\.我们使用层次聚类、多维尺度分析(MDS)和缠结图比较分析了迁移学习的几何结构,以研究规则族之间的关系和迁移行为。
7. 7\.我们分析了伪机器人辅助的人类学习,寻求辅助与非辅助人类游戏玩法之间的行为差异。我们开发了 GOHR 的 Gymnasium 兼容实现,通过兼容性封装器保留了遗留观察管道,同时支持与现代强化学习框架集成。
## 2 隐藏规则游戏
### 2.1 GOHR 概述
*隐藏规则游戏*(GOHR)是本研究使用的主要环境。它是一个受控的实验框架,旨在研究人类和人工智能体中的规则发现、学习和泛化。GOHR 由威斯康星大学麦迪逊分校的研究人员开发,并已作为研究隐藏结构学习的测试平台(\[6 (https://arxiv.org/html/2608.21372#bib.bib9), 1 (https://arxiv.org/html/2608.21372#bib.bib8), 2 (https://arxiv.org/html/2608.21372#bib.bib12), 7 (https://arxiv.org/html/2608.21372#bib.bib11)\])。该环境由一个6×6网格棋盘和位于四个角落的四个桶组成。每个回合开始时,n=9个对象随机放置在棋盘上。每个对象由两个属性描述:形状和颜色。一个隐藏规则支配着对象必须如何被分配到桶中。玩家(人类或智能体)的目标是通过试错交互正确推断这个隐藏规则,并成功地将所有对象放入有效的桶中。由于规则未明确提供,该任务涉及两个相互关联的挑战:识别支配对象-桶分配的潜在规则,以及学习一个与该规则一致的选择动作的策略。两个关键实体定义了环境:
- •规则:定义将对象属性(例如颜色、形状、位置)映射到有效桶分配的约束。
- •棋子(对象):具有形状和颜色等属性的游戏元素,在每个回合开始时随机初始化在棋盘上。
### 2.2 游戏机制
#### 2.2.1 棋盘布局
GOHR 棋盘是一个6×6的网格,索引从1到36,四个桶位于角落。每个网格单元对应一个唯一的位置索引,而空间坐标(x,y)定义了实际布局。
表1:GOHR 棋盘的表示。
#### 2.2.2 棋子、桶与规则
棋盘上的每个对象定义如下:
- •形状:几种形状类别之一(例如正方形、圆形)...相似文章
从具体到抽象的人工智能:向大众揭开人工智能的神秘面纱
本文介绍了一种名为 AIcon2abs 的方法论,该方法结合了可视化编程与 WiSARD 无权重神经网络,通过动手实践活动帮助普通大众(包括儿童)理解人工智能概念。该方法将训练与分类作为一等编程构件,使学习型机器与传统程序之间的区别更加直观易懂。
通用推理的可迁移性:多领域RLVR的自动化课程设计
本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。
基于强化学习的智能体Transformer可证明地学会搜索
本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。
必须快速学习:强化学习泛化能力的新基准
OpenAI 推出了一个基于音速小子(Sonic the Hedgehog)的新型强化学习基准,用于测量 RL 智能体的迁移学习和小样本学习性能,同时包括基线算法的评估。
@rohanpaul_ai: LLM 代理能否通过交互发现隐藏规则?答案令人不安。隐藏世界越复杂…
本文研究了LLM代理是否可以通过交互推断隐藏的世界模型,发现随着复杂性的增加,它们难以构建稳定的内部模型。