《Game of Hidden Rules》中的人工智能学习与概念迁移

arXiv cs.AI 论文

摘要

本文研究《Game of Hidden Rules》中的人工智能学习和概念迁移,重点关注基于Transformer的A2C框架的强化学习、规则难度分析、迁移学习和泛化。

arXiv:2608.21372v1 公告类型:新 摘要:本报告总结了在《Game of Hidden Rules (GOHR)》上进行的工作,重点关注通过试错反馈训练推断隐藏规则的强化学习智能体、表示设计、规则难度分析、迁移学习、泛化和伪机器人辅助人类学习分析。报告重点介绍了基于Transformer的A2C框架、以特征为中心和以对象为中心的表示、实验发现以及人类学习数据的分类。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:11

# 基于隐藏规则游戏的AI学习与概念迁移
来源:https://arxiv.org/html/2608.21372 \\DTMnewdatestyle monthyeardate  
Wentian Wang南加州大学  
Jacob Feldman罗格斯大学新布朗斯维克分校  
Lazaros K. Gallos罗格斯大学新布朗斯维克分校  
Paul B. Kantor罗格斯大学新布朗斯维克分校  
Paul B. Kantor, 顾问  
Vladimir Menkov罗格斯大学新布朗斯维克分校  
Hao Wang罗格斯大学新布朗斯维克分校

###### 摘要
本报告总结了在*隐藏规则游戏*(GOHR)中开展的研究工作,重点涉及:基于试错反馈训练推断隐藏规则的强化学习智能体、表征设计、规则难度分析、迁移学习、泛化能力,以及基于伪机器人辅助的人类学习行为分析。报告聚焦于基于Transformer的A2C框架、以特征为中心与以对象为中心的表征方式、实验发现,以及人类学习数据的分类。

###### 目录
1. [1 引言](https://arxiv.org/html/2608.21372#S1)
    1. [1.1 研究动机](https://arxiv.org/html/2608.21372#S1.SS1)
    2. [1.2 问题陈述](https://arxiv.org/html/2608.21372#S1.SS2)
    3. [1.3 贡献总结](https://arxiv.org/html/2608.21372#S1.SS3)
2. [2 隐藏规则游戏](https://arxiv.org/html/2608.21372#S2)
    1. [2.1 GOHR 概述](https://arxiv.org/html/2608.21372#S2.SS1)
    2. [2.2 游戏机制](https://arxiv.org/html/2608.21372#S2.SS2)
        1. [2.2.1 棋盘布局](https://arxiv.org/html/2608.21372#S2.SS2.SSS1)
        2. [2.2.2 棋子、桶与规则](https://arxiv.org/html/2608.21372#S2.SS2.SSS2)
        3. [2.2.3 反馈与回合终止](https://arxiv.org/html/2608.21372#S2.SS2.SSS3)
    3. [2.3 GOHR 环境](https://arxiv.org/html/2608.21372#S2.SS3)
3. [3 方法论](https://arxiv.org/html/2608.21372#S3)
    1. [3.1 强化学习建模](https://arxiv.org/html/2608.21372#S3.SS1)
    2. [3.2 状态与特征编码](https://arxiv.org/html/2608.21372#S3.SS2)
        1. [3.2.1 以特征为中心的表征](https://arxiv.org/html/2608.21372#S3.SS2.SSS1)
        2. [3.2.2 以对象为中心的表征](https://arxiv.org/html/2608.21372#S3.SS2.SSS2)
        3. [3.2.3 时序历史编码](https://arxiv.org/html/2608.21372#S3.SS2.SSS3)
    3. [3.3 动作空间](https://arxiv.org/html/2608.21372#S3.SS3)
    4. [3.4 奖励函数](https://arxiv.org/html/2608.21372#S3.SS4)
    5. [3.5 基于 Transformer 的 Actor-Critic 架构](https://arxiv.org/html/2608.21372#S3.SS5)
        1. [3.5.1 输入投影与位置编码](https://arxiv.org/html/2608.21372#S3.SS5.SSS1)
        2. [3.5.2 Transformer 编码器](https://arxiv.org/html/2608.21372#S3.SS5.SSS2)
        3. [3.5.3 Actor 头](https://arxiv.org/html/2608.21372#S3.SS5.SSS3)
        4. [3.5.4 Critic 头](https://arxiv.org/html/2608.21372#S3.SS5.SSS4)
    6. [3.6 A2C 学习算法](https://arxiv.org/html/2608.21372#S3.SS6)
    7. [3.7 评估指标](https://arxiv.org/html/2608.21372#S3.SS7)
4. [4 环境与训练设置](https://arxiv.org/html/2608.21372#S4)
    1. [4.1 环境与规则集](https://arxiv.org/html/2608.21372#S4.SS1)
    2. [4.2 模型配置与超参数](https://arxiv.org/html/2608.21372#S4.SS2)
    3. [4.3 训练与评估协议](https://arxiv.org/html/2608.21372#S4.SS3)
5. [5 实验与结果](https://arxiv.org/html/2608.21372#S5)
    1. [5.1 独立规则实验](https://arxiv.org/html/2608.21372#S5.SS1)
        1. [5.1.1 规则属性的难度分析](https://arxiv.org/html/2608.21372#S5.SS1.SSS1)
        2. [5.1.2 规则难度分析](https://arxiv.org/html/2608.21372#S5.SS1.SSS2)
        3. [5.1.3 关键观察](https://arxiv.org/html/2608.21372#S5.SS1.SSS3)
    2. [5.2 泛化分析](https://arxiv.org/html/2608.21372#S5.SS2)
        1. [5.2.1 以特征为中心(FC)的泛化](https://arxiv.org/html/2608.21372#S5.SS2.SSS1)
        2. [5.2.2 以对象为中心(OC)的泛化](https://arxiv.org/html/2608.21372#S5.SS2.SSS2)
        3. [5.2.3 观察](https://arxiv.org/html/2608.21372#S5.SS2.SSS3)
    3. [5.3 形状与颜色规则的相似性](https://arxiv.org/html/2608.21372#S5.SS3)
        1. [5.3.1 规则内比较](https://arxiv.org/html/2608.21372#S5.SS3.SSS1)
        2. [5.3.2 形状规则与颜色规则间的比较](https://arxiv.org/html/2608.21372#S5.SS3.SSS2)
        3. [5.3.3 增加运行次数的影响](https://arxiv.org/html/2608.21372#S5.SS3.SSS3)
        4. [5.3.4 总结](https://arxiv.org/html/2608.21372#S5.SS3.SSS4)
    4. [5.4 迁移实验](https://arxiv.org/html/2608.21372#S5.SS4)
        1. [5.4.1 简单到简单的迁移](https://arxiv.org/html/2608.21372#S5.SS4.SSS1)
        2. [5.4.2 复合规则迁移实验](https://arxiv.org/html/2608.21372#S5.SS4.SSS2)
        3. [5.4.3 迁移至 ordL1_Nearby](https://arxiv.org/html/2608.21372#S5.SS4.SSS3)
        4. [5.4.4 迁移至 cm_RBKY_cw_0123](https://arxiv.org/html/2608.21372#S5.SS4.SSS4)
        5. [5.4.5 总结](https://arxiv.org/html/2608.21372#S5.SS4.SSS5)
    5. [5.5 多维尺度分析](https://arxiv.org/html/2608.21372#S5.SS5)
    6. [5.6 迁移几何与聚类结构](https://arxiv.org/html/2608.21372#S5.SS6)
        1. [5.6.1 行聚类:后继规则行为的相似性](https://arxiv.org/html/2608.21372#S5.SS6.SSS1)
        2. [5.6.2 列聚类:前驱规则影响的相似性](https://arxiv.org/html/2608.21372#S5.SS6.SSS2)
        3. [5.6.3 行结构与列结构比较](https://arxiv.org/html/2608.21372#S5.SS6.SSS3)
6. [6 基于伪机器人建模的人类学习分析](https://arxiv.org/html/2608.21372#S6)
    1. [6.1 动机](https://arxiv.org/html/2608.21372#S6.SS1)
    2. [6.2 数据集与问题设置](https://arxiv.org/html/2608.21372#S6.SS2)
    3. [6.3 行为建模方法](https://arxiv.org/html/2608.21372#S6.SS3)
        1. [6.3.1 结果序列表征](https://arxiv.org/html/2608.21372#S6.SS3.SSS1)
        2. [6.3.2 马尔可夫 / 回退模型](https://arxiv.org/html/2608.21372#S6.SS3.SSS2)
        3. [6.3.3 序列分类](https://arxiv.org/html/2608.21372#S6.SS3.SSS3)
    4. [6.4 评估协议](https://arxiv.org/html/2608.21372#S6.SS4)
    5. [6.5 结果](https://arxiv.org/html/2608.21372#S6.SS5)
        1. [6.5.1 机器人辅助侧分类](https://arxiv.org/html/2608.21372#S6.SS5.SSS1)
        2. [6.5.2 步数的影响](https://arxiv.org/html/2608.21372#S6.SS5.SSS2)
        3. [6.5.3 规则层面的差异](https://arxiv.org/html/2608.21372#S6.SS5.SSS3)
    6. [6.6 讨论](https://arxiv.org/html/2608.21372#S6.SS6)
7. [7 总体讨论与结论](https://arxiv.org/html/2608.21372#S7)
    1. [7.1 主要发现](https://arxiv.org/html/2608.21372#S7.SS1)
    2. [7.2 局限性](https://arxiv.org/html/2608.21372#S7.SS2)
    3. [7.3 未来工作](https://arxiv.org/html/2608.21372#S7.SS3)
8. [8 致谢](https://arxiv.org/html/2608.21372#S8)
9. [参考文献](https://arxiv.org/html/2608.21372#bib)
10. [附录 A 兼容 Gymnasium 的 GOHR 环境](https://arxiv.org/html/2608.21372#A1)
    1. [A.1 设计目标](https://arxiv.org/html/2608.21372#A1.SS1)
    2. [A.2 Gymnasium 接口](https://arxiv.org/html/2608.21372#A1.SS2)
    3. [A.3 对多表征的支持](https://arxiv.org/html/2608.21372#A1.SS3)
    4. [A.4 遗留兼容性封装器](https://arxiv.org/html/2608.21372#A1.SS4)
    5. [A.5 重构实验的观察](https://arxiv.org/html/2608.21372#A1.SS5)
    6. [A.6 渲染与可视化](https://arxiv.org/html/2608.21372#A1.SS6)
    7. [A.7 可用性](https://arxiv.org/html/2608.21372#A1.SS7)
11. [附录 B 规则描述](https://arxiv.org/html/2608.21372#A2)
12. [附录 C 基于规则实验中使用的规则](https://arxiv.org/html/2608.21372#A3)
13. [附录 D 规则属性难度排名](https://arxiv.org/html/2608.21372#A4)
14. [附录 E FC 和 OC 模型的总体规则难度](https://arxiv.org/html/2608.21372#A5)
15. [附录 F 迁移图](https://arxiv.org/html/2608.21372#A6)
16. [附录 G 聚类与 MDS 结果](https://arxiv.org/html/2608.21372#A7)
    1. [G.1 层次聚类结果](https://arxiv.org/html/2608.21372#A7.SS1)
    2. [G.2 多维尺度分析结果](https://arxiv.org/html/2608.21372#A7.SS2)
    3. [G.3 缠结图比较](https://arxiv.org/html/2608.21372#A7.SS3)
17. [附录 H 补充材料](https://arxiv.org/html/2608.21372#A8)

## 1 引言
### 1.1 研究动机
人类和智能体经常遇到环境底层规则未明确提供的情形。相反,这些规则必须通过交互、观察和反馈来推断。学习此类隐藏结构是许多现实世界问题的基础,包括科学推理、战略决策、机器人学和自适应控制。*隐藏规则游戏*(GOHR)为研究此类学习提供了一个受控环境。在 GOHR 中,智能体观察包含多个对象的棋盘,并必须推断一个未知的潜在规则,该规则决定特定动作是被接受还是被拒绝。智能体不会收到关于规则本身的直接监督;相反,学习仅通过稀疏的反馈进行,该反馈表明尝试的动作是否满足隐藏约束。这种设定对机器学习系统提出了几个重要挑战。首先,智能体必须从有限的反馈中发现抽象的关联结构。其次,它必须在复杂性和表征各异的不同规则族之间进行泛化。第三,它有机会将先前学到的知识迁移到新的但结构相关的任务中。这些挑战与强化学习和表征学习中关于抽象、组合性和迁移的更广泛问题密切相关。GOHR 特别适合研究这些问题,因为该环境包含具有可解释结构的多样化规则族。一些规则依赖于对象特征,如形状或颜色,而另一些则依赖于空间关系、桶排序或多个规则组件的组合。这种多样性使得能够在受控条件下对规则难度、泛化和迁移行为进行系统分析。除了强化学习分析,GOHR 还提供了一个机会来比较人工学习行为与人类决策模式。111事实上,它的设计和构建就是基于这种比较目的\[1 (https://arxiv.org/html/2608.21372#bib.bib8)\]。理解机器学习表征是否捕获了与人类使用的相似结构,可能为可解释和可迁移的学习策略提供见解。
### 1.2 问题陈述
本研究的核心问题是在 GOHR 环境中从稀疏的接受/拒绝反馈中学习潜在规则(第2节 (https://arxiv.org/html/2608.21372#S2);另见\[7 (https://arxiv.org/html/2608.21372#bib.bib11)\])。在每个步骤,智能体观察当前棋盘状态并选择一个动作,对应于将一个对象放入几个桶之一。环境根据一个隐藏规则评估该动作,并仅返回有限的反馈,表明该动作是被接受还是被拒绝。因此,智能体需要通过与环境的交互间接推断潜在规则。由此产生了几个研究问题:
- •内部状态表征如何影响学习性能和泛化能力?
- •哪些规则属性对学习难度影响最大?
- •先前学习的规则是否能促进结构相关规则的学习(概念迁移)?
- •不同的规则族是否能引发一致的迁移学习结构?
- •强化学习智能体在多大程度上表现出与人类学习者相似的行为模式?
为了研究这些问题,本工作比较了两种状态表征:
1. 1\.一种*以特征为中心(FC)*的表征,将棋盘编码为空间位置上的特征图。
2. 2\.一种*以对象为中心(OC)*的表征,显式表示单个对象及其属性。
两种表征都使用基于 Transformer 的 Actor-Critic 强化学习框架进行训练。由此产生的智能体在独立规则学习、泛化、迁移学习和迁移几何分析等方面接受了检验。
### 1.3 贡献总结
本工作的主要贡献总结如下:
1. 1\.我们开发了一种基于显式对象属性的以对象为中心(OC)状态表征,并系统性地将其学习、泛化和迁移行为与先前提出的以特征为中心(FC)表征进行比较(\[6 (https://arxiv.org/html/2608.21372#bib.bib9)\])。
2. 2\.我们开发了一种基于 Transformer 的 Actor-Critic(\[4 (https://arxiv.org/html/2608.21372#bib.bib27)\])强化学习架构,用于从稀疏反馈中学习隐藏规则。
3. 3\.我们分析了多个规则族的规则难度,并研究了规则的结构属性如何影响学习系统的性能。
4. 4\.我们研究了在 FC 和 OC 两种表征下,跨相关形状和颜色规则的泛化行为。
5. 5\.我们进行了广泛的迁移学习实验,包括简单到简单的迁移和复合规则迁移设置。
6. 6\.我们使用层次聚类、多维尺度分析(MDS)和缠结图比较分析了迁移学习的几何结构,以研究规则族之间的关系和迁移行为。
7. 7\.我们分析了伪机器人辅助的人类学习,寻求辅助与非辅助人类游戏玩法之间的行为差异。我们开发了 GOHR 的 Gymnasium 兼容实现,通过兼容性封装器保留了遗留观察管道,同时支持与现代强化学习框架集成。

## 2 隐藏规则游戏
### 2.1 GOHR 概述
*隐藏规则游戏*(GOHR)是本研究使用的主要环境。它是一个受控的实验框架,旨在研究人类和人工智能体中的规则发现、学习和泛化。GOHR 由威斯康星大学麦迪逊分校的研究人员开发,并已作为研究隐藏结构学习的测试平台(\[6 (https://arxiv.org/html/2608.21372#bib.bib9), 1 (https://arxiv.org/html/2608.21372#bib.bib8), 2 (https://arxiv.org/html/2608.21372#bib.bib12), 7 (https://arxiv.org/html/2608.21372#bib.bib11)\])。该环境由一个6×6网格棋盘和位于四个角落的四个桶组成。每个回合开始时,n=9个对象随机放置在棋盘上。每个对象由两个属性描述:形状和颜色。一个隐藏规则支配着对象必须如何被分配到桶中。玩家(人类或智能体)的目标是通过试错交互正确推断这个隐藏规则,并成功地将所有对象放入有效的桶中。由于规则未明确提供,该任务涉及两个相互关联的挑战:识别支配对象-桶分配的潜在规则,以及学习一个与该规则一致的选择动作的策略。两个关键实体定义了环境:
- •规则:定义将对象属性(例如颜色、形状、位置)映射到有效桶分配的约束。
- •棋子(对象):具有形状和颜色等属性的游戏元素,在每个回合开始时随机初始化在棋盘上。
### 2.2 游戏机制
#### 2.2.1 棋盘布局
GOHR 棋盘是一个6×6的网格,索引从1到36,四个桶位于角落。每个网格单元对应一个唯一的位置索引,而空间坐标(x,y)定义了实际布局。
表1:GOHR 棋盘的表示。
#### 2.2.2 棋子、桶与规则
棋盘上的每个对象定义如下:
- •形状:几种形状类别之一(例如正方形、圆形)...

相似文章

从具体到抽象的人工智能:向大众揭开人工智能的神秘面纱

arXiv cs.AI

本文介绍了一种名为 AIcon2abs 的方法论,该方法结合了可视化编程与 WiSARD 无权重神经网络,通过动手实践活动帮助普通大众(包括儿童)理解人工智能概念。该方法将训练与分类作为一等编程构件,使学习型机器与传统程序之间的区别更加直观易懂。

通用推理的可迁移性:多领域RLVR的自动化课程设计

Hugging Face Daily Papers

本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。

基于强化学习的智能体Transformer可证明地学会搜索

arXiv cs.LG

本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。