IFlowNets:扩展生成采样器以在不完全信息博弈中学习策略

arXiv cs.LG 论文

摘要

本文介绍了IFlowNets,将对抗流网络扩展到不完全信息博弈,证明了先前的约束条件无效,并在初步实验中显示出与现有方法相当或更好的性能。

arXiv:2608.05422v1 公告类型:新论文 摘要:虽然许多算法将强化学习(RL)与反事实遗憾(CFR)方法相结合,以利用计算速度和性能之间的权衡,但在不完全信息博弈的博弈论应用中,对生成采样框架的研究较少。我们将生成流网络框架——对抗流网络(AFlowNets)——扩展到不完全信息博弈,称为信息流网络(IFNs)。我们证明了先前为完全信息博弈中的生成流网络建立的约束条件,在获得有效密度(对应于玩家策略)和有效训练目标方面是不可接受的。我们表明,我们提出的泛化模型IFlowNets缓解了这一问题,并严格泛化了AFlowNets。在三个标准博弈环境的初步结果中,IFlowNets在性能和速度上均与结果采样蒙特卡洛反事实遗憾(OSMCCFR)和标准基于RL的方法相当或更好。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:50

# IFlowNets:扩展生成式采样器以在不完全信息游戏中学习策略

来源:https://arxiv.org/abs/2608.05422
查看 PDF (https://arxiv.org/pdf/2608.05422)

> 摘要:尽管许多算法将强化学习(RL)与反事实遗憾(CFR)方法相结合,以利用计算速度和性能之间的权衡,但在不完全信息游戏中,对博弈论应用中的生成式采样框架的研究仍然较少。我们将一种生成式流网络框架——对抗流网络(AFlowNets)——扩展到不完全信息游戏,称为信息流网络(IFNs)。我们证明,先前为完全信息游戏中的生成式流网络建立的约束条件,无法用于获得有效的密度(对应于玩家策略)和有效的训练目标。我们表明,我们提出的推广方法 IFlowNets 缓解了这一问题,并严格推广了 AFlowNets。在三个标准游戏环境的初步结果中,IFlowNets 在性能和速度上均表现出与结果采样蒙特卡洛反事实遗憾(OSMCCFR)和基于标准 RL 的方法相当或更优的结果。

## 提交历史

来自:Conor Artman [查看电子邮件](https://arxiv.org/show-email/86fec294/2608.05422) **[v1]** Wed, 5 Aug 2026 21:31:23 UTC (622 KB)

相似文章

通过非梯度向量流的流图学习

arXiv cs.LG

本文介绍了SGFlow,一种为扩散模型学习流图的方法,该方法避免了可逆性约束和通过模型迭代的反向传播,在CIFAR上取得了有竞争力的FID分数,并具有经过证明的稳定点保证。

Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习

arXiv cs.LG

提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。