inverse-reinforcement-learning

标签

Cards List
#inverse-reinforcement-learning

@seclink: 小知识:1. 当海外大型企业纷纷探索逆强化学习时,国内具身智能领域却...

X AI KOLs Timeline ↗ · 2026-09-18 缓存

本文对比了中外企业在人工智能实践上的差异,着重分析了研究方法、数据伦理方面的不同,并呼吁加强监管以保护知识产权与隐私安全。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

人机自主团队中利用二阶心理理论同步信念(扩展版)

arXiv cs.AI ↗ · 2026-08-13 缓存

本文将对偏好的奖励学习重新定义为人机自主团队问题,指出知道目标的教师能够设计出比学习者驱动的查询选择更高效的训练示例。文章引入了带有二阶心理理论的理解陈述,以保持教师对学习者模型的同步,并通过仿真表明该方法优于学习者主导的选择。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

基于对抗逆向强化学习的无标签工业故障检测:一种面向运行至失效预测的系统

arXiv cs.LG ↗ · 2026-07-28 缓存

本文提出了一种用于机械故障检测的对抗逆向强化学习框架,该框架从正常运行数据中学习健康奖励,无需故障标签,在多个基准测试中实现了一致的检测性能。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

使用数据并行吉布斯采样的非参数贝叶斯逆强化学习

arXiv cs.LG ↗ · 2026-07-14 缓存

本文提出了一种非参数贝叶斯逆强化学习方法,使用狄利克雷过程先验从专家演示中推断多个潜在奖励类型,并通过Ray实现并行的折叠吉布斯采样器以提高可扩展性。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

在化学反应网络中实现强化学习:以趋光性作为好奇心驱动的探索

arXiv cs.LG ↗ · 2026-06-26 缓存

本文提出了一个框架,将部分可观测马尔可夫决策过程与生化反应动力学联系起来,用于建模单细胞藻类的趋光性,并利用逆向强化学习从实验轨迹中推断行为目标。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

入乡随俗:从异构智能体学习通用行为

arXiv cs.LG ↗ · 2026-06-18 缓存

本文介绍了GRID,一种社会学习方法,通过将每个智能体的奖励函数分解为通用奖励和特定奖励,从异构智能体中提取通用行为,从而得到一个避免模式平均偏差的通用智能体。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

量化逆强化学习中潜在观测缺失问题

arXiv cs.LG ↗ · 2026-05-14 缓存

本文识别了逆强化学习(IRL)中观测缺失的问题,该问题可能导致专家行为看似次优,并提出了一种实用算法,用于量化使专家行为显得最优所需的最小扰动,并在合成任务、癌症治疗模拟和ICU数据上进行了验证。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

信任域逆强化学习:利用局部策略更新进行显式对偶上升

arXiv cs.LG ↗ · 2026-05-13 缓存

本文介绍了信任域逆强化学习(TRIRL),这是一种结合了单调对偶改进与高效局部策略更新的方法,其性能优于最先进的模仿学习方法。该方法通过使用信任域约束,解决了逆强化学习中稳定性与计算成本之间的权衡问题。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

通过双层优化实现交互场景的交互式逆向强化学习

arXiv cs.LG ↗ · 2026-05-12 缓存

本文介绍了交互式逆向强化学习(IIRL),这是一个学习者通过与专家主动互动来推断奖励函数的框架,其形式化为随机双层优化问题。作者提出了 BISIRL 算法,为该交互式学习范式提供了收敛性保证和实验验证。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

利用逆强化学习进行多目标约束推断

arXiv cs.AI ↗ · 2026-05-11 缓存

本文介绍了 MOCI,这是一种新颖的框架,能够从强化学习中的异构专家演示中推断共享约束和个体偏好,在预测性能和计算效率方面均优于现有基线。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

SPS:通过概率挤压引导实现大语言模型强化学习中的更优探索

arXiv cs.CL ↗ · 2026-04-21 缓存

研究人员提出了 SPS(概率挤压引导),这是一种结合强化学习与逆强化学习的训练范式,旨在解决大语言模型推理训练中的概率挤压问题。该问题表现为概率质量过度集中于高奖励轨迹,导致探索空间受限及多样本性能(Pass@k)下降。在五个推理基准上的实验表明,该方法有效提升了模型的探索能力与 Pass@k 指标。

0 人收藏 0 人点赞
#inverse-reinforcement-learning

生成对抗网络、逆强化学习和基于能量模型之间的联系

OpenAI Blog ↗ · 2016-11-11 缓存

本文建立了生成对抗网络 (GAN)、逆强化学习 (IRL) 和基于能量的模型 (EBM) 之间的数学等价性,证明了某些 IRL 方法等价于具有可评估生成器密度的 GAN。这项工作连接了三个研究社区,促进知识转移,有助于开发更稳定和可扩展的算法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈