基于近体学奖励建模的深度强化学习社交合规导航

arXiv cs.LG 论文

摘要

本文提出了一种基于近体学的奖励公式,用于深度强化学习社交导航,将人类个人空间建模为高斯混合场,以提高社交合规性,同时保持导航效率。

arXiv:2608.12917v1 公告类型:新 摘要:在拥挤环境中开发有效的机器人导航方法对于现实应用至关重要。尽管最近的深度强化学习(DRL)方法提高了拥挤环境中的导航性能,但它们通常主要关注以任务为中心的目标,而对社交合规目标的代表性不足。在本文中,我们提出了一种新颖的基于近体学的奖励公式,用于DRL社交导航,该公式提供了密集的、可解释的社交学习信号,同时保持导航效率。我们的方法基于Hall的近体学理论,将每个人的个人空间建模为径向高斯混合场,并在机器人的视野上计算机器人中心的局部成本。我们将所提出的奖励集成到既定的DRL导航方法中,并在多种人群场景、奖励基线和人群密度下使用导航指标和社交指标进行模拟评估。结果表明,与对比的奖励模型相比,所提出的奖励在模拟中持续改善了社交指标,同时保持了有竞争力的导航性能。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:32

# 面向深度强化学习中的社交合规导航:基于近体学的奖励建模
Source: https://arxiv.org/abs/2608.12917
View PDF (https://arxiv.org/pdf/2608.12917)

> 摘要:在拥挤环境中开发有效的机器人导航方法对于现实世界应用至关重要。尽管近期的深度强化学习(DRL)方法改善了拥挤环境中的导航性能,但它们通常主要关注以任务为中心的目标,而未充分体现社交合规目标。本文提出了一种基于近体学的新型奖励公式,用于DRL社交导航,在保持导航效率的同时提供密集、可解释的社交学习信号。我们的方法将每个人的个人空间建模为由霍尔近体学理论推导出的径向高斯混合场,并在机器人的视野上计算机器人中心的局部成本。我们将所提出的奖励集成到已有的DRL导航方法中,并在多种人群场景、奖励基线和人群密度下进行仿真评估,同时使用导航指标和社交指标。结果表明,与对比的奖励模型相比,所提出的奖励在仿真中持续改善社交指标,同时保持有竞争力的导航性能。

## 提交历史

来自:Takieddine Soualhi [查看电子邮件 (https://arxiv.org/show-email/8d98943a/2608.12917)] [通过CCSD代理] **[v1]** 周四,2026年8月13日 07:59:23 UTC(4,835 KB)

相似文章

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

学习社会规范增强动态人机协调中的兼容性

arXiv cs.AI

本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。