基于近体学奖励建模的深度强化学习社交合规导航
摘要
本文提出了一种基于近体学的奖励公式,用于深度强化学习社交导航,将人类个人空间建模为高斯混合场,以提高社交合规性,同时保持导航效率。
查看缓存全文
缓存时间: 2026/08/14 09:32
# 面向深度强化学习中的社交合规导航:基于近体学的奖励建模 Source: https://arxiv.org/abs/2608.12917 View PDF (https://arxiv.org/pdf/2608.12917) > 摘要:在拥挤环境中开发有效的机器人导航方法对于现实世界应用至关重要。尽管近期的深度强化学习(DRL)方法改善了拥挤环境中的导航性能,但它们通常主要关注以任务为中心的目标,而未充分体现社交合规目标。本文提出了一种基于近体学的新型奖励公式,用于DRL社交导航,在保持导航效率的同时提供密集、可解释的社交学习信号。我们的方法将每个人的个人空间建模为由霍尔近体学理论推导出的径向高斯混合场,并在机器人的视野上计算机器人中心的局部成本。我们将所提出的奖励集成到已有的DRL导航方法中,并在多种人群场景、奖励基线和人群密度下进行仿真评估,同时使用导航指标和社交指标。结果表明,与对比的奖励模型相比,所提出的奖励在仿真中持续改善社交指标,同时保持有竞争力的导航性能。 ## 提交历史 来自:Takieddine Soualhi [查看电子邮件 (https://arxiv.org/show-email/8d98943a/2608.12917)] [通过CCSD代理] **[v1]** 周四,2026年8月13日 07:59:23 UTC(4,835 KB)
相似文章
Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning
The paper proposes calibrating an artificial guilt reward signal from human neural and behavioral fMRI data, then embeds it in multi-agent PPO agents. The neurally calibrated agents match human social decision rates far better than hand-tuned or selfish baselines.
面向行人行为不确定性的安全自动驾驶的多智能体强化学习
本文提出了一种多智能体强化学习框架,该框架同时训练自动驾驶车辆和具有个性驱动乱穿马路行为的行人,与单智能体方法相比,碰撞率降低了30%,并展示了更真实的交互场景。
奖励作为具身世界模型的智能体
本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。
结构化强化学习在贝叶斯劝导中的应用:面向智能交互驾驶
本文针对交互驾驶中的贝叶斯劝导问题,提出了一种结构化强化学习框架。在该框架中,领航车辆通过选择性披露交通信息来引导网联车辆。该方法引入了MAPL和SQP算法,相比现有方法实现了30%的成本效率提升。
学习社会规范增强动态人机协调中的兼容性
本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。