基于宏动作的多智能体指令遵循:价值取消方法
摘要
提出MAVIC,一种多智能体强化学习方法,在指令边界修正价值估计,以在遵循外部自然语言指令的同时保持基础任务性能。
arXiv:2605.12655v1 公告类型:新
摘要:实际应用中的多智能体强化学习(MARL)可能需要适应外部自然语言指令,这些指令会中断当前行为并与长期目标冲突。然而,基于指令的条件奖励引入了根本性失效模式,因为贝尔曼更新跨指令上下文耦合了值估计,导致指令中断宏动作时值不一致。我们提出了宏动作值修正的指令遵循方法(MAVIC),该方法通过修正传入指令目标并恢复当前目标下的延续值,在指令边界处修正贝尔曼备份。与奖励塑造不同,MAVIC修改了引导目标本身,从而在统一策略下实现随机指令切换时的一致值估计。我们提供了理论分析和演员-评论家实现,并展示了MAVIC在日益复杂的协作多智能体环境中,在保持基础任务性能的同时实现了高指令遵循率。
查看缓存全文
缓存时间: 2026/05/14 06:13
# 基于宏动作的多智能体指令遵循:通过值消除实现 来源: https://arxiv.org/abs/2605.12655 查看 PDF (https://arxiv.org/pdf/2605.12655) > **摘要:** 现实应用中的多智能体强化学习(MARL)可能需要适应外部自然语言指令,这些指令会中断正在进行的动作,并与长期目标产生冲突。然而,将奖励条件化于指令会引发一个基本的失败模式——贝尔曼更新会耦合不同指令上下文下的值估计,导致指令中断宏动作时出现不一致的值。我们提出用于指令遵从的宏动作值纠正方法(MAVIC),该方法在指令边界处通过纠正传入指令目标并恢复当前目标下的延续值来修正贝尔曼回溯。与奖励塑造不同,MAVIC修改了引导目标本身,从而在统一策略下实现随机指令切换时一致的值估计。我们提供了理论分析和演员-评论家实现,并展示MAVIC在日益复杂的协作多智能体环境中能够保持基础任务性能的同时实现高指令遵循率。 ## 提交历史 来自:Wo Wei Lin [查看邮箱 (https://arxiv.org/show-email/e97b481f/2605.12655)] **[v1]** 2026年5月12日 星期二 19:01:16 UTC (356 KB)
相似文章
考虑修改的价值学习用于强化学习中的奖励黑客缓解
提出考虑修改的价值学习(MCVL),一种针对离策略基于价值的强化学习的防护措施,通过评估每个转移对冻结的自举回报估计器的影响,在允许其进入训练之前进行筛选,从而缓解奖励黑客。
MetaAgent-X:通过端到端强化学习突破自动多智能体系统的天花板
MetaAgent-X引入了一个端到端的强化学习框架,联合优化自动多智能体系统的设计与执行,克服了冻结执行器的天花板,并在现有基线基础上实现了高达21.7%的性能提升。
递归多智能体系统
本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。
三思而后行:面向具身智能体的验证器引导动作选择
提出VeGAS框架,一种针对基于MLLM的具身智能体的测试时框架,该框架采样多个候选动作,并利用生成式验证器选择最可靠的动作,在挑战性任务上相比CoT基线实现了高达36%的相对性能提升。
BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计
BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。