标签
本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。
This paper empirically studies how VLM agents with persistent spatial memory fail when memory becomes stale, using a dynamic FrozenLake testbed. It finds that trusting stale memory can more than double death rates, and that read-time auditing helps but does not fully close the gap.
本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。
SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。
GROW提出了一种新颖的强化学习框架,通过将轨迹分解为状态-动作对并计算它们之间的优势,将GRPO适配到多轮VLM智能体任务中,在超过800个Minecraft任务上实现了最先进的性能。
AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。