vlm-agents

标签

Cards List
#vlm-agents

面向多智能体 VLM 系统的协作记忆

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。

0 人收藏 0 人点赞
#vlm-agents

基于VLM智能体的上下文机器人学习

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。

0 人收藏 0 人点赞
#vlm-agents

我们能看见的谎言:VLM智能体在具身社会交互中的联合言语和非言语欺骗

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。

0 人收藏 0 人点赞
#vlm-agents

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

arXiv cs.CL ↗ · 2026-08-06 缓存

This paper empirically studies how VLM agents with persistent spatial memory fail when memory becomes stale, using a dynamic FrozenLake testbed. It finds that trusting stale memory can more than double death rates, and that read-time auditing helps but does not fully close the gap.

0 人收藏 0 人点赞
#vlm-agents

当记忆说谎:VLM智能体空间记忆过时性的实证研究

Hugging Face Daily Papers ↗ · 2026-08-05 缓存

本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。

0 人收藏 0 人点赞
#vlm-agents

SceneActBench: 智能体能否在其看到的3D场景中执行操作?

Hugging Face Daily Papers ↗ · 2026-07-24 缓存

SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。

0 人收藏 0 人点赞
#vlm-agents

GROW: 将GRPO与状态-动作建模对齐用于开放世界VLM智能体

arXiv cs.LG ↗ · 2026-05-21 缓存

GROW提出了一种新颖的强化学习框架,通过将轨迹分解为状态-动作对并计算它们之间的优势,将GRPO适配到多轮VLM智能体任务中,在超过800个Minecraft任务上实现了最先进的性能。

0 人收藏 0 人点赞
#vlm-agents

AtlasVA:面向无教师VLM Agent的自进化视觉技能记忆

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

AtlasVA是一个面向视觉语言模型Agent的无教师视觉技能记忆框架,它利用空间热图、视觉示例和符号文本技能来改善长时域任务中的空间决策,在多个基准测试中优于基线方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈