标签
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
PhysCaP 是一个基于物理信息的代码生成代理,它通过主动探索物体来推断隐藏的物理属性,以实现高效的机器人操作。
本文提出一个用于具身目标消歧的主动感知框架,使用视觉语言模型基于累积的视觉证据和交互信息进行决策。真实机器人实验展示了其在结合物理观察和用户意图澄清方面的有效性。
本文提出了慢思考与主动感知的数学形式,引入了名为'active lifting'的理论,该理论推导了慢思考大语言模型的设计、训练和推理过程。
本文介绍了一种针对世界模型的认证感知时钟,该时钟基于模型的有效性视界,提供了一种主动的、解析推导的截止时间,用于指示智能体何时必须重新感知。本文提出了一种漂移感知部署方法,并在冻结的3D VN-JEPA模型上展示了其有效性,与基准调度器相比减少了尾部违规。
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Co-GLANCE 是一种用于异构机器人团队的实时机载感知与决策系统,它将视觉语言模型的能力蒸馏为高效模型,并利用保形预测与选择性弃权来量化并解决感知不确定性,相比基于云端的视觉语言模型基线高出 25-36%,同时延迟降低了 350 倍。
ActiveMimic 是一个预训练框架,它从自我中心人体视频中恢复相机和手腕轨迹,将主动感知建模为视角动作,从而使机器人预训练能够达到与直接在机器人数据上训练的模型相当的性能。