标签
论文提出 GAVA 框架,用于在具身智能体收到用户纠正时,仲裁应接受、拒绝、探索环境还是请求澄清;实验在纯文本的 ALFWorld 中进行,利用从训练中获得的物体-位置先验知识,相比均匀基线减少了交互成本与联合成本。
该论文提出 MATE,一种确定性的检索后记忆适配方法,将检索到的轨迹转换为面向执行的记忆,供具身智能体使用。在 134 个 ALFWorld 任务上,使用 Qwen2.5-14B 和 72B 分别取得 81.3% 和 93.3% 的成功率,同时 token 消耗约为原始轨迹的十分之一。
SciHorizon-eLab 是一个智能体协议至任务编译器,用于将科学协议编译为具身任务以进行可扩展基准测试,并引入了一个包含300个认证任务的基准测试。
RoboFoundry提出了一种面向具身智能体的自演化系统即策略框架,在基准测试中达到最先进的性能,并支持真实世界部署中的零样本迁移。
RoboFollow 引入了一个诊断基准,通过分析高场景熵和扰动来揭示具身代理中的指令跟随幻觉,暴露了当前模型在强大初始性能背后的差距。
OmniEcho引入了一种空间感知的全模态模型和一个新的基准,用于具身智能体的空间音频-视觉感知和导航,实现了最先进的性能。
本文将行为知识形式化为前置条件贝叶斯网络,并探讨了在神经符号强化学习中针对具身代理的三种放置策略,展示了在MiniGrid和Fetch等基准测试中在解决方案质量和样本效率方面的改进。
本文提出了一种用于持续实体代理更新准入的审计协议,强调需要在错误控制与保留学习机会之间取得平衡,以防止有害更新并促进有用学习。
该项目允许用户在基于物理的模拟中提示AI智能体进行一对一足球比赛,并评估提示在具身环境中转化为行动的效果。
SafeBranch 是一个框架,通过使用来自不安全轨迹的分支对,使具身智能体对齐以安全行动,显著提高了交互任务中的安全性,而不牺牲任务成功率。
This paper argues that representing agent skills as code, rather than natural language, yields the best cost reduction for LLM agents, and introduces SpeedRunner, a coding agent that learns programmatic skills from past trajectories to improve performance while cutting costs across embodied environments.
介绍了Thea,一个用于具身智能体的操控框架,将机器人能力编排为可调用的工具,引入场景图作为上下文和评估作为退出码,以闭环连接智能体与物理世界。
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。
介绍一种名为Combodied Agents的新范式,它统一了数字智能体和具身智能体,以建模、预测并长期支持个体人类状态轨迹,重点关注人类的持续福祉而非任务完成。
本文提出了CEAA,一种模块化的认知架构,用于具身智能虚拟代理,将高层推理模型与实时交互3D环境中的具身执行相结合。
360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。
这是一篇综述论文,为具身代理中的语言接地引入了功能角色分类,区分了五种角色,并通过审计证据来评估语言的贡献是否真正得到支持。
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。