MAP:一种用于长周期交互式智能体推理的“先绘图后行动”范式
摘要
本文提出了“先绘图后行动”范式(MAP),这是一个即插即用的框架,在执行前将环境理解前置到交互式LLM智能体中,在多个基准测试中取得了一致性的性能提升,并使前沿模型在25个游戏环境中的22个上超越了接近零的基线性能。
查看缓存全文
缓存时间: 2026/05/14 04:16
论文页面 - MAP:一种用于长时域交互型智能体推理的“先映射后行动“范式
来源:https://huggingface.co/papers/2605.13037
摘要
交互型LLM智能体在执行过程中由于反应式理解而导致环境感知延迟和认知瓶颈,本文提出的“先映射后行动“范式(MAP)通过预先获取环境知识——包括全局探索、任务特定映射和知识增强执行——解决了这一问题。
当前交互型LLM智能体依赖于目标导向的逐步规划(https://huggingface.co/papers?q=goal-conditioned%20stepwise%20planning),其环境理解(https://huggingface.co/papers?q=environmental%20understanding)是在执行过程中被动获得的,而非事先建立。这种时间上的颠倒导致了延迟的环境感知:智能体必须通过试错(https://huggingface.co/papers?q=trial-and-error)来推断环境约束,从而陷入认知瓶颈(https://huggingface.co/papers?q=Epistemic%20Bottleneck),被困在低效的失败循环中。受人类可供性感知(https://huggingface.co/papers?q=affordance%20perception)和认知地图理论(https://huggingface.co/papers?q=cognitive%20map%20theory)的启发,我们提出了“先映射后行动“范式(MAP)(https://huggingface.co/papers?q=Map-then-Act%20Paradigm),这是一个即插即用框架,将环境理解前置到执行之前。MAP包含三个阶段:(1)全局探索(https://huggingface.co/papers?q=Global%20Exploration),获取环境通用先验知识;(2)任务特定映射(https://huggingface.co/papers?q=Task-Specific%20Mapping),构建结构化认知地图;(3)知识增强执行(https://huggingface.co/papers?q=Knowledge-Augmented%20Execution),基于地图解决任务。实验表明,在各种基准测试和LLM上均取得了一致的性能提升。在ARC-AGI-3(https://huggingface.co/papers?q=ARC-AGI-3)上,MAP使前沿模型在22个游戏环境中超越了接近零基线的性能。我们进一步引入了MAP-2K(https://huggingface.co/papers?q=MAP-2K)数据集,其中包含“先映射后行动“的轨迹,并表明在该数据集上训练的效果优于专家执行轨迹,这暗示理解环境比模仿更为根本。
查看arXiv页面(https://arxiv.org/abs/2605.13037)查看PDF(https://arxiv.org/pdf/2605.13037)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.13037)
在您的智能体中获取此论文:
hf papers read 2605\.13037
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型关联此论文
请在模型的README.md中引用 arxiv.org/abs/2605.13037 以在此页面建立链接。
引用此论文的数据集0
尚无数据集关联此论文
请在数据集的README.md中引用 arxiv.org/abs/2605.13037 以在此页面建立链接。
引用此论文的Spaces0
尚无Space关联此论文
请在Space的README.md中引用 arxiv.org/abs/2605.13037 以在此页面建立链接。
包含此论文的收藏0
尚无收藏包含此论文
请将此论文添加到收藏(https://huggingface.co/new-collection)以在此页面建立链接。
相似文章
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
MapSatisfyBench: 通过基于行为的隐式决策因素评估满意度感知的地图代理
MapSatisfyBench是一个基准,用于评估基于LLM的地图代理从表述不明确的用户查询中恢复隐式决策因素的能力,将评估从任务完成转向满意度感知的空间决策。
Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
从受训者到训练者:面向多智能体推理的强化学习的LLM设计训练环境
本文提出了LLM-as-Environment-Engineer框架,其中策略模型通过分析失败案例自动重新设计强化学习训练环境,并引入MAPF-FrozenLake作为可控测试平台。该框架使用Qwen3-4B模型,性能优于GPT和Gemini等更大规模模型,表明策略学习提升了模型诊断自身弱点的能力。
MapAgent:面向城市级车道级地图生成的工业级自主框架
MapAgent 是一个工业级自主框架,融合视觉语言处理与约束感知推理,能够自动生成符合规范的车道级地图,已在百度地图中为超过360个城市实现了95%以上的自动化。