语言的作用与证据支持:具身代理中语言接地的功能角色分类及证据审计

arXiv cs.CL 论文

摘要

这是一篇综述论文,为具身代理中的语言接地引入了功能角色分类,区分了五种角色,并通过审计证据来评估语言的贡献是否真正得到支持。

arXiv:2608.03099v1 公告类型:新 摘要:基础模型将语言广泛应用于具身代理中,但其存在并不能说明语言贡献了什么,或这种贡献的接地程度如何。本综述将这两个问题分开讨论。我们为语言定义了五种非排他的功能角色:规格指定、具身表征、动作编排、接地调控和执行耦合。针对每种角色,我们追踪从语言内容到其具身消费者的路径,并识别能够检验所宣称职责的观察或干预措施。将该框架应用于所评审的文献,揭示出功能使用与证据支持之间反复出现的差距。可解释的或被修订的语言中间产物可能是不正确的、未被使用的,或未能影响后续行为。即使行为直接以语言为条件,系统层面的成功本身也不能将语言的贡献单独分离出来。因此,我们逐项评估接地主张,询问所报告的证据是否支持赋予语言的具体责任。以角色主张而非架构作为比较单元,使我们能够在不将结论延伸到所报告证据之外的情况下,比较模块化与端到端的具身代理。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:43

# 语言在具身智能体中的作用及其证据支持:一种功能角色分类法与语言锚定的证据审计
来源:https://arxiv.org/html/2608.03099
Yifan Guo1, Chenghao Li2, Zhu Wang1,†, Wei Xu1, Yu Li1, Yulong Zhu1, Zhuo Sun1, Bin Guo1, Zhiwen Yu1
1Northwestern Polytechnical University
2University of Electronic Science and Technology of China
†通讯作者

###### 摘要

基础模型将语言贯穿于具身智能体之中,但语言的存在并不能表明其贡献了什么,也无法表明这种贡献在多大程度上得到了锚定。本综述将这两个问题分开处理。我们为语言定义了五个非排他性功能角色:规范(Specification)、具身表征(Embodied Representation)、动作编排(Action Orchestration)、锚定调节(Grounding Regulation)与执行耦合(Execution Coupling)。针对每个角色,我们追踪从语言内容到其具身消费端的路径,并识别能够检验所声称责任的观察或干预措施。将此框架应用于所评述的文献,揭示了功能使用与证据支持之间反复出现的鸿沟。可解释或经修订的语言中间产物可能是错误的、未被使用的,或者无法影响后续行为。即使动作直接以语言为条件,系统级成功本身也不能孤立出语言的贡献。因此,我们逐项评估锚定主张,检验所报告的证据是否支持赋予语言的具体责任。以角色主张而非架构作为比较单位,使我们能够在不断言超出所报告证据的前提下,比较模块化与端到端的具身智能体。语言在具身智能体中的作用及其证据支持:一种功能角色分类法与语言锚定的证据审计

## 1 引言

语言如今已贯穿于具身行为之中。它可以定义任务或组织已习得的技能(Ahnet al.,2022 (https://arxiv.org/html/2608.03099#bib.bib2); Lianget al.,2023 (https://arxiv.org/html/2608.03099#bib.bib1))。语言对齐的表征可以使空间状态可供后续决策使用(Huanget al.,2023a (https://arxiv.org/html/2608.03099#bib.bib4))。语言还可以表达奖励或在检测到失败后修正行为(Yuet al.,2023 (https://arxiv.org/html/2608.03099#bib.bib8); Duanet al.,2024 (https://arxiv.org/html/2608.03099#bib.bib17))。在其他系统中,语言直接约束动作策略(Zitkovichet al.,2023 (https://arxiv.org/html/2608.03099#bib.bib11))。这些机制通常被放在“语言锚定”的标题下讨论,尽管它们赋予了语言内容不同的责任。

然而,改进后的语言条件成功并不能确立语言内容得到了更好的锚定。更好的感知能力或更广泛的机器人数据可能解释这种提升。动作模型、规划器或控制器的变化也可以解释这种提升(Zitkovichet al.,2023 (https://arxiv.org/html/2608.03099#bib.bib11); Liet al.,2024a (https://arxiv.org/html/2608.03099#bib.bib18))。因此,证据必须将语言贡献与这些替代解释区分开来。

图1:综述框架概览。具身回路提供了语言可能承担五种非排他性功能角色的语境。角色根据语言派生内容所起的作用进行分配。对于每一项论文–角色主张,证据审计都询问所声称的贡献是否能够连接到下游具身行为。

只有在确定了赋予语言的责任之后,才能评估锚定。因此,我们的核心问题是:*语言在具身智能体中承担哪些功能角色,哪些具身证据支持这些角色?* 我们区分了五个非排他性角色:规范、具身表征、动作编排、锚定调节和执行耦合。这些角色可能在同一系统中共存。因此,我们根据语言组件所实例化的角色来刻画一篇论文,而不是将整个系统强行归入单一类别。对于每个角色,我们追踪从语言内容到消费它的具身组件的路径。然后,我们询问哪些已报告的观察或干预措施能够检验赋予语言的责任。图1(https://arxiv.org/html/2608.03099#S1.F1)说明了这种分析形式。

应用这种基于角色的视角揭示了一个反复出现的问题:针对系统某一属性的证据有时被用来支持一个更强的主张。我们称之为*证据替代*。在评述的文献中,有四种形式反复出现。

1. 1. 显式语言并不是锚定内容的证据。可读的中间产物使语言角色更容易被检查。但它并不表明内容与当前环境匹配,也不表明智能体在行动时依赖它。
2. 2. 内部修订并不是具身修正。批评或修订后的计划表明内部状态发生了变化。只有当中期修订改变了后续可执行的决策时,它才构成具身修正。恢复主张还需要改进结果的证据。
3. 3. 任务成功并不是语言归因。任务成功评估的是整个系统。将提升归因于语言需要一个直接针对所声称语言角色的比较。
4. 4. 接近动作并不等于更强的锚定。直接对动作进行条件化使语言内容靠近运动输出,但它并不能孤立语言贡献。锚定强度取决于与所声称角色相关的证据。

审计并不假设语言贡献无法被孤立。许多论文包含匹配对照,以测试特定承载角色的量。但很少有论文将观察到的结果通过修订追踪到改变后的可执行尝试。在我们的分析中,功能责任和证据支持被分别记录。前者识别语言改变了什么;后者确定所报告的实验对该改变确立了何种结论。

本综述有三个贡献。首先,它引入了一种功能分类法,通过非排他性语言角色剖面来表征具身系统,而不是通过架构或处理阶段。其次,它通过将每个所声称的角色追溯到与之相关的具身测试来比较锚定机制。第三,它审计了评述文献中报告的证据,并将反复出现的鸿沟转化为具体的报告问题。第2节(https://arxiv.org/html/2608.03099#S2)定义了综述范围。第3节(https://arxiv.org/html/2608.03099#S3)至第5节(https://arxiv.org/html/2608.03099#S5)引入了分类法,考察了五个角色如何实现,并报告了证据审计。第6节(https://arxiv.org/html/2608.03099#S6)提出了对评估和报告的启示。附录记录了语料库构建过程,并提供了完整的角色和证据剖面。

## 2 范围与综述定位

我们根据语言内容在一个具身系统中改变什么来界定综述范围,而不是根据模型标签。同样的规则适用于大语言模型(LLMs)、视觉–语言模型(VLMs)、多模态大语言模型(MLLMs)和视觉–语言–动作模型(VLAs)。只有语言内容具有通向情境化智能体中任务相关状态或行为的已报告路径时,论文才符合纳入条件。该路径可以在当前交互期间起作用,也可以通过稍后重用的经验起作用。仅用于标注、事后描述或离线评分的语言不符合条件。我们还排除了没有智能体–环境后果的离线基准。这些标准决定了纳入与否,而不决定证据强度。

持续学习系统只有在先前获取的语言条件信息对后续具身回路具有已报告影响时才被纳入;持续学习不被视为单独的功能角色。附录A(https://arxiv.org/html/2608.03099#A1)记录了搜索和筛选程序。这一边界保留了长期以来的要求,即语言内容必须对情境化感知和行动负责(Harnad,1990 (https://arxiv.org/html/2608.03099#bib.bib53); Roy,2005 (https://arxiv.org/html/2608.03099#bib.bib54); Bisket al.,2020 (https://arxiv.org/html/2608.03099#bib.bib56))。

基础模型赋能的智能体使得归因变得困难,因为语言在一个更大的具身系统内部运作。报告出的提升可能来自于解释场景或产生运动的组件。它也可能取决于用于训练这些组件的数据。因此,我们的问题不是完整系统是否成功,而是哪种变化可以归于语言,以及何种证据支持这种归属。

现有综述通常围绕模型设计、机器人能力或学习范式来组织这一领域(Wanget al.,2024 (https://arxiv.org/html/2608.03099#bib.bib46); Maet al.,2026 (https://arxiv.org/html/2608.03099#bib.bib47); Chenet al.,2026b (https://arxiv.org/html/2608.03099#bib.bib52))。这些视角解释了具身系统是如何构建的,以及它们处理哪些任务。我们提出一个不同的问题:语言内容承担什么责任,以及这种责任是如何被检验的?我们的比较单位是从语言内容到行为的角色特定路径,这种路径在模块化和端到端系统中都可以识别。由于一篇论文可能包含多条这样的路径,角色仍然是非排他性的。附录B(https://arxiv.org/html/2608.03099#A2)将这一分析选择与代表性综述进行了比较。

## 3 从语言功能到具身证据

在界定了范围之后,我们要问:语言内容在具身回路内部造成了什么差异?语言模块的位置不能回答这个问题;其下游责任才能。我们区分五个功能角色,总结于表1(https://arxiv.org/html/2608.03099#S3.T1)。这些角色被分配给语言内容,而不是分配给整个系统或按时间顺序的阶段。一个规划器可能定义任务,同时也选择用于实现该任务的技能。一个空间表征可以描述具身状态,同时直接约束运动。我们将在同一系统中实例化的角色集合称为其*功能角色剖面*。

表1:赋予语言派生内容的五个非排他性功能角色的操作性定义。

| 角色 | 操作性定义 |
|------|-----------|
| 规范 | 确定后续行为应实现什么,通过将指令与场景或能力关联,并可能对任务进行修订。 |
| 具身表征 | 将语言可寻址的状态或空间信息提供给语言系统下游的组件。 |
| 动作编排 | 选择、排序、分解或参数化可用的技能或运动原语。 |
| 锚定调节 | 使用环境证据改变与任务、状态或执行相关的语言派生内容,并影响后续行为。 |
| 执行耦合 | 对产生物理动作的路径上的动作策略或控制信号进行直接条件化。 |

几个边界使这些角色保持区分。规范涉及要满足的任务;动作编排涉及如何使用可用能力来实现该任务。具身表征使状态可供后续消费者使用,而执行耦合则将语言派生量置于产生物理动作的路径上。动作编排可以保持开环。锚定调节仅在新的证据改变下游计算且该变化到达后续具身行为时开始。识别一个功能角色并不表明该角色已被锚定。

对于每项论文–角色主张,我们编码五种非排他性证据操作。

- **R:路径可追溯性。** 可以识别语言派生量、其下游具身消费者以及两者之间的路径。
- **T:定向行为测试。** 对承载角色的量或接口进行的干预会产生已报告的行为后果。
- **C:具身约束检验。** 使用实例匹配的具身指称对象或约束来检查操作或评估期间承载角色的内容。
- **F:闭环反馈。** 观察到的结果触发修订,该修订改变了后续可执行的决策或尝试。
- **I:主张相对隔离。** 匹配的比较将所声称的角色与其主要替代解释隔离开来。隔离是相对于所述主张而言的。它不需要控制完整系统能力的每一个来源。

这些操作既不是额外的功能角色,也不是成熟度量表上的步骤。附录A.3(https://arxiv.org/html/2608.03099#A1.SS3)给出了编码规则。操作提供的保证还取决于具身检查的来源。预言机或模拟器状态可以检验与建模约束的一致性,但它不能确立现实世界的鲁棒性。来自直接感知或物理结果的证据支持不同的主张。例如,触觉接触可以验证所表征的物理属性,但并不能表明智能体在失败后能够恢复。我们将检查的来源称为其*证据来源*。

语料库级别的频率统计的是具有至少一项合格角色主张的不同论文。在一篇论文中分配多个角色不会增加论文计数。第4节(https://arxiv.org/html/2608.03099#S4)使用角色定义来比较具身机制。第5节(https://arxiv.org/html/2608.03099#S5)将证据操作应用于评述文献中报告的主张。

## 4 语言在具身回路中的作用

规范
主分配:15 完整剖面出现:21
π0, A2Nav, CLAIRIFY, CoELA, GR00T N1, Hi Robot, HRC Manipulation, Humanoid-LLA, Instruct2Act, LAGE, AMobility VLA, OpenVLA, RoboBrain, SMART-LLM, ViLa

具身表征
主分配:56 完整剖面出现:76
3D-VLA, 3DLLM-Mem, Anticipation-VLA, ChatVLA, ChatVLA-2, CLIP-Nav, CogACT, CogVLA, CoNVOI, CoPa, CoT-VLA, Dejavu, DexGraspVLA, Distilled Feature Fields, ECoT, Embodied-RAG, EmbodiedGPT, EnerVerse, Explore until Confident, Fast-in-Slow, Fast-ThinkAct, FlowVLA, GPT-4V for Robotics, HAMSTER, JanusVLN, LEO, LGX, LManip, LLMManipulate, Anything, MemER, MOKA, MOO, MultiPLY, NavCoT, NavGPT, NavGPT-2, Octopi, OmniManip, OneTwoVLA, PaLM-E, PhysObjects, PIVOT, RoboGround, RoboPoint, RT-H, SayPlan, Scene-LLM, SpatialVLA, Statler, TaPA, ThinkAct, TLA, UP-VLA, Visual Language Maps, VoxPoser, VTLA

动作编排
主分配:12 完整剖面出现:68
DECKARD, DEPS, Grounded Decoding, LLM-DP, LLM-Planner, Octopus, ProgPrompt, ReplanVLM, SayCan, SEE, A-R1, Unified Agent, Zero-Shot Planners

锚定调节
主分配:18 完整剖面出现:52
AHA, APOD, CELITEE, EmbodiSkill, Evolvable Embodied Agent, GRAPE, Hume, Inner Monologue, KnowNo, Language to Rewards, Large Reward Models, Reflective Planning, RoboFuM, SAIL, Text2Reward, VLA-RL, VLM-Social-Nav

执行耦合
主分配:4 完整剖面出现:62
Code as Policies, DexVLA, ReKep, RT-2

图2:评述文献中的功能角色剖面。对于每个角色,图显示了具有该主分配的论文数量,以及该角色出现在完整剖面任意位置的数量。论文标签显示主分配。每篇论文有一个主分配,但可能实例化多个角色。附录C(https://arxiv.org/html/2608.03099#A3)提供了相应的论文级清单。

图2(https://arxiv.org/html/2608.03099#S4.F2)显示,单一系统可能为语言分配多个角色。本节比较每个角色的代表性机制。附录C(https://arxiv.org/html/2608.03099#A3)提供了支撑这一比较的完整论文级清单。

### 4.1 规范:使智能体承诺于一项任务

规范确定后续行为应实现什么。一些系统根据观察到的场景对指令进行形式化。其他系统在分解任务时使用可用能力,或在交互过程中修订任务。

场景关联的形式化将指令连接到能够引导后续行为的实体和条件。ViLa将指令和观察到的场景翻译为PDDL对象、初始状态和目标,使规划器应该将什么视为任务变得明确(Shiraiet al.,2024 (https://arxiv.org/html/2608.03099#bib.bib14))。Hi Robot则保持承诺的可修订性,将开放式指令和情境化的用户插话转化为更新后的命令,用于视觉运动策略(Shiet al.,2025 (https://arxiv.org/html/2608.03099#bib.bib25))。这些应用

相似文章

社会模拟中语言模型的角色引导

arXiv cs.CL

介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

arXiv cs.AI

This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。