探索语言与非语言代理之间的协作
摘要
本文介绍了 LLAMIA-Bench 和一种称为潜在状态内化的方法,以增强语言模型与非语言代理之间的协作,表明内化连续表示优于口头化,并与前沿模型如 GPT-5.1 相匹配。
arXiv:2609.00474v1 公告类型:新
摘要:语言模型越来越多地被部署为编排者,通过自然语言协调专门的子代理来解决复杂任务。然而,在许多重要领域,如游戏和机器人技术,最强的可用代理并非语言模型。将非语言代理与语言模型集成需要\emph{口头化}:在每个交互步骤中将其丰富的连续表示压缩为稀疏的文本摘要。为了研究口头化是否构成瓶颈,我们引入了\textsc{LLAMIA-Bench},这是一套六个多样化的协作国际象棋任务,涵盖三个方面:行为模仿、状态评估和自然语言解释。每个任务都实例化了一个既定的国际象棋问题,单独的语言模型或国际象棋引擎都无法解决。为了解决语言模型与非语言代理的协作问题,我们引入了\emph{潜在状态内化},它将子代理的连续表示直接投影到语言模型的令牌流中,作为学习到的状态令牌,并随着动作推进环境状态进行动态重新编码。通过将内部化与口头化集成进行比较,我们的实验揭示了一致的\emph{口头化债务}:性能差距在训练过程中不断扩大,并且当语言模型从 40 亿参数扩展到 140 亿参数时仍然持续。一个单一的 140 亿参数模型\textsc{LLAMIA},通过潜在状态内化进行训练,在所有基准任务中匹配或超越任务专家和前沿模型(包括具有工具访问权限的 GPT-5.1),并在分布外泛化,而特定任务的微调则崩溃。
查看缓存全文
缓存时间: 2026/09/02 05:52
# 探索语言与非语言代理之间的协作 来源:https://arxiv.org/html/2609.00474 Harini S I∗![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/adobe-logo.png)Somesh Singh∗![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/adobe-logo.png)![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/iiitd-logo.png)![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/ub-logo.png)Yaman K Singla![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/adobe-logo.png)Rajiv Ratn Shah![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/iiitd-logo.png)![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/iitk-logo.png)David Doermann![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/ub-logo.png)Balaji Krishnamurthy![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/adobe-logo.png)![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/adobe-logo.png)Adobe Media and Data Science Research \(MDSR\)![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/iiitd-logo.png)IIIT\-Delhi,![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/iitk-logo.png)IIT Kanpur,![[Uncaptioned image]](https://arxiv.org/html/2609.00474v1/images/ub-logo.png)SUNY at Buffalo[behavior\-in\-the\-wild@googlegroups\.com](mailto:[email protected]) ###### 摘要 大型语言模型(LLMs)正越来越多地被部署为协调器,通过自然语言协调专门的子代理以解决复杂任务。然而,在游戏和机器人等许多重要领域,现有最强大的代理并非语言模型。将非语言代理与LLMs集成需要*语言化*:在每个交互步骤中,将其丰富的连续表示压缩为稀疏的文本摘要。为了研究语言化是否构成瓶颈,我们引入了LLAMIA\-Bench,这是一套包含六个多样化协作国际象棋任务的测试集,涵盖三个方面:行为模仿、状态评估和自然语言解释。每个任务都体现了一个成熟的国际象棋问题,单独由LLM或国际象棋引擎均无法解决。为了解决LLM与非语言代理的协作问题,我们引入了*潜在状态内化*:将子代理的连续表示直接投影到LLM的令牌流中,作为学习到的状态令牌,并随着动作推进环境状态而进行动态重编码。比较内化与语言化集成,我们的实验揭示了一个持续的*语言化债务*:性能差距在训练过程中不断扩大,并且在LLM从4B扩展到14B参数时依然存在。一个经过潜在状态内化训练的14B模型LLAMIA,在所有基准任务上均达到或超过了任务专家模型和前沿模型(包括具有工具访问能力的GPT\-5\.1),并且在特定任务微调模型失效的分布外场景中实现了泛化。 ††脚注文本:代码、数据和示例可在https://behavior-in-the-wild.github.io/llamia.html获取 ††∗同等贡献。 ## 1 引言 大型语言模型(LLMs)正越来越多地被部署为通用协调器,用于协调工具和代理以解决复杂任务\(Hong et al\., 2024 (https://arxiv.org/html/2609.00474#bib.bib41);Tran et al\., 2025 (https://arxiv.org/html/2609.00474#bib.bib44)\)\。此范式的核心模式是与*子代理*协作:经过训练以在特定领域表现出色的专业代理\(Anthropic, 2025 (https://arxiv.org/html/2609.00474#bib.bib43);OpenAI, 2025 (https://arxiv.org/html/2609.00474#bib.bib42)\)\。这种协作使协调LLM能够利用子代理的领域特定智能\(Hong et al\., 2024 (https://arxiv.org/html/2609.00474#bib.bib41)\)并通过任务委托保持其上下文长度\(Zhang et al\., 2024b (https://arxiv.org/html/2609.00474#bib.bib40)\),从而实现有效的长期多步推理和规划。如今,这种协作完全通过自然语言进行:LLM调用子代理,接收其输出的自然语言描述,并基于该描述进行推理以决定后续行动\(Tran et al\., 2025 (https://arxiv.org/html/2609.00474#bib.bib44)\)。 当两个代理都是语言模型时,语言协作是自然的,因为它们共享词汇表并能用文字表达其状态。然而,在游戏、机器人技术和自动驾驶等许多重要领域,现有最强大的代理并非语言模型;其专业知识编码在内部表示中:捕捉策略、价值估计和学习特征的潜在状态,如AlphaZero\(Silver et al\., 2017 (https://arxiv.org/html/2609.00474#bib.bib6)\)和RT\-1\(Brohan et al\., 2022 (https://arxiv.org/html/2609.00474#bib.bib24)\)。 LLMs与非语言代理输入空间之间的这种不匹配提出了一个根本问题: - *LLMs如何能够有效地与非语言子代理协作并进行联合推理?* LLMs与子代理之间协作的深度可以解决许多两者单独无法解决的有用任务。以国际象棋为例:LLMs训练时接触的棋类文献比大多数专家一生研究的还要多,然而它们却无法利用这些知识来下好棋,远远落后于现代引擎和专家\(Kolasani et al\., 2025 (https://arxiv.org/html/2609.00474#bib.bib23)\)。相反,预训练引擎几十年前就超越了人类特级大师\(Campbell et al\., 2002 (https://arxiv.org/html/2609.00474#bib.bib1)\),但它们仍然是狭窄的专家,无法解释一步棋背后的原因或在不同背景下制定策略\(Jhamtani et al\., 2018 (https://arxiv.org/html/2609.00474#bib.bib27);Lee et al\., 2022 (https://arxiv.org/html/2609.00474#bib.bib30)\)。并且存在诸如游戏解说、准备对手和设计有趣的谜题等任务,这些都需要国际象棋引擎的深刻局面理解能力和LLM对人类意图的推理能力。LLM与子代理之间的有效协作可以解锁这些应用。 现有的LLM-子代理协作方法试图通过*语言化*子代理的输出为自然语言,然后在传递给LLM之前来弥合这一差距。早期工作在代理行动和价值估计的文本描述上微调语言模型\(Zang et al\., 2019 (https://arxiv.org/html/2609.00474#bib.bib29);Lee et al\., 2022 (https://arxiv.org/html/2609.00474#bib.bib30)\),而更近期的系统则依赖于上下文学习和工具调用接口在推理时呈现子代理输出\(Schick et al\., 2023 (https://arxiv.org/html/2609.00474#bib.bib21);Yao et al\., 2022 (https://arxiv.org/html/2609.00474#bib.bib20);Kim et al\., 2025 (https://arxiv.org/html/2609.00474#bib.bib18)\)。然而,这些方法共享一个共同假设:子代理的专业知识可以被忠实地语言化。 在这项工作中,我们证明了这种假设从根本上是限制性的。国际象棋引擎的潜在表示编码了局面结构、远期战术主题和学习的前瞻\(Jenner et al\., 2024 (https://arxiv.org/html/2609.00474#bib.bib31)\)——这些语义特征无法忠实地转化为文本。因此,语言化迫使子代理的表示通过一个有损瓶颈,将丰富的潜在结构压缩为表面描述。我们称这个概念为*语言化债务*Zhu et al\. \(2025\) (https://arxiv.org/html/2609.00474#bib.bib34),并在受控的异构LLM–代理协作中量化其下游成本。此外,我们表明这种误差在交互中累积:在多步设置中,代理之间的每次交流都会剥离细节并在推理过程中累积误差,从而削弱了最初促使这种协作的好处。 **内化:** 为了弥合这一差距,我们引入了*潜在状态内化*,这是一种范式,其中LLM通过单个由三种交错令牌类型组成的轨迹来推理非语言代理的内部状态:*语言*令牌(LLM的思维链)、*动作*令牌(推进环境的移动)和*潜在状态*令牌(代理倒数第二层激活投影到LLM嵌入空间)。如图2所示 (https://arxiv.org/html/2609.00474#S1.F2),该范式包含三个不同步骤: 1. LLM用语言推理并生成动作,使环境状态演化,例如在其思维链中构建反事实状态; 2. LLM按需请求代理评估一个状态,无论是当前位置还是通过候选移动达到的反事实状态; 3. 代理对结果状态进行编码,其激活被投影为\(k=32\)个连续*潜在状态*令牌,附加到推理轨迹中,并在每次状态转换后动态重新编码。 我们训练一个轻量级的三层MLP,*LatentBridge*(第2\.2节),它学习从代理内部状态到LLM令牌空间的投影。 **LLAMIA:** 我们通过两阶段训练一个LLM骨干来实例化潜在状态内化:监督式投影器对齐,然后是强化学习(DAPO),详见第2\.3节。我们将由此产生的模型称为LLAMIA(具有内部代理的大型语言与动作模型)。 除了技术贡献,内化也为现实世界应用开辟了新途径。因为内化需要访问模型权重,它不能直接应用于闭源模型。LLAMIA通过充当桥梁解决了这一矛盾:它用自然语言与LLMs交互,并内化子代理,间接但忠实地为闭权模型提供了对非语言代理专业知识的访问。这使得诸如基于情境的游戏解说和特定对手准备等现实世界创意应用成为可能,无需重新训练闭权模型。 **语言化债务:** 为了建立和分析内化与语言化相比的效果,我们训练了LLAMIA\-Verb,它与LLAMIA相同,区别在于子代理的输出作为文本而非潜在令牌传递给LLM。在训练过程中,LLAMIA在所有任务上持续获得更高的奖励(图3)。在需要更深层次多步集成的任务上,差距扩大。这些结果表明,当非语言代理被视为工具时,语言化是一个根本瓶颈。 **LLAMIA\-Bench,国际象棋作为测试平台:** 尽管应用广泛,LLM与非语言代理的协作仍未得到充分探索。一个主要原因是缺乏能够大规模研究这种协作的环境:具有可验证指标和开放预训练代理的多样化任务。国际象棋是一个完美的测试平台:数十年的人机协作在解说、准备和谜题方面产生了具有可验证指标的多样化任务、强大的开放预训练代理、既定的评估协议以及像LichessFeng et al\. \(2024\) (https://arxiv.org/html/2609.00474#bib.bib28)这样的大型公共语料库。 因此,我们使用国际象棋作为主要测试平台,并引入了LLAMIA\-Bench(附录B),这是一个精心策划的六任务套件,涵盖跨技能水平的行为克隆、谜题趣味性与难度估计、走法注释和游戏级解说。我们引入了一个从Agadmator的YouTube频道策划的新数据集用于游戏级解说。 图1:LLAMIA\-Bench在不同协作接口上的表现。六个国际象棋\-LLM任务的得分(×100)。方法按访问类型和骨干标注(OS = 开源,CS = 闭源):语言化工具使用(Qwen3\-14B\+Lc0,GPT\-5\+Lc0)、每任务微调专家(Task\-Finetune)以及LLAMIA的潜在集成。LLAMIA在每个任务上均匹配或超越每个基线,并且是唯一在谜题趣味性上得分的系统,在那里引擎信号没有文本替代品。"平均性能"是每种方法在其报告任务上的平均值。 **结果:** 单个LLAMIA\-14B模型在全部六个LLAMIA\-Bencht任务上均匹配或超越了每个特定任务专家和前沿模型(图1)。语言化债务在需要多步状态跟踪或不可语言化信号的任务上最为显著:尽管计算量相同,LLAMIA\-Verb在解说和谜题趣味性上的奖励保持平稳,表明语言化丢弃了有效多步协作所需的任务相关信息。内化还塑造了涌现的*协作类型*:LLAMIA发展出反事实查询和多步前瞻策略,这些在LLAMIA\-Verb中不存在,后者无论任务如何都坍缩为引擎跟随,这表明访问完整的潜在状态是使更丰富协作可学习的关键。 超越基准数字,LLAMIA复现了人类行为特征:在时间压力下,它会犯下与人类相同的错误;在不同技能水平下,其注意力集中在人类玩家优先考虑的相同棋子上。一项人类研究证实了这一点:LLAMIA的游戏在大多数试验中被当作人类,并且在战略洞察力和解释深度方面,其解说相比语言化基线更受青睐。 我们的贡献有四点: 1. 1\.**潜在状态内化**(第2节):一种LLM–非语言代理协作范式,使LLM能够推理交错的⟨*语言*,*动作*,*潜在状态*⟩令牌链。 2. 2\.**LLAMIA**(第2节):一个两阶段训练框架,包括自监督投影器对齐和端到端RL(DAPO),产生单个模型LLAMIA,在多样化协作任务上实现最先进的性能。LLAMIA通过为闭权模型提供对子代理的忠实访问来实现现实世界应用。 3. 3\.**语言化债务**(第3节):通过与LLAMIA\-Verb的受控消融实验,我们首次在异构LLM-代理协作中对*语言化债务*(内化与语言化集成之间的性能差距)进行了经验量化,其在性能和计算上均非最优,并且在需要更深层次多步协作的任务上差距扩大。 4. 4\.**LLAMIA\-Bench**(第3节):一个精选的基准测试集,包含六个国际象棋任务,涵盖行为克隆、谜题理解、解说和规划。 参见图注图2:**潜在状态内化**。随时间展开的单条思维链。 *t=0*(子代理调用):LLM开始用*语言*推理并输出;当前棋盘\(S\_\{0\}\)通过冻结的子代理(Lc0\-BT4)传递,*LatentBridge*将其隐藏激活映射为\(k=32\)个连续*潜在状态*令牌,附加到上下文中。 *t=1*(状态转换):在\(S\_\{0\}\)及其潜在状态的条件下,LLM继续推理并输出一个*动作*(Nc2),这使环境推进到\(S\_\{1\}\)。 *t=2*(子代理调用):LLM选择重新调用,将\(S\_\{1\}\)编码为新的*潜在状态*,因此后续推理基于更新后的棋盘。LLM决定何时重新调用,而不是在每个步骤都重新编码。 第一阶段仅在状态-策略对上训练LatentBridge;第二阶段联合微调
相似文章
探索语言与非语言代理之间的协作
本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。
网络上的大型语言模型:资源受限下的协作智能
本文探讨了分布式大型语言模型(LLMs)如何在设备和云端之间协同工作以应对资源限制的协作智能范式。文章涵盖了垂直方向的设备-云端协作、水平方向的多智能体协作、路由策略,以及在可扩展且可信的协作式人工智能方面的开放研究挑战。
超越标记:基于LLM的多智能体系统中潜在通信的统一框架
本文提出了一个基于LLM的多智能体系统中潜在通信的统一框架,按照通信信息内容、发送者-接收者对位和融合技术对方法进行分类,并回顾了2024至2026年间的十八种代表性方法。
@yoheinakajima: 更多人现在正在尝试这种通过共享状态进行通信的智能体方法(而非彼此对话)
Azalia Mirhoseini 强调 DeLM,一种去中心化语言模型方法,其中智能体通过共享状态通信,在SWE-bench Verified上使用Gemini-3 Flash实现了约10%的提升,且成本不到一半。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。