探索语言与非语言代理之间的协作

Hugging Face Daily Papers 论文

摘要

本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。

语言模型(LLMs)越来越多地被部署为编排器,通过自然语言协调专门的子代理来解决复杂任务。然而,在许多重要领域,如游戏和机器人技术,最强的可用代理并非语言模型。将非语言代理与语言模型整合需要文本化:在每个交互步骤中,将它们丰富的连续表示压缩成稀疏的文本摘要。为了研究文本化是否构成瓶颈,我们引入了LLAMIA-Bench,这是一套包含六个多样化协作棋类任务的基准,涵盖三个方面:行为模仿、状态评估和自然语言解释。每个任务实例化了一个成熟的棋类问题,语言模型或国际象棋引擎单独都无法解决。为了解决语言模型与非语言代理的协作问题,我们引入了潜在状态内化方法,该方法将子代理的连续表示直接投射到语言模型的令牌流中,作为学习的状态令牌,并随着动作推进环境状态进行动态重编码。比较内化与文本化整合,我们的实验揭示了一种持续的文本化债务:性能差距在训练过程中不断扩大,并且当语言模型从4B扩展到14B参数时仍然存在。一个经过潜在状态内化训练的14B模型LLAMIA,在所有基准任务中匹配或超越了任务专家和前沿模型(包括具有工具访问的GPT-5.1),并且在任务特定微调崩溃的分布外场景中泛化良好。
查看原文
查看缓存全文

缓存时间: 2026/09/03 11:51

论文页面 - 探索语言与非语言智能体之间的协作

来源:https://huggingface.co/papers/2609.00474

摘要

一个协作式国际象棋任务基准测试表明,通过学习的状态标记直接将连续的子智能体表示整合到语言模型中,其性能优于基于文本的语义化表达,并能有效扩展。

大型语言模型越来越多地被部署为协调器,通过自然语言协调专门的子智能体来解决复杂任务。然而,在游戏和机器人技术等许多重要领域,最强大的可用智能体并非语言模型。将非语言智能体与大型语言模型整合,需要通过语义化表达:在每个交互步骤中,将其丰富的连续表示压缩为稀疏的文本摘要。为了研究语义化表达是否构成瓶颈,我们推出了LLAMIA-Bench——一套包含六个多样化协作式国际象棋任务的测试套件,涵盖三个方面:行为模仿、状态评估和自然语言解释。每项任务都体现了一个经典的国际象棋问题,而大型语言模型或国际象棋引擎都无法单独解决。为解决大型语言模型与非语言智能体的协作问题,我们引入了潜在状态内化方法,该方法将子智能体的连续表示直接投射到大型语言模型的标记流中,作为学习的状态标记,并在环境状态随动作推进时进行动态重编码。通过对比内化与语义化整合方式,我们的实验揭示了一种持续存在的语义化债务:性能差距在训练过程中不断扩大,并且在大型语言模型规模从40亿参数扩展到140亿参数时依然存在。一个140亿参数的模型LLAMIA,通过潜在状态内化进行训练,在所有基准测试任务中达到或超越任务专家模型及前沿模型(包括具有工具访问权限的GPT-5.1),并且在特定任务微调失效的分布外场景中也能良好泛化。

查看arXiv页面 (https://arxiv.org/abs/2609.00474)查看PDF (https://arxiv.org/pdf/2609.00474)项目页面 (https://behavior-in-the-wild.github.io/llamia.html)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.00474)

在你的智能体中获取此论文:

hf papers read 2609\.00474

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。

包含此论文的收藏集1

相似文章

探索语言与非语言代理之间的协作

arXiv cs.CL

本文介绍了 LLAMIA-Bench 和一种称为潜在状态内化的方法,以增强语言模型与非语言代理之间的协作,表明内化连续表示优于口头化,并与前沿模型如 GPT-5.1 相匹配。

SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展

arXiv cs.AI

SMAC-Talk 是一个新的基准测试,在星际争霸多智能体挑战的基础上进行扩展,旨在评估基于 LLM 的智能体在具有自然语言通信的协作多智能体环境中的表现。该基准包含带有欺骗性通信者的场景,并使用 Qwen3.5 系列模型对智能体进行基准测试,以研究推理能力、记忆机制和模型规模对协调效果的影响。

网络上的大型语言模型:资源受限下的协作智能

Hugging Face Daily Papers

本文探讨了分布式大型语言模型(LLMs)如何在设备和云端之间协同工作以应对资源限制的协作智能范式。文章涵盖了垂直方向的设备-云端协作、水平方向的多智能体协作、路由策略,以及在可扩展且可信的协作式人工智能方面的开放研究挑战。