探索语言与非语言代理之间的协作
摘要
本文介绍了LLAMIA-Bench,一个用于语言模型和非语言代理之间协作棋类任务的基准,并提出了潜在状态内化方法以超越基于文本的表述,其中14B模型匹配或超越了如GPT-5.1等前沿模型。
查看缓存全文
缓存时间: 2026/09/03 11:51
论文页面 - 探索语言与非语言智能体之间的协作
来源:https://huggingface.co/papers/2609.00474
摘要
一个协作式国际象棋任务基准测试表明,通过学习的状态标记直接将连续的子智能体表示整合到语言模型中,其性能优于基于文本的语义化表达,并能有效扩展。
大型语言模型越来越多地被部署为协调器,通过自然语言协调专门的子智能体来解决复杂任务。然而,在游戏和机器人技术等许多重要领域,最强大的可用智能体并非语言模型。将非语言智能体与大型语言模型整合,需要通过语义化表达:在每个交互步骤中,将其丰富的连续表示压缩为稀疏的文本摘要。为了研究语义化表达是否构成瓶颈,我们推出了LLAMIA-Bench——一套包含六个多样化协作式国际象棋任务的测试套件,涵盖三个方面:行为模仿、状态评估和自然语言解释。每项任务都体现了一个经典的国际象棋问题,而大型语言模型或国际象棋引擎都无法单独解决。为解决大型语言模型与非语言智能体的协作问题,我们引入了潜在状态内化方法,该方法将子智能体的连续表示直接投射到大型语言模型的标记流中,作为学习的状态标记,并在环境状态随动作推进时进行动态重编码。通过对比内化与语义化整合方式,我们的实验揭示了一种持续存在的语义化债务:性能差距在训练过程中不断扩大,并且在大型语言模型规模从40亿参数扩展到140亿参数时依然存在。一个140亿参数的模型LLAMIA,通过潜在状态内化进行训练,在所有基准测试任务中达到或超越任务专家模型及前沿模型(包括具有工具访问权限的GPT-5.1),并且在特定任务微调失效的分布外场景中也能良好泛化。
查看arXiv页面 (https://arxiv.org/abs/2609.00474)查看PDF (https://arxiv.org/pdf/2609.00474)项目页面 (https://behavior-in-the-wild.github.io/llamia.html)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.00474)
在你的智能体中获取此论文:
hf papers read 2609\.00474
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用 arxiv.org/abs/2609.00474 以从本页面链接。
包含此论文的收藏集1
相似文章
探索语言与非语言代理之间的协作
本文介绍了 LLAMIA-Bench 和一种称为潜在状态内化的方法,以增强语言模型与非语言代理之间的协作,表明内化连续表示优于口头化,并与前沿模型如 GPT-5.1 相匹配。
SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展
SMAC-Talk 是一个新的基准测试,在星际争霸多智能体挑战的基础上进行扩展,旨在评估基于 LLM 的智能体在具有自然语言通信的协作多智能体环境中的表现。该基准包含带有欺骗性通信者的场景,并使用 Qwen3.5 系列模型对智能体进行基准测试,以研究推理能力、记忆机制和模型规模对协调效果的影响。
CollabBench:通过主动参与与多样玩家基准测试并释放LLM协作能力
CollabBench是一个新的基准测试,用于评估和训练LLM智能体在合作游戏中的表现,具有多样玩家模拟和协作训练范式。实验表明,与基础模型相比,效率提高19.5%,情感性能提升24.4%。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
网络上的大型语言模型:资源受限下的协作智能
本文探讨了分布式大型语言模型(LLMs)如何在设备和云端之间协同工作以应对资源限制的协作智能范式。文章涵盖了垂直方向的设备-云端协作、水平方向的多智能体协作、路由策略,以及在可扩展且可信的协作式人工智能方面的开放研究挑战。