双智能体LLM中继中的状态压缩:约束保持的封闭世界研究

arXiv cs.AI 论文

摘要

本文评估了双智能体LLM中继中用于旅行规划的交接压缩,比较了JSON提取和叙述摘要等方法,发现结构化表示能更好地保持约束。

arXiv:2607.18265v1 公告类型:新 摘要:长时间运行的大型语言模型(LLM)智能体通常会积累包含审计、淘汰和数值计算的大量中间痕迹。实际上,在将状态传递给下游决策步骤之前,会对状态进行压缩,从而产生信息瓶颈,其中微小的遗漏可能会破坏严格的数值或类别约束。本文评估了在由两个LLM智能体组成的封闭世界旅行规划中继中的交接压缩。一个研究人员针对50个目标实例审计固定的酒店和航班库存,而一个预定员仅使用目标和交接负载选择酒店-航班对,库存信息被隐藏。我们比较了四种交接条件:无压缩、叙述摘要、模式约束的JSON提取和基于嵌入的剪枝。对固定库存的穷举枚举提供了精确的可行和最优标签。结果表明,在小决策模型下,交接表示强烈影响下游可行性。JSON提取达到了最高的可行性准确率0.96,而叙述摘要虽然产生了最小的压缩交接负载,但将可行性降低至0.48。基于嵌入的剪枝在不额外进行生成压缩的情况下,可行性达到了0.88,与无压缩对照组持平。这些发现表明,约束检查受益于结构化和可审计的交接表示,而非仅仅依赖于简洁性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 双智能体大语言模型继电中的状态压缩:约束保持的封闭世界研究
来源:https://arxiv.org/html/2607.18265
Sheeba Elizabeth John https://orcid.org/0009-0003-8384-7521 Kaarthik Senthil Kumar https://orcid.org/0009-0007-1461-1231 Saratsuhas Vijayababu https://orcid.org/0009-0006-6682-7918 所有作者对本文贡献均等。

###### 摘要

长期运行的大语言模型(LLM)智能体通常会积累包含审计、排除和数值计算的庞大中间轨迹。实践中,在将状态传递给下游决策步骤之前,会对其进行压缩,这就形成了一个信息瓶颈,其中的微小遗漏可能会破坏严格的数值或分类约束。本文在封闭世界的旅行规划继电场景中,评估了两个LLM智能体之间的交接压缩。一个研究员智能体对固定库存中的酒店和航班进行审计(共50个目标实例),一个预订员智能体仅使用目标和交接负载(库存不提供)来选择酒店–航班对。我们比较了四种交接条件:不压缩、叙述性总结、模式约束的JSON提取以及基于嵌入的剪枝。通过对固定库存进行穷举枚举,我们得到了精确的可行解和最优解标签。结果表明,在小规模决策模型下,交接表示对下游可行性影响很大。JSON提取的可行性准确率最高,达0.96;而叙述性总结虽然产生的压缩交接负载最小,但可行性却降至0.48。基于嵌入的剪枝在可行性上与未压缩的对照组持平,达到0.88,且无需额外的生成式压缩调用。这些发现表明,约束检查受益于结构化且可审计的交接表示,而非单纯依赖简洁性。

## I. 引言

智能体系统的一种常见模式是,通过生成长段的中间工作记忆轨迹来解决多步骤任务[11,12],这些轨迹包括审计、排除、计算和推理过程。随着这些轨迹的增长,智能体系统面临着底层模型上下文窗口有限以及推理成本上升等实际约束。一种常见的工程响应是,在将智能体状态传递给下游决策组件之前进行压缩[3,5,1,2,3]。这种交接会形成信息瓶颈,因为压缩必须去除冗长内容,同时保留对决策至关重要的信息,特别是有效决策所需的严格数值和分类约束。微小的扭曲可能会产生重大的操作影响。预算的近似值或缺失的设施可能会导致下游选择从有效变为无效,或导致对账缺口。

本文使用封闭世界的旅行规划基准,研究单一、受控的交接瓶颈处的状态压缩。我们将状态压缩定义为:将上游轨迹转换为更小的表示,旨在保留对决策至关重要的约束。我们评估了一个两阶段继电协议。研究员智能体对固定库存中的每个选项进行穷举审计,明确检查每家酒店和每个航班是否满足目标的硬约束,并记录通过/未通过的证据,从而生成长轨迹[6]。预订员智能体仅接收原始目标和该轨迹的压缩形式,并选择一个旨在满足约束条件的酒店–航班对。

我们比较了四种交接条件:一个未压缩的对照组和三种压缩策略:叙述性总结[3]、模式约束的JSON提取以及基于嵌入的剪枝(利用嵌入空间中的余弦相似度过滤句子)。真实值通过对固定库存中所有酒店–航班对进行穷举枚举计算得出,即使在存在多个可行解的情况下也能进行客观评分。可行性准确率是主要结果指标,最优匹配准确率和最优性差距是次要任务指标,压缩比和每次运行的token数作为效率度量。嵌入空间相似度用作表示诊断工具。结果量化了压缩激进程度与下游可靠性之间的权衡,并识别出压缩保留候选提及但丢弃排除证据的失败模式,这可能导致无效选择。

## II. 方法

本研究评估了在两个LLM智能体之间受控交接处的智能体状态压缩。使用封闭世界的旅行规划基准,以便精确计算可行解。每次运行遵循固定的继电序列:上游研究员智能体对固定航班和酒店库存生成穷举审计轨迹,压缩层使用多种技术之一对该轨迹进行转换,下游预订员智能体仅使用目标和压缩后的交接负载做出最终预订决策。

### II-A. 封闭世界数据集与目标规范

构建了一个伦敦的封闭世界旅行规划数据集,包含固定库存:10家酒店和10个航班。每条酒店记录包括标识符、每晚价格(美元)、到市中心距离(公里)、星级评分以及一组有限的设施(以规范化令牌表示)。每条航班记录包括标识符、航空公司、起飞时间窗口、舱位等级和价格(美元)。其他航班属性如经停和可退款性作为干扰字段包含在内,不作为硬约束执行。所有价格均针对单人旅行者、一晚住宿定义,总行程成本计算为一张航班票加一晚酒店住宿之和。

评估集包含50个目标实例。每个目标指定一个旅行者角色和一组用于评分的硬约束:总预算上限、必选酒店设施、酒店到市中心的最大距离、首选起飞时间窗口以及要求的舱位等级。目标设计覆盖了不同的约束严格程度,包括接近失败的案例(可行性取决于微小的预算余量)。固定库存保持不变,目标则变化。这确保观察到的差异主要反映交接表示和压缩方法,而非底层世界状态的变化。

### II-B. 真实值生成

真实值通过封闭世界库存的穷举枚举确定性生成。对于每个目标实例,我们考虑库存中形成的酒店–航班对,并根据目标中定义的硬约束进行过滤,包括总预算、必选酒店设施、酒店最大距离、首选起飞窗口和要求的舱位等级。设施通过精确的令牌成员匹配。如果酒店和航班满足分类约束,且一晚酒店加一张航班的总成本不超过预算,则该对是可行的。设\(g\)表示一个目标实例,\(F_g\)表示在硬约束下\(g\)的所有可行酒店–航班对集合。如果\(F_g = \emptyset\),则该目标标记为不可满足,两个标识符的预期输出均为NONE。

除了可行集之外,还定义了一个最佳对以支持次要最优性分析。设\(t_g^* \in F_g\)表示在确定性排序下的排名最高的可行对。可行对按总行程成本最小、然后到市中心酒店距离最小、然后酒店星级评分的顺序排序,最后通过(酒店ID, 航班ID)的字典序进行最终平局决胜。记录所选排名最高的对\(t_g^*\)作为目标\(g\)的最优对,同时记录完整可行集\(F_g\)以支持存在多个可行解时的评估。此真实值生成过程作为独立脚本实现,与LLM智能体无关,确保跨运行的可重复标签。

### II-C. 双智能体继电协议

每次实验运行遵循固定双智能体继电协议,旨在隔离交接瓶颈。上游研究员智能体接收目标实例以及完整的封闭世界航班和酒店库存。其任务是生成一个长的、穷举审计轨迹,评估每家酒店和每个航班是否满足用于评分的硬约束,即总预算、必选设施、到市中心的最大距离、航班起飞窗口和舱位等级。研究员智能体被指示在严格的封闭世界规则下运行,仅使用提供的库存,避免任何外部假设。两个智能体均使用*GPT-4.1-nano*[7](一种小型模型配置),嵌入使用*text-embedding-3-small*[8]计算。图1总结了封闭世界的双智能体继电以及在交接瓶颈处评估的三种压缩变体。

然后,研究员轨迹通过一个压缩层,该层在评估的其中一种条件下生成转换后的交接负载。下游预订员智能体接收原始目标和仅压缩后的负载。封闭世界库存不提供给预订员智能体,因此预订决策完全取决于压缩步骤中幸存下来的信息。预订员智能体需要列举负载中明确有证据支持的候选酒店–航班组合,并使用与真实值生成器相同的确定性排序选择单个推荐:优先考虑总行程成本最小,然后酒店距离最小,然后酒店星级评分最高,仅使用稳定的标识符排序作为最终平局决胜。预订员智能体不允许引入上游负载中未出现的酒店或航班标识符。此限制遵循减少下游组件中无根据生成(幻觉)的更广泛目标[10]。

参见图注文本图1:在封闭世界双智能体继电(研究员智能体→压缩→预订员智能体)中评估交接压缩方法。包含一个无压缩对照条件,即完整的研究员轨迹原封不动地传递给预订员智能体。所有运行均使用确定性解码,温度设为0,每次运行使用固定种子。提示和响应模式在所有条件下保持不变。每次运行进行端到端记录,包括研究员输出、压缩负载和预订员决定,支持对压缩引起的信息丢失和下游约束违反进行可重复分析。

### II-D. 压缩条件

我们评估了四种交接条件。提示和上下文压缩已在先前工作中通过冗余剪枝和学习型压缩器得到探索[5,1,2,3],这激发了我们的剪枝方法。对照组不进行压缩,直接将完整的研究员轨迹传递给预订员智能体。然后对相同的研究员轨迹应用三种压缩方法。第一种方法生成一个不超过250字的叙事文本摘要。第二种方法执行模式约束的结构化提取,将轨迹转换为一个JSON对象,以规范化格式记录约束注册表、每个选项的评估和排除证据。先前关于结构化输出的约束解码工作激励了对生成结构化目标时强制输出有效性的需求[9]。第三种方法应用基于嵌入的剪枝,将研究员轨迹分割成句子,并根据句子嵌入与目标以及面向排除的查询之间的余弦相似度保留句子,同时明确保留标识符和判决句子以减少意外丢失决策关键证据。在开发过程中进行了小范围阈值扫描,选择余弦阈值0.75作为稳定性工作点用于主要研究。

压缩作为确定性中间件层实现,而非继电中的额外智能体。这避免了引入额外的决策者,其随机行为可能混淆误差归属。每次运行和条件记录压缩负载、token使用量(作为推理成本的代理)以及嵌入计算,生成的负载成为下游预订员智能体可用的唯一证据。

### II-E. 评估指标与日志记录

评估结合了任务级正确性、效率以及在交接处进行的表示级测量。可行性准确率作为主要结果指标。设\(t_g\)表示预订员智能体为目标\(g\)选择的结果。如果\(t_g \in F_g\),则运行得分正确。当\(F_g = \emptyset\)时,输出两个标识符均为NONE被视为正确。最优匹配准确率作为次要指标,定义为\(t_g = t_g^*\)。此外,在条件于可行选择(即\(t_g \in F_g\))的情况下计算最优性差距\(\Delta_g = C(t_g) - C(t_g^*)\),其中\(C(\cdot)\)表示从封闭世界库存计算的总行程成本(美元)。否则\(\Delta_g\)未定义。

压缩比定义为交接负载中的token数除以原始研究员轨迹中的token数。每次运行记录token使用量,包括研究员和预订员调用的token以及压缩方法所需的任何额外调用的token。表示漂移使用嵌入空间中的余弦相似度测量。使用*text-embedding-3-small*为目标文本、研究员轨迹以及每个压缩负载计算嵌入,并记录研究员轨迹与压缩负载之间、压缩负载与目标之间的相似度。这些相似度度量被用作表示偏移的代理,不保证数值阈值或分类约束的保留。

所有运行都记录完整的研究员轨迹、压缩负载、预订员输出、token使用量、用于计算\(\Delta_g\)的行程成本数量以及上述指标。日志还包括目标标识符和条件标签。这支持在相同目标集上跨压缩方法进行配对比较,并支持在单个约束级别进行故障模式分析。

## III. 结果

我们在伦敦封闭世界基准(N=50个目标)上对四种交接条件进行了实证比较。可行性准确率作为主要结果指标,最优匹配准确率和最优性差距作为次要任务指标。报告压缩比和token使用量以描述效率,并使用基于嵌入的相似度诊断来表征表示偏移。我们报告95% bootstrap置信区间(

相似文章