TREK:面向复杂行程规划的LLM智能体旅行推理与评估套件

arXiv cs.CL 论文

摘要

介绍TREK,一个用于评估LLM智能体在复杂旅行规划任务中表现的基准测试,采用确定性评分,涵盖基于合成知识库的800个多约束任务。该基准测试表明,即使是最强大的智能体也难以应对未明确表述的用户需求。

arXiv:2607.26977v1 公告类型:新 摘要:旅行规划是对使用工具的LLM智能体的一项严苛压力测试:一个可用的行程单是一件单一产物,必须在多个维度上同时保持正确——每一趟航班、酒店和景点都必须存在且可预订,每天在时空上必须可行,总花费必须控制在预算内,且计划必须服务于一个需求仅部分明确的旅行者。现有智能体基准测试一次只奖励其中某个属性,并使用软性评分或LLM评判标准对最终输出进行评分,这无法保证返回的计划是可执行的,而且既不具可复现性也不具可审计性。我们提出TREK(旅行推理与评估套件),这是一个用于可行行程综合的基准测试:生成一个单一计划,该计划同时满足约束条件、无幻觉、时空可执行、预算有效,并能回应用户未明确表述的个人需求。TREK包含800个多约束任务——其中533个可解,267个经证明因类型化的路线/实体/预算原因而不可解——基于一个合成且内部一致的知识库,该知识库涵盖375个城市和13种人物角色,包含212,530条记录,并通过一套生产风格的工具沙箱(经过验证的RESTful API)提供服务。每个任务均由完全确定性的、基于规则的评估器进行评分,不涉及任何LLM评判,并附带一个经人工验证的金标准参考,在同一评估器下得分为满分1.0,因此上限是可证明可达的,所有剩余差距是智能体的局限而非评分器的严格性问题。通过对15个LLM智能体在九个约束维度上的评估,我们发现即使是最强的智能体(GPT-5.6)也仅在46.2%的可解任务中生成完全可行的计划,中位数为6.6%,最低为0.0%;满足旅行者未明确表述的需求成为普遍瓶颈,即便在最前沿也尚未解决。我们将发布数据集、工具沙箱、确定性评估器和智能体代码,作为一个完全可复现的基准测试。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# TREK:面向复杂行程规划中LLM代理的旅行推理与评估工具包
来源:https://arxiv.org/html/2607.26977 \(2027\)
###### 摘要。旅行规划是对使用工具的LLM代理的一个严苛的压力测试:一个可用的行程表是一个单一产物,必须在多个维度上同时正确——每一趟航班、酒店和景点都必须存在且可预订,每一天在物理上必须可行,总花费必须控制在预算内,并且该计划必须服务于一位需求仅被部分陈述的旅行者。现有的代理基准测试一次只奖励这些属性中的一项,并用软性评分或LLM评判的标准来评分最终输出,这种评分无法证明返回的计划是可执行的,既不可复现也不可审计。我们引入了TREK(旅行推理与评估工具包),一个针对可行行程综合的基准测试:生成一个单一计划,该计划同时满足约束正确、无幻觉、时空可执行、预算有效,并且响应旅行者未陈述的个人需求。TREK包含800个多约束任务——其中533个可行,267个被证明不可行(带有路线/实体/预算类型的失败原因)——基于一个合成的、内部一致的知识库,该知识库包含212,530条记录,覆盖375个城市和13个角色,通过一个生产风格的、经过验证的RESTful API工具沙箱提供服务。每个任务都由一个完全确定性的、基于规则的评估器评分,不使用LLM评判,并且附带一个经过人工验证的黄金参考,该参考在同一个评估器下获得完美的1.0分,因此上限是可证明达到的,而每个剩余差距都是代理的局限性,而非评分器的严格性。通过对15个LLM代理在九个约束维度上进行评估,我们发现即使最强的(GPT-5.6)也仅能在46.2%的可解任务上生成一个完全可行的计划,中位数为6.6%,最低为0.0%;满足旅行者未陈述的需求成为普遍瓶颈,即使在前沿模型中也未解决。我们发布数据集、工具沙箱、确定性评估器和代理代码,作为一个完全可复现的基准。

¹11https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

旅行规划,工具使用,隐式需求,RESTful API,LLM代理

††版权:acmlicensed
††期刊年份:2027
††DOI:XXXXXXX.XXXXXXX
††会议:ACM SIGKDD知识发现与数据挖掘会议论文集;2027年8月;
††ISBN:978-1-4503-XXXX-X/2027/08
††CCS:计算方法学 → 多代理规划
††CCS:信息系统 → 信息检索

## 1. 引言

参见图注Figure 1.

图1. TREK中可行与不可行查询的示例。代理与生产风格的工具沙箱交互以构建旅行计划,由完全确定性、无LLM评判的评估器沿九个约束维度评分。

TREK的800个任务中,533个可行,267个被证明不可行。

大语言模型(LLM)代理正从聊天记录转向实际生产,在此过程中它们必须不仅仅是*提议*一个行动,而是*返回一个可执行的产物*(Yao et al., 2023 (https://arxiv.org/html/2607.26977#bib.bib7); Schick et al., 2023 (https://arxiv.org/html/2607.26977#bib.bib29); Qin et al., 2023 (https://arxiv.org/html/2607.26977#bib.bib22))。旅行规划是这一转变最严苛的压力测试。一个可部署的旅行计划是一个单一对象,必须在多个维度上同时正确:每一趟航班、酒店和景点都必须存在且可预订,每一天在物理上必须可行,总花费必须控制在预算内,并且整个计划必须服务于一位需求仅被部分表达的旅行者。对现代使用工具的代理来说,单独做好任何一个维度是常规任务;但同时*在所有维度上*都做好,并且体现在*一个*计划中,正是我们所要分离和衡量的能力——而当今的代理在很大程度上缺乏这种能力。我们将这种能力命名为**可行行程综合**:生成一个*单一*计划,该计划同时满足(a)针对显式请求的**约束正确**,(b)**无幻觉**(每个实体都能对应到知识库记录),(c)**时空可执行**(同一天内的行程在时间上物理可达),(d)**预算有效**,以及(e)响应旅行者的**未陈述**的个人需求——所有五个条件*同时成立,且体现在一个产物中*。

**测量缺口。** 先前的代理和工具基准测试一次只奖励这些属性中的一项,或者一次只奖励一次工具调用(Liu et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib26); Qin et al., 2023 (https://arxiv.org/html/2607.26977#bib.bib22)),并采用软性评分标准或LLM评判来评估最终输出。首先,没有软性评分或LLM评判的分数能够*证明*返回的计划是端到端可执行的;这样的分数既不可复现也不可审计,并且一个代理可以在返回一个旅行者无法遵循的计划的同时获得高分。其次,分别满足五个可行性属性并不能说明它们在*一个产物中同时*满足——而这正是部署所要求的。可行性是一个合取命题;测量它需要一个确定性地检查该合取的评分器。因此瓶颈在于测量本身:除非评分器是精确的且其上限是可达的,否则我们无法信任任何数字。

**TREK。** 我们引入了**TREK**(旅行推理与评估工具包),这是一个围绕*可信的联合可行性测量*构建的基准测试。代理在一个生产*风格*的工具沙箱内行动——该沙箱包含具有严格参数验证、语义搜索端点和结构化JSON错误的RESTful API——基于一个包含212,530条记录的知识库,涵盖375个城市中的航班、酒店、景点和租车,以及13个旅行者角色。数据是*合成的,且通过构造在结构上保持一致*——这不是妥协,而是因为内部一致性使我们能够计算精确的基准真实值并保证可达的上限,这是任何爬取的、漂移的语料库所无法保证的。我们并不声称数据是真实世界收集的;我们声称它是*受控的*,这一特性对于认证来说更强。两个可信属性构成了论文的主干。

(1)一个完全确定性的、基于规则的评估器,没有LLM评判。评分是比特可复现的,并且可以自由重新运行。即使是隐式需求的满足也是确定性的:*D1*评分器是每个角色所需设施与相应知识库设施字段的集合交集,而不是基于学习或嵌入的匹配。(代理可以*使用*语义搜索作为工具;但*评分*从不这样做。)

(2)一个可达的、经过人工验证的黄金参考。每个800个任务都附带一个黄金参考——一个可行的行程,或者对于不可行任务,是一个正确类型的拒绝——由15名标注员小组进行人工验证,在同一个评估器下获得1.0分。因此上限是*可证明可达的*:代理与1.0之间的任何差距都反映了代理(模型和固定框架)本身,而不是评分器的严格性。仅确定性本身并不新鲜;ChinaTravel(Shao et al., 2025a (https://arxiv.org/html/2607.26977#bib.bib3))也已经针对确定性DSL进行评分。TREK的新颖之处在于*组合*:一个确定性的无评判评估器,一个经人工验证且被证明能达到1.0的黄金参考,将不可行性作为一等标签进行类型化,以及一个生产风格的工具沙箱,所有这些被连接起来,以针对一个可证明可达的上限来认证*联合*可行性。800个任务分为533个可行和267个*被证明*不可行的实例(图1 (https://arxiv.org/html/2607.26977#S1.F1)),后者带有*类型化*的不可行性标签(路线、实体、预算),以便正确*拒绝*不可能请求是一种一等、可评分的行为。

**差距。** 我们的主要指标,**任务完美率**,是指代理在九个约束维度中*每一个适用的*维度上都解决的任务比例,仅在533个可解任务上报告。在15个LLM代理中,最强的(GPT-5.6)仅能在46.2%的可解任务上生成一个完全可行的计划;15个代理的*中位数*仅为6.6%,最低为0.0%。TREK的顶分因此是困难但仍在带内——而非被击穿(§2 (https://arxiv.org/html/2607.26977#S2)通过与τ-bench及相关的代理基准测试进行校准)——存在到一个*可证明*可达的1.0的上升空间,这正是我们研究的现象。

**研究问题与发现。** 我们围绕三个问题组织研究,并在相应部分回答每个问题:

- • **RQ1:前沿LLM代理能否综合出一个完全可行的行程?** *不能*——最高46.2%,中位数6.6%,最低0.0%。
- • **RQ2:可行的综合在何处失效?瓶颈如何随能力变化?** 隐式需求满足(D1)是*普遍瓶颈*:它是前沿模型仍然大规模失败的唯一维度,仅在46.3%的适用任务上通过,而其他每个维度至少通过86.7%——并且是15个代理中每一个的前两大失败项。瓶颈*随能力上升*:弱模型在每个维度上都失败,而前沿模型基本上只在这一维度上失败。时空可达性(B3,同日旅行时间的可行性)是*规划器/非规划器的分水岭*,从顶部的13.3%失败到底部的93.8%失败。只有城市*排序*随能力提升;任务级的多城市惩罚持续存在,因此多城市规划远未解决。
- • **RQ3:更多的思考或计算是否能带来更高的可行性?** *没有明显效果。*在我们集合中唯一的一对指令/推理变体中,推理变体*表现更差*——在严格的工具模式下面临思考与可控性之间的张力(这是一个跨版本的观察,并非完美的受控配对)。准确率也不随支出变化:GPT-5.6以顶分代理中最低的每查询令牌成本位居榜首,而几个弱模型花费5–7倍的令牌却只得到个位数的分数(令牌由提供商报告;挂钟时间只是使用成本的代理,不是干净的计算量)。

**贡献。**

1. (1)一个包含800个联合可行性旅行规划任务的数据集,基于一个212,530条记录的合成知识库(375个城市,13个角色),通过一个生产风格的工具沙箱提供服务,该沙箱包含经过验证的RESTful和语义搜索API,并带有结构化JSON错误。
2. (2)一个完全确定性的、无LLM评判的评估器,配以一个经人工验证的黄金参考,该参考在所有800个任务上被证明能获得1.0分,从而使得上限是比特可复现且可证明可达的,因此每个差距都可归因于代理。
3. (3)**任务完美**作为主要指标,涵盖九个约束维度,加上类型化的(路线/实体/预算)不可行性,作为通过267个可证明不可行任务的一等、可评分评估维度。
4. (4)一项涵盖15个模型的研究,确立了顶部/中位数/底部差距,以及三个发现:D1作为随能力上升的普遍瓶颈,B3作为规划器的分水岭,以及在我们能测试的唯一一对中推理没有帮助,而准确率不随成本变化。

## 2. 相关工作

### 2.1. 旅行规划基准测试

旅行规划是对长周期、使用工具的代理的一个流行压力测试:一个可用的行程必须同时满足许多异构约束。TravelPlanner(Xie et al., 2024a (https://arxiv.org/html/2607.26977#bib.bib1))是最直接的先驱——代理查询六个旅行数据库并输出一个多日计划,在环境、常理和硬约束下——其两阶段GPT-4-Turbo代理仅达到0.6%的最终通过率。但其自由形式的输出首先由GPT-4-Turbo*结构化*,然后进行脚本检查,因此评分并非免解析,并且它既不评估隐式偏好,也不评估类型化的不可行性。ChinaTravel(Shao et al., 2025a (https://arxiv.org/html/2607.26977#bib.bib3))将设置扩展到真实的中文多日请求,并通过一个*可执行的组合DSL*(一个确定性的符号评估器)验证计划,其最强代理是神经符号的。作为我们最接近的确定性相关基准,它是TREK所*超越*的:它不提供*被证明*能达到最大值的黄金参考,不提供*类型化*的不可行性,不提供生产风格的API沙箱,也不提供*可评分*的效率轴。NATURAL PLAN(Zheng et al., 2024 (https://arxiv.org/html/2607.26977#bib.bib2))通过精确匹配对旅行、会议和日历规划进行评分,但将工具输出直接放在上下文中,而非交互式沙箱,并且所有模型在十城市旅行规划中均低于5%。如今拥挤的领域反而凸显了我们的定位;几个最近的成果共享我们的名称或范围,必须加以区分。

在同期进行的ACL 2026*TravelBench*(Cheng et al., 2026a (https://arxiv.org/html/2607.26977#bib.bib120))在名称和领域上最为接近,但*近乎正交*:它在真实的高德地图日志上使用*LLM评分标准和元评判*来评估多轮*对话*质量,用描述性的交互边界类别(缺失信息/工具/意图)标记不可行性。TREK则确定性地认证一个*单一可执行计划*——无LLM评判——配以一个被证明能达到1.0的黄金参考,带有*类型化*的路线/实体/预算不可行性和*基于规则*的隐式需求评分。KDD 2026*TravelEval*(Chen et al., 2026b (https://arxiv.org/html/2607.26977#bib.bib123))是一个基于模拟的全局计划评估器,涵盖多个旅行质量维度,但其评分既不是比特可复现的,也未配以可证明最大的黄金参考,并且它既不对不可行性*分类*,也不暴露经过验证的工具沙箱;此外还有一项无关工作也使用了*TravelBench*名称(Billa and Jing, 2025 (https://arxiv.org/html/2607.26977#bib.bib121))。

一股平行的浪潮研究互补的轴——时空一致性和个性化(Chaudhuri et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib124); Wang et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib125); Ni et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib126); Zhao et al., 2025a (https://arxiv.org/html/2607.26977#bib.bib122))、隐式或受角色条件约束的偏好(Deng et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib127); Shao et al., 2025b (https://arxiv.org/html/2607.26977#bib.bib129); Chen et al., 2026a (https://arxiv.org/html/2607.26977#bib.bib143); Cheng et al., 2026b (https://arxiv.org/html/2607.26977#bib.bib140))、模拟评分的全局计划动态(Yang et al., 2025 (https://arxiv.org/html/2607.26977#bib.bib136))以及中断驱动的重新规划(Karmakar et al., 2026 (https://arxiv.org/html/2607.26977#bib.bib139))。据我们所知,之前没有任何旅行基准测试——包括ChinaTravel、TravelEval、TravelBench以及这股平行浪潮——能够将完全确定性的、无LLM评判的评估器与*经人工验证且被证明能达到最大值的黄金参考*、*类型化*的路线/实体/预算不可行性以及一个明确的效率轴结合在一个单一的、联合可行的行程上(表1 (https://arxiv.org/html/2607.26977#S2.T1))。

表1. TREK与代表性规划和代理基准测试的对比。
评分方式:基于规则(*规则*,无LLM评判)、LLM结构化再规则(*提取+规则*)、可执行*DSL*、模拟(*模拟*)、执行(*执行*)、精确*匹配*或LLM*评判*(DSL/模拟也是无评判的;TREK的区别在于*组合*,而非仅确定性)。
API:代理通过一个带验证参数和结构化错误的类型化工具沙箱行动(相对于自由形式的函数调用或浏览器操作)。
黄金参考==1:一个参考解决方案在每项任务上被证明达到评估器的最大值(−-:提供但未证明最大;✗:无)。
隐式偏好:是否评分*未陈述*的偏好以及*方式*——*确定性*(例如设施集交集)、*评判*(LLM评分标准)或−-(未单独说明)。
不可行性:*类型化*(路线/实体/预算证明)对比*未类型化*对比✗。
效率:是否对明确的工具使用效率/成本指标进行评分。据我们所知,只有TREK结合了单一计划输出、纯规则评分、类型化API沙箱和已验证的

相似文章

评估智能体非常困难

Reddit r/AI_Agents

本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

三思而后行:LLM 智能体的自主探索

Hugging Face Daily Papers

本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。