演示TOFFEE:一个大规模合成数据代理轨迹的学习系统
摘要
TOFFEE是一个系统,它采用带有自适应模型选择和跨任务前缀重用的蒙特卡洛树搜索(Monte Carlo Tree Search),大规模合成高质量的数据代理轨迹。这些轨迹可用于微调或上下文学习,以提升数据代理在异构企业环境中的性能。
arXiv:2607.06233v1 Announce Type: new
摘要:由大型语言模型(LLM)驱动的数据代理在数据驱动的决策中扮演着越来越重要的角色。然而,现有的数据代理难以泛化到未见过的数据环境和分析工作流,尤其是在异构企业环境中。这导致了对合成高质量数据代理轨迹的日益增长的需求,这些轨迹能够捕获给定数据环境中的复杂分析工作流。此类轨迹支持两个关键的后续用途:它们可以作为监督微调(SFT)数据,使数据代理模型适应目标领域;也可以作为上下文学习(ICL)演示,指导通用LLM在陌生数据环境中工作。因此,我们引入了TOFFEE,一个通过蒙特卡洛树搜索(MCTS)结合自适应模型选择和跨任务前缀重用来从给定数据环境合成高质量数据代理轨迹的系统。我们展示了TOFFEE能够有效生成跨异构环境的复杂分析任务的可扩展轨迹数据。在此演示中,我们介绍了TOFFEE的系统框架,包括其任务池构建、轨迹探索器和学习成本模型。我们还介绍了TOFFEE的Web界面及其工作流,并演示了两个端到端场景:用于数据代理微调的轨迹合成,以及演示增强的数据代理推理。
查看缓存全文
缓存时间: 2026/07/08 04:39
# 一种用于大规模合成数据智能体轨迹的学习系统 来源:https://arxiv.org/html/2607.06233 ###### 摘要 基于LLM的数据智能体在数据驱动决策中正扮演着越来越重要的角色。然而,现有的数据智能体难以泛化到未见过的数据环境与分析工作流,尤其是在异构的企业环境中。这产生了对合成高质量数据智能体轨迹的日益增长的需求,这些轨迹能够捕获给定数据环境下复杂的分析工作流。此类轨迹支持两个关键的的下游用途:它们可以作为监督微调(SFT)数据,将数据智能体模型适配到目标领域;也可以作为上下文学习(ICL)演示,指导通用LLM应对不熟悉的数据环境。因此,我们引入了TOFFEE,一个通过蒙特卡洛树搜索(MCTS)结合自适应模型选择与跨任务前缀复用,从给定数据环境合成高质量数据智能体轨迹的系统。我们展示了TOFFEE能够有效地为跨异构环境的复杂分析任务生成可扩展的轨迹数据。在此演示中,我们介绍了TOFFEE的系统框架,包括其任务池构建、轨迹探索器和学习成本模型。我们还介绍了TOFFEE的网页界面及其工作流,并演示了两个端到端场景:用于数据智能体微调的轨迹合成,以及增强演示的数据智能体推理。 PVLDB引用格式:PVLDB, 19(12): XXX-XXX, 2026. doi:XX.XX/XXX.XX (https://doi.org/XX.XX/XXX.XX)††本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可。访问https://creativecommons.org/licenses/by-nc-nd/4.0/查看该许可协议的副本。对于超出本许可协议范围的任何使用,请通过邮件[email protected] (https://arxiv.org/html/2607.06233v1/mailto:[email protected])获取许可。版权归所有者/作者所有。出版权授予VLDB基金会。VLDB基金会会议录,第19卷,第12期,ISSN 2150-8097。doi:XX.XX/XXX.XX (https://doi.org/XX.XX/XXX.XX) PVLDB工件可用性:源代码、数据和/或其他工件已在https://github.com/wang0702/toffee上提供。 ## 1. 引言 通过将推理与工具执行(例如,SQL、Python)交错进行的数据分析智能体,在数据驱动决策中正受到越来越多的关注 (Jing et al., 2025 (https://arxiv.org/html/2607.06233#bib.bib2); Lai et al., 2026 (https://arxiv.org/html/2607.06233#bib.bib3))。相应地,主流的数据湖和数据仓库平台开始集成此类能力,例如,Databricks Genie、Snowflake Cortex Analyst和BigQuery数据智能体。然而,现有的数据智能体难以泛化到未见过的数据环境与分析工作流 (Jing et al., 2025 (https://arxiv.org/html/2607.06233#bib.bib2)),尤其是在异构的企业环境中。为给定数据环境合成高质量的数据智能体轨迹,即推理、工具调用及执行结果的多步序列,可以弥合这一差距。图1 (https://arxiv.org/html/2607.06233#S1.F1) 说明了这一点。  图1. 数据智能体轨迹合成。上方:没有轨迹,智能体会产生SQL错误和模糊的结论。中间:合成的轨迹。下方:通过SFT或ICL进行轨迹增强的智能体。第一行显示了没有轨迹操作的数据智能体:它反复产生SQL错误并返回模糊的结论。中间行显示了通过在实际数据环境中运行智能体操作生成的合成轨迹。当用于SFT或ICL(如下方行所示)时,这些轨迹帮助同一个智能体避免错误并产生具体证据(例如,Q3营收同比下降12%,Pearson r=0.85)。然而,大规模获取此类轨迹仍然困难 (Li et al., 2025 (https://arxiv.org/html/2607.06233#bib.bib4); Lin et al., 2025 (https://arxiv.org/html/2607.06233#bib.bib5))。单次生成在任一步骤失败时会丢弃所有进展,而最佳N样本采样则在独立的尝试之间引入了冗余计算。构建这样一个系统面临以下挑战。  图2. TOFFEE系统概览:任务池构建(左)、轨迹探索器(中),以及用于SFT或演示ICL的数据智能体轨迹导出(右)。 **挑战。** 首先,数据智能体轨迹合成需要大量多样化的分析任务,例如,“按区域计算季度收入”或“关联营销支出与线索转化率”,每个任务都基于目标数据环境中的表和文件。提示LLM从模式生成任务通常会产生琐碎或无法解决的问题,而手动整理任务则无法扩展。第一个挑战是*如何从用户指定的数据环境中自动构建现实、可解决的任务*(C1)。其次,合成数据智能体轨迹本质上是复杂的:每一步都需要一个完整的LLM推理和工具执行循环,并且可以从由不同LLM生成的工具操作(例如,SQL查询、Python脚本或模式发现)中进行选择,因此可能的轨迹数量随步数呈指数增长。第二个挑战是*如何在如此巨大的搜索空间中合成高质量的轨迹*(C2)。第三,每个合成步骤都需要选择推理配置:调用哪个LLM,提供多少先验步骤作为提示上下文,以及是否启用LLM的扩展思考。例如,较小的模型可以列出表并读取列名,但在需要编写多表连接查询的步骤上会失败;较大的模型能正确处理连接,但在此类常规步骤上浪费预算。第三个挑战是*如何根据步骤的难度在每一步选择正确的推理配置*(C3)。 **我们的方法。** 为了解决这些挑战,我们引入了TOFFEE,一个预算感知的轨迹合成系统。首先,为了自动构建大量分析任务,我们设计了一个*任务池构建*流程。它通过轻量级脚本发现数据环境中的依赖关系,然后将每个依赖反向转化为一个多步分析任务,并验证每个任务既可解决又有意义(解决C1)。其次,对于一个任务,为了在轨迹合成的庞大搜索空间中高效导航,我们设计了一个*轨迹探索器*。它实现了基于MCTS的搜索,其中每个候选步骤都针对数据环境执行,自然捕获了多样的执行路径(例如,错误恢复)(解决C2)。第三,为了根据步骤的难度选择正确的推理配置(例如,调用哪个LLM),我们设计了一个*学习成本模型*(LCM)。LCM观察执行奖励,并通过在线奖励学习学习状态相关的策略,使其能够区分常规步骤和复杂的分析步骤,无需手动调整(解决C3)。 初步结果支持了这种设计。在相同的每任务预算下,TOFFEE合成出比单次生成和最佳N样本采样更高质量的轨迹。在TOFFEE合成轨迹上微调的模型,在KramaBench和DSBench上超越了OpenAI o3等前沿推理模型(第3节 (https://arxiv.org/html/2607.06233#S3))。 在此演示中,TOFFEE的交互式网页界面让用户可以连接异构数据环境,通过实时搜索树可视化合成轨迹,并导出结果用于SFT和ICL。我们展示了两个端到端场景。 ## 2. TOFFEE概述 TOFFEE的架构如图2 (https://arxiv.org/html/2607.06233#S1.F2) 所示。TOFFEE接收一个数据环境E作为输入,它可能包含数据库、文件以及可通过沙箱代码访问的资源。它分三个阶段生成数据智能体轨迹:任务池构建(左)、轨迹探索(中),以及导出用于SFT或ICL(右)。 **任务池构建。** 只有当任务真实、可解决且与数据环境相关联时,数据智能体轨迹搜索才有用。一种简单的方法是直接将模式提示给LLM,但由于该方法对数据库的上下文有限,通常会产生琐碎或无法解决的问题。为了解决这个问题,TOFFEE在搜索之前构建一个数据智能体任务池,将每个任务锚定在数据环境本身。如图2 (https://arxiv.org/html/2607.06233#S1.F2) 左侧所示,TOFFEE从给定的数据环境构建任务。该环境由用户连接,或从现有基准测试(如Spider、LiveSQLBench和SpreadsheetBench)中采样。它首先对环境进行概要分析以收集模式元数据和示例行,然后运行预定义的SQL模板来发现数据依赖关系,例如链接多个表的共享客户ID,或在不同地区差异显著的订单取消率,最后提示LLM将每个发现的依赖关系表述为数据智能体需要回答的有意义的问题。每个依赖关系在其问题被编写之前执行,最终结果记录为任务的答案键。TOFFEE随后验证每个候选任务:它像智能体一样重放解决步骤,重新运行每个查询以确认结果稳定,并拒绝LLM无需访问数据即可回答的问题。它只接受具有确定性答案和经过验证的执行证据的任务,确保与下游基准测试严格隔离,防止评估污染。 **轨迹探索器。** *轨迹探索器*通过树搜索为每个任务合成轨迹:搜索树中的每个节点是一个分析状态,每条边是一个工具调用,例如运行SQL查询或Python脚本,由特定的LLM配置生成。探索器不局限于单一路径,而是扩展多个分支并保留最有希望的分支。搜索从跨同一数据环境中的任务共享的前缀开始,因此模式发现和数据概要分析等常见操作只运行一次。在每次扩展时,探索器调用接下来描述的LCM,以在剩余预算下选择分支宽度和推理配置。当某一步遇到执行错误时,探索器不会丢弃部分轨迹;它会分支进入修复路径,由此产生的错误-诊断-修复序列被保留作为训练数据,教导下游智能体从现实错误中恢复。一旦确定性验证器确认其执行输出重现了任务构建时记录的证据,并且其最终答案与经过执行验证的答案键匹配,轨迹就被存储。 **学习成本模型。** *学习成本模型*(LCM)是探索器的预算感知控制器,它根据当前分析状态和剩余每任务API预算,选择每次扩展的LLM和推理配置。例如,它将常规的模式发现路由到小而快的模型,同时将复杂的多表推理升级到能力更强的模型。如图2 (https://arxiv.org/html/2607.06233#S1.F2) 底部所示,每次扩展时,LCM提取一个状态特征向量,编码轨迹进度、模式覆盖率和最近的错误历史,然后通过结合预测奖励μ与探索不充分配置的探索奖励σ,对每个可行的配置(包括操作符、模型、上下文长度和推理努力程度)进行评分。它根据排名靠前的配置之间的分歧设置分支宽度K,随着预算缩减而收窄K。探索器和LCM形成一个闭环反馈:每步之后,系统根据执行成功和分析进展计算奖励,并通过岭回归更新LCM的赌臂参数,从而随时间改进其路由和分支决策。 **轨迹导出与下游使用。** 如图2 (https://arxiv.org/html/2607.06233#S1.F2) 右侧所示,每条轨迹是一个(状态、工具调用、观察结果)元组的序列,以两种模式导出。对于*SFT*,轨迹成为多轮训练样本,教导智能体模型完整的分析工作流,从而产生像TOFFEE-9B和TOFFEE-27B这样的模型。对于*ICL演示*,最高质量的轨迹作为示例:当用户提出问题时,系统检索一条类似的轨迹放入LLM提示中,使模型在不熟悉的环境中遵循演示的工作流。 ## 3. 初步实验结果 我们在一个配备双AMD EPYC 9555 CPU和8块NVIDIA H100 GPU的Ubuntu服务器上进行实验。合成工作节点通过OpenRouter使用API调用LLM。轨迹质量按0到1的评分尺度进行评估,评分依据执行信号(例如,步骤成功率、分析进展)以及对最终答案与每个任务经过执行验证的答案键的确定性检查。最佳N样本使用N=5;图3(b) (https://arxiv.org/html/2607.06233#S3.F3.sf2) 中的所有方法共享相同的智能体提示和工具访问权限。下游评估使用KramaBench (Lai et al., 2026 (https://arxiv.org/html/2607.06233#bib.bib3)) 和DSBench (Jing et al., 2025 (https://arxiv.org/html/2607.06233#bib.bib2)),TOFFEE-9B和TOFFEE-27B从Qwen3.5-9B和Qwen3.5-27B微调而来。  (a) 轨迹质量 vs. 预算。  (b) 下游得分。 图3. 关于合成效率和下游有效性的初步结果。 图3(a) (https://arxiv.org/html/2607.06233#S3.F3.sf1) 比较了在不同每任务预算下的轨迹质量。单次生成一旦预算覆盖一次完整尝试后就停滞不前。最佳N样本随着预算增加而改善,但收益递减,因为每次独立尝试都从头开始重复工作。无LCM的TOFFEE通过MCTS探索表现优于它们,但受到每一步均匀配置的限制。TOFFEE始终优于所有基线,以更低的成本收敛到高质量,这证实了通过LCM进行自适应每步模型选择的价值。图3(b) (https://arxiv.org/html/2607.06233#S3.F3.sf2) 显示了应用于Qwen3.5-27B的TOFFEE轨迹的下游有效性,并与作为前沿参考的OpenAI o3进行比较。使用TOFFEE合成轨迹作为ICL演示已经比零样本基线有所改进。在TOFFEE轨迹上微调(TOFFEE-27B)进一步放大了收益,在两个基准测试上都超越了OpenAI o3等前沿推理模型。 ![[无标题图像]](https://arxiv.org/html/2607.06233v1/figures/image1.png) 图4. TOFFEE的合成模式。 ![[无标题图像]](https://arxiv.org/html/2607.06233v1/figures/image2.png) 图5. TOFFEE的推理模式。 ## 4. 演示场景 该演示包含一个用于轨迹生产的*合成*模式(图4 (https://arxiv.org/html/2607.06233#S3.F4))和一个用于增强演示的数据智能体推理的*推理*模式(图5 (https://arxiv.org/html/2607.06233#S3.F5))。 ### 4.1. 端到端体验 图4 (https://arxiv.org/html/2607.06233#S3.F4) 展示了TOFFEE的合成模式。用户按照以下四个步骤执行轨迹合成。 **步骤1:环境设置。** 用户连接一个包含异构数据源(如数据库、CSV文件、JSON和Markdown文档)的数据环境。图4 (https://arxiv.org/html/2607.06233#S3.F4) 左上角的*数据环境*面板随后列出其表名、行数和模式。 **步骤2:合成**
相似文章
RODS:面向多轮工具使用智能体的奖励驱动在线数据合成方法
本文介绍了RODS,一种奖励驱动的在线数据合成方法,该方法解决了多轮工具使用智能体训练中静态数据集信息样本耗尽的问题。它在显著减少轨迹数量的情况下,达到了与更大规模离线流水线相当的性能。
一种基于观测上下文压缩的高效终端智能体自我演化框架
TACO 提出了一种自我演化压缩框架,可自动学习压缩冗余的终端交互历史,在 TerminalBench 及其他代码智能体基准上将 token 开销降低约 10%,准确率提升 1–4%。
TMAS:通过多智能体协同扩展测试时计算
TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。
Tree-of-Experience:一种在低重复性和隐式奖励环境下用于自进化智能体的结构化经验管理方案
本文介绍了FinEvolveBench(一个用于金融情感预测的基准测试)和Tree-of-Experience(ToE,一种针对低重复性任务和隐式奖励的LLM智能体的结构化经验管理方法)。实验表明,在此类挑战性场景中,ToE优于通用经验机制。
构建智能体轨迹数据集的实用指南
一份构建结构化智能体轨迹数据集的实用指南,用于训练使用工具的智能体,强调设计包含六个关键部分的轨迹的重要性,并将轨迹视为数据资产而非日志。