TRACE:基于业务规则的推理课程,用于企业级大语言模型中知识保持的参数化工具检索

Hugging Face Daily Papers 论文

摘要

TRACE 引入了一种两阶段课程,用于在企业级大语言模型中保持参数化工具知识,同时实现快速的单束贪婪解码,相比基线提高了准确率和召回率。

参数化检索通过为每个API分配一个唯一的虚拟标记,并训练模型通过约束束搜索生成该标记,来使大语言模型能够隐式地检索工具。Toolsense 表明,这种机制有两个关键缺陷:它在训练过程中破坏了参数化工具知识,并且其束搜索解码对于实时部署来说太慢。我们引入了 TRACE(通过增强思维链和企业规则进行工具检索),这是一种解决这种分离的两阶段课程。第一阶段重用来自 ToolSense 的多格式记忆 SFT,通过 LoRA 来播种工具知识。第二阶段是我们的核心贡献:模型被训练在生成工具标记的 JSON 列表之前发出思考轨迹,使用两个数据源——来自 ToolSense 的 RRB 对以及针对领域专家整理的业务规则合成的查询——两者都通过推理轨迹进行增强。这个训练目标保留了第一阶段的 MCQ 和 QA 探测准确率,同时实现了生产延迟下的单束贪婪解码。在两个企业产品线的 8300 多个工具组合企业目录上评估,TRACE 的第二阶段训练不仅保持而且提高了工具理解:与第一阶段相比,MCQ 准确率提高了 3.2 个百分点,QA 探测提高了 9 个百分点。在检索方面,TRACE 在领域 A 上实现了约 86% 的召回率,在领域 B 上实现了约 60% 的召回率——而嵌入基线性能分别约为 27% 和 52%——两者均采用单束贪婪解码,使其可直接以生产延迟部署。
查看原文
查看缓存全文

缓存时间: 2026/07/28 14:25

论文页面 - TRACE:面向企业LLM知识保留的参数化工具检索的业务规则推理课程

来源:https://huggingface.co/papers/2607.22639

摘要

参数化检索通过为每个API分配一个唯一的虚拟令牌,并训练模型通过约束束搜索生成该令牌,使LLM能够隐式检索工具。ToolSense研究表明,该方案存在两个关键缺陷:训练过程中会破坏参数化工具知识,且其束搜索解码方式对实时部署而言过于缓慢。我们提出TRACE(基于增强思维链与企业规则的工具检索)——一种解决上述脱节问题的两阶段课程方案。阶段1复用ToolSense的多格式记忆SFT,通过LoRA注入工具知识。阶段2是我们的核心贡献:模型经过训练,在生成JSON格式的工具令牌列表之前,先输出思考轨迹;训练数据源自两类数据源——ToolSense中的RRB对以及针对领域专家整理的面向业务规则合成的查询——两者均附有推理轨迹增强。该训练目标在保留阶段1多选题与问答探测精度的同时,支持单束贪婪解码,满足生产环境延迟要求。在涵盖两个企业产品线、总计8300余个工具的企业目录上评估,TRACE阶段2训练不仅保留而且提升了工具理解能力:多选题精度较阶段1提升3.2个百分点,问答探测提升9个百分点。在检索方面,TRACE在领域A上实现约86%的召回率,在领域B上约60%——而基于嵌入的基线性能分别约为27%与52%——两者均采用单束贪婪解码,使其可直接部署至生产延迟要求下。

查看arXiv页面 (https://arxiv.org/abs/2607.22639)查看PDF (https://arxiv.org/pdf/2607.22639)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22639)

在您的agent中获取此论文:

hf papers read 2607.22639

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接至此论文

在模型README.md中引用 arxiv.org/abs/2607.22639 即可从此页面链接。

引用此论文的数据集0

暂无数据集链接至此论文

在数据集README.md中引用 arxiv.org/abs/2607.22639 即可从此页面链接。

引用此论文的Spaces0

暂无Space链接至此论文

在Space README.md中引用 arxiv.org/abs/2607.22639 即可从此页面链接。

包含此论文的收藏0

暂无收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。

基于外部子图生成的大语言模型逐步推理增强

arXiv cs.CL

本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。