市场目录的自动研究:从遗留表单到AI原生匹配

arXiv cs.AI 论文

摘要

本文提出一个自动研究循环,用于在服务市场中生成服务提供者偏好分类法,利用大语言模型从遗留表单过渡到AI原生匹配,并展示了来自一个主要U.S.市场的部署结果。

arXiv:2609.00274v1 Announce Type: new 摘要:双向服务市场正从确定性的请求表单接收转向AI原生的概率匹配,这得益于大语言模型(LLMs)能够从自然语言中推断意图、偏好和潜在约束。依赖推断的意图而非固定表单字段,迫使这些平台重新生成支持匹配、搜索和定价的服务提供者端偏好分类法:这些属性对服务提供者可解释,同时对市场决策保持有用信号。我们提出一个自动研究循环,逐个职业生成这种分类法,自2026年4月以来已在一个主要U.S.消费者服务市场中投入生产,涵盖132个职业。该循环不是使用一个全局层次结构,而是将每个职业视为一个独立的生成问题,并运行迭代的提议-评估-保留优化循环。每个候选标签集由一个重新校准的六标准LLM作为评判者的框架评分,并且一个由不同人格组成的七批评家小组对调整后的分数贡献加权惩罚,没有硬性否决。一个单独的奇偶映射阶段将遗留请求表单的问答对映射回生成的分类法,产生覆盖信号和人工质量保证接口;它通过首先推断每个遗留问题旨在测量的服务提供者属性来实现这一点,而不是将问题字面翻译为标签。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:00

# 面向市场目录的自研究:从遗留表单到AI原生匹配
来源:https://arxiv.org/html/2609.00274
## 面向市场目录的自研究:从遗留表单到AI原生匹配

**注:** 本文已被KDD 2026智能体AI评估与可信度研讨会接收。

**会议:** KDD 2026智能体AI评估与可信度研讨会;2026年8月;韩国济州岛

Hojat Abdolanezhad 电子邮件:[[email protected]](mailto:[email protected]) 所属机构:Thumbtack,美国加利福尼亚州旧金山  
Daniel Capo 电子邮件:[[email protected]](mailto:[email protected]) 所属机构:Thumbtack,美国加利福尼亚州旧金山  
Sang Su Lee 电子邮件:[[email protected]](mailto:[email protected]) 所属机构:Thumbtack,美国加利福尼亚州旧金山  
Shishir Dash 电子邮件:[[email protected]](mailto:[email protected]) 所属机构:Thumbtack,美国加利福尼亚州旧金山  
Vijay Anand Raghavan 电子邮件:[[email protected]](mailto:[email protected]) 所属机构:Thumbtack,美国加利福尼亚州旧金山

© 无

###### 摘要

匹配消费者与服务提供者的双边服务市场正从确定性的请求表单录入方式,转向由大型语言模型最新进展赋能的AI原生概率匹配系统。这些模型能够从自然语言指令中推断用户意图、上下文偏好和潜在约束。随着市场越来越依赖推断的意图而非固定表单字段,这些平台必须重新生成支撑匹配、搜索和定价的供应商侧偏好分类体系:一套对服务提供者而言可解释、同时作为市场决策有效信号的供应商属性和偏好集。我们提出了一种自研究循环,按职业逐个生成此分类体系。该系统自2026年4月起已在一个主要的美国消费者服务市场投入生产,覆盖132个职业。该循环不构建单一的全局层级结构,而是将每个职业视为独立的生成问题,运行迭代的提议-评估-保留改进循环。每个候选标签集使用一个重新校准的六标准LLM评判者框架进行评分,最高产生15分的综合分数。一个由7个具有不同人设的评论者组成的评审团,通过加权惩罚贡献于调整分数,不设硬性否决权。一个单独的基于LLM的对等映射阶段,将遗留的请求表单问答对映射回生成的分类体系,既产生覆盖度信号,也提供一个可扩展的人工质量保证接口。该循环迁移遗留的结构化问答时,首先推断每个问题旨在衡量的底层供应商属性,而非进行字面意义的问答到标签翻译。与以往的自主分类生成系统不同,我们的方法(i)将每个职业的偏好标签目录(而非职业层级)作为优化单元,(ii)并行独立生成每个职业的标签,(iii)使用基于市场的评论者(通过加权惩罚贡献于调整分数,不设硬性否决权)进行评估,并(iv)将遗留问答到现代标签的迁移视为一个独立的流水线组件,而非下游的副作用。我们报告了上线后14天生产群体(1,840名注册专业人士,930万次过滤评估)的部署结果,该结果揭示了一个具体的目录清洁度差距,而全局构建方法本会掩盖此问题。

###### 关键词:

LLM自研究,分类生成,市场目录,多评论者评估,LLM评判者,已部署系统

## 1\.引言

市场目录提供了共享的表示方式,通过它解释消费者请求、供应商偏好和工作属性。匹配、搜索和定价都依赖于这种通用语言。然而,在历史上依赖结构化问答表单的服务市场中,目录通常是隐式的,分布在数百个特定类别的架构中,而非呈现为统一结构。当市场过渡到AI原生概率匹配(图1 (https://arxiv.org/html/2609.00274#S1.F1))时,这种隐式目录就成了一个负担。匹配模型需要结构化信号,定价模型需要跨类别可转移的工作属性,而市场参与者需要一个一致的接口来表达偏好,而无需浏览数百个独立的架构。

我们将此问题定义为目录*重构*,而非*创建*,因为目录已通过问答对隐式定义在遗留系统中,尽管是分布式的。任务是推断跨问答对编码的潜在属性,并将其重组为适合AI原生市场交互的显式表示。由于隐式的遗留目录围绕不同的服务领域组织,每个领域都有自己的词汇表、偏好结构和匹配语义,我们将目录重构分解为一系列更小的*自研究*问题(Karpathy, 2026 (https://arxiv.org/html/2609.00274#bib.bib9)),而不是一个单一的全局分类生成任务。这种设计不同于近期的层次分类生成系统,后者优化连贯的职业层次结构(Li et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib10))或语料库级研究分类(Kargupta et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib8))。我们的目标不是在所有领域之上构建单一层次结构,而是重构在双边市场的每个服务领域内语义仍然有意义的偏好目录。

参考标题(a)遗留问答匹配  
参考标题(b)AI原生匹配

图 1\. 从遗留请求表单匹配到AI原生匹配的演进:遗留匹配(1(a) (https://arxiv.org/html/2609.00274#S1.F1.sf1))依赖于嵌入在职业特定问答表单中的隐式目录。AI原生匹配(1(b) (https://arxiv.org/html/2609.00274#S1.F1.sf2))需要一个显式目录,将消费者意图和供应商偏好转化为供下游市场系统使用的共享表示。

本文的主要贡献如下:

1. \(1\) **面向市场的目录** – 我们研究一个区别于职业层次构建(Li et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib10))、文本标签分类归纳(Wan et al., 2024 (https://arxiv.org/html/2609.00274#bib.bib13))、研究语料库分类适应(Kargupta et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib8))和产品架构建模(Huang et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib6))的目录重构问题。生成的单元是一个面向供应商的*偏好标签*:供应商在生产环境中切换的一个原语,也是下游市场系统使用的信号。
2. \(2\) **独立的自研究循环** – 我们将重构分解为独立的自研究任务,每个服务职业一个,各自拥有自己的*提议-评估-保留*循环。这避免了将所有服务领域强行纳入单一全局层次结构,并限制了属性在表面相似但实际运营不同的职业之间的语义干扰。
3. \(3\) **基于市场的自动化评估** – 我们将重新校准的多标准LLM评判者(Zheng et al., 2023 (https://arxiv.org/html/2609.00274#bib.bib15))与一个七人设评论者评审团相结合,后者为生成的目录贡献加权惩罚。这使评估与市场目标而非通用的分类质量度量保持一致。
4. \(4\) **遗留问答对等映射** – 我们引入了一个对等映射阶段,将重构后的目录映射回遗留的请求表单问答对。此阶段测量新目录是否覆盖了遗留系统中编码的操作差异,并产生一个可供人工审查的工件,以验证从结构化表单到供应商偏好标签的迁移。

该系统的成功意味着市场可以退役其遗留请求表单,而不会丢失它们编码的偏好结构。最直接的证据是重构的保真度。在重构的目录中,73.3%的遗留答案直接映射到再生目录中的一个标签;其余大部分仅是录入型答案(尺寸、范围、“灵活”),偏好架构不应承载这些内容,作为可接受的非标签被排除(占所有答案的20.8%)。只有6.0%的遗留答案是*遗憾的遗漏*,即未覆盖的真实偏好。针对应映射的偏好进行度量,总体覆盖率为92.5%,每个职业的中位数为100%(平均97.8%)。目录丢弃的是,按设计,录入细节;专业人士据此筛选的偏好几乎完全得以保留。加上生产规模(132个职业上线,新职业可在数小时内按需接入)以及部署前强制的人工签批,这种保真度使得退役请求表单变得合理。

提议-评估-保留循环建立在先前关于LLM迭代改进、原则引导批判和自研究系统的工作基础上(Madaan et al., 2023 (https://arxiv.org/html/2609.00274#bib.bib11);Bai et al., 2022 (https://arxiv.org/html/2609.00274#bib.bib3);Karpathy, 2026 (https://arxiv.org/html/2609.00274#bib.bib9));在此,我们将其应用于双边服务市场的生产目录重构。我们报告了截至2026年4月覆盖132个服务职业的生产部署结果,随着市场扩张,可按需接入新职业。本文的其余部分描述了市场环境(§2 (https://arxiv.org/html/2609.00274#S2))、其他相关工作(§3 (https://arxiv.org/html/2609.00274#S3))、用于目录重构的自研究系统(§4 (https://arxiv.org/html/2609.00274#S4))、其在生产中的部署(§5 (https://arxiv.org/html/2609.00274#S5))以及从大规模运行该系统中得出的实证发现(§6 (https://arxiv.org/html/2609.00274#S6))。

## 2\.背景

在本节中,我们描述市场环境以及系统部署的生产背景(§2.1 (https://arxiv.org/html/2609.00274#S2.SS1)),以及理解目录重构问题所需的术语(§2.2 (https://arxiv.org/html/2609.00274#S2.SS2))。

### 2\.1\.市场环境

部署组织是一个主要的美国在线服务市场,将消费者与跨家庭、健康和活动类别的本地服务专业人士(*专业人士*)连接起来,包括管道、房屋清洁、摄影、园艺以及大约130个其他类别。专业人士指定目标偏好,以决定他们有资格接收和购买哪些消费者线索。本文描述的系统是2026年专业端市场重新设计的一部分,该设计用由结构化供应商侧偏好架构(Einav et al., 2016 (https://arxiv.org/html/2609.00274#bib.bib5))驱动的概率匹配,取代了通过结构化问答定义的僵硬二元目标定位。

### 2\.2\.术语

遗留分类按职业、类别和特定类别的请求表单问答架构组织。重构后的目录包含两类标签:

1. \(1\) *规范标签*决定资格:供应商必须拥有与类别相关的规范标签,严格匹配过滤器才会认为该供应商有资格接收该类别的线索;
2. \(2\) *专业偏好标签*允许供应商在他们已有资格的类别内,细化他们希望接收的线索。

第6节(https://arxiv.org/html/2609.00274#S6)报告了两个依赖于这种区分的生产发现:一个目录清洁度差距,其中已弃用的规范标签仍由请求时增强服务发出;以及一个部署侧种子差距,其中40.66%的*过滤评估*失败,因为与消费者请求关联的规范标签未出现在供应商资料中。*过滤评估*是匹配器侧的单次检查,针对一个候选专业人士和一个传入的消费者请求,以确定该专业人士的资料是否包含请求所需的规范标签。

## 3\.相关工作

我们的工作位于自动化分类构建、智能体架构生成、自研究系统、提示优化和基于LLM评估的交叉点。

#### 层次分类构建。

CLIMB(Li et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib10))使用全局语义聚类来提炼核心职业,然后使用基于反思的多智能体系统迭代构建连贯的层次结构。我们的工作在生成单元和重构目标上有所不同:CLIMB在层次结构中生成职业,而我们则在职业内重构供应商偏好标签。此外,我们的目录是为每个职业独立生成的,必须通过对等映射支持从遗留请求表单问答系统的迁移。TnT-LLM(Wan et al., 2024 (https://arxiv.org/html/2609.00274#bib.bib13))使用LLM从非结构化文本中归纳并迭代改进标签分类,而TaxoAdapt(Kargupta et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib8))通过迭代层次分类,动态适应不断发展的科学语料库的多维分类。这两个系统都为我们采用的生成与改进范式提供了参考。然而,它们的目标是语料库组织和分类的分类归纳,而我们的目标是用于市场决策的目录重构。

#### 架构和目录生成。

AttributeForge(Huang et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib6))使用大量专业的LLM智能体,结合自动化评估和修复,实现了端到端的产品架构建模自动化。就生产级目录重构而言,它是最接近的前期工作。关键区别在于建模的对象:AttributeForge为电子商务目录生成产品属性,而我们则为服务市场重构供应商偏好目录,在那里匹配不仅取决于供应商能力,还取决于供应商筛选偏好。

#### 自研究、自我改进和提示优化。

我们的“提议、评估、保留”循环借鉴了更广泛的LLM迭代优化方法家族,包括Self-Refine(Madaan et al., 2023 (https://arxiv.org/html/2609.00274#bib.bib11))、Constitutional AI(Bai et al., 2022 (https://arxiv.org/html/2609.00274#bib.bib3))、多智能体辩论(Du et al., 2024 (https://arxiv.org/html/2609.00274#bib.bib4))、GEPA(Agrawal et al., 2025 (https://arxiv.org/html/2609.00274#bib.bib2)),以及DSPy和MIPROv2等提示优化框架(Opsahl-Ong et al., 2024 (https://arxiv.org/html/2609.00274#bib.bib12))。与DSPy类似,我们将提示视为可优化的工件,评估作为搜索信号。然而,我们的框架不是针对固定基准或保留指标优化单个提示,而是优化特定职业的目录生成提示,其输出是结构化的市场目录。

遗留RF数据 DoD_{o} 生成器 评判者(评分/15)PM 专业分类 对抗推理 连贯性 对等性 7人设评论者评审团(并行) 聚合惩罚(集级别 + 评论者) 改进了? 编辑器:修订提示 迭代 最佳目录 T^{⋆} 平台期时停止

相似文章

索引不可读之物:LLM原生的递归构建与服务分类检索

arXiv cs.AI

本文提出 A2X,这是一个 LLM 原生的流水线,用于递归构建和搜索分层服务分类体系,以克服在智能体互联网中进行服务发现时 LLM 有效上下文窗口受限的问题。与全上下文和基于嵌入的基线相比,它显著提高了检索准确性并降低了 token 消耗。

服务长尾:面向度假租赁市场的免训练LLM候选生成

arXiv cs.LG

本文提出了一种面向度假租赁市场的免训练基于LLM的候选生成流水线,使用现成LLM合成语义查询,并通过密集检索来补充协同过滤,显著提升了对长尾房源的覆盖,同时保持了在热门房源上的性能。