利用并行解码技术扩展电子商务属性提取

arXiv cs.CL 论文

摘要

论文介绍了一个两阶段的大语言模型管道,使用经过微调的Qwen3-4B和超并行解码来提取电子商务中具有购买区分度的属性,实现了85%的准确率,成本降低了92%。

arXiv:2609.09716v1 公告类型:新 摘要:客户依赖特定的产品属性来比较产品并做出购买决策,但电子商务目录混乱且非结构化,难以识别哪些属性最重要并大规模提取。标准属性值提取 (AVE) 系统平等对待所有属性,产生大型、不一致的属性集,这些属性集不反映消费者用来区分产品的因素。我们引入了一个两阶段的大语言模型管道,首先为每个产品类别发现一个紧凑的、排序的具有购买区分度的属性模式,然后使用经过微调的紧凑大语言模型 (Qwen3-4B) 和超并行解码 (HPD) 从目录文本中提取它们的值。该管道实现了85%的提取准确率,与蒸馏它的基础大语言模型相当,同时将推理成本降低了92%相对于基础大语言模型,使其能够用于生产规模的产品发现和目录丰富。生成的类别级结构化表示实际上构成了自动构建的产品知识库,提供跨不同产品类别的一致、可比的属性,可以支撑下游的知识密集型应用。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:14

# 通过并行解码实现电子商务属性提取的规模化
来源:https://arxiv.org/html/2609.09716
Dushyanta DhyaniBryan WangShervin Malmasi单位:Amazon\.com, Inc\.联系邮箱:\{veduln, dhyanidd, brywan, malmasi\}@amazon\.com

###### 摘要

消费者依赖特定的产品属性来比较商品并做出购买决策,但电子商务目录通常混乱且缺乏结构,这使得识别关键属性并大规模提取它们变得十分困难。标准的属性值提取(AVE)系统对所有属性一视同仁,产生庞大且不一致的属性集,无法反映消费者用来区分产品的关键因素。我们提出了一种两阶段的LLM流水线:首先为每个产品类别发现一个紧凑的、按购买重要性排序的属性模式,然后使用经过微调的紧凑型LLM(Qwen3-4B)配合超并行解码(HPD)从目录文本中提取属性值。该流水线在保持与蒸馏来源的基础LLM相当(85%)提取准确率的同时,将推理成本降低了92%,使其能够应用于产品发现和目录丰富化的生产级规模。最终生成的类别级结构化表示实质上构成了自动构建的产品知识库,为跨不同类别的产品提供了一致、可比较的属性,可用于支撑下游的知识密集型应用。

## 1 引言

属性值提取是电子商务系统的核心能力。结构化的产品属性驱动着搜索、筛选、比较、推荐以及产品质量评估工作流(Yang 等人,2022 (https://arxiv.org/html/2609.09716#bib.bib1);Brinkmann 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib2))。然而,电子商务目录高度混乱,产品信息分散在标题、描述、要点列表和半结构化字段中;卖家使用的术语不一致;且属性值常常缺失、隐含、重复或以非标准形式表达(Khandelwal 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib3);Yang 等人,2022 (https://arxiv.org/html/2609.09716#bib.bib1))。近期研究越来越多地探索用于AVE的生成式方法,即使用编码器-解码器模型和LLM直接从产品文本中提取属性值(Blume 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib4);Shinzato 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib5);Khandelwal 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib3))。这些方法能处理异构输入和灵活的输出模式,但将其部署到电子商务规模时面临两大挑战。首先,在数千个产品类别上手动定义高质量的模式成本高昂且难以维护(Huang 等人,2025 (https://arxiv.org/html/2609.09716#bib.bib11);Xu 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib6))。其次,从海量目录中提取值的计算成本很高,特别是当产品每日新增且模式随下游需求演变时(Chen 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib7);Yang 等人,2024 (https://arxiv.org/html/2609.09716#bib.bib8);Zhang 等人,2024 (https://arxiv.org/html/2609.09716#bib.bib9))。

我们专注于提取每个产品类别中与消费者相关、能区分购买决策的属性。与针对广泛属性覆盖范围或为预定义属性提取值的标准AVE表述不同(Yang 等人,2022 (https://arxiv.org/html/2609.09716#bib.bib1);Xu 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib6)),我们的目标是识别在类别内对产品区分最有用的属性(例如,搅拌机的功率、存储设备的容量、耳机的降噪性能),并确保同一类别中的所有产品共享相同的模式,使它们的结构化表示可以直接比较。因此,我们的流水线自动推导领域本体(类别级模式)并大规模填充,无需人工模式工程即可构建结构化的产品知识库。

我们提出了一个可扩展的两阶段LLM流水线。第一阶段,我们使用大型基础LLM(Claude)从具有代表性的目录样例中自动发现特定于类别的模式,然后跨类别标准化语义相似的属性。第二阶段,我们使用经过微调的小型语言模型,配合超并行解码(HPD),从产品目录文本中提取已发现模式对应的值。HPD利用属性值之间的条件独立性,并行解码多个值(Glavas 等人,2026b (https://arxiv.org/html/2609.09716#bib.bib10)),显著提高了吞吐量。

我们在一个跨越数千个类别的大型专有电子商务目录上评估了该系统。我们的模式发现阶段产生的属性有89.6%被判断为正确或相关,经过微调的值提取模型实现了约85%的提取准确率,与基础LLM教师模型相当,同时模型参数量减少了100倍以上。所提系统将推理成本降低了92%,使大规模、重复的目录处理成为可行。我们的主要贡献是:

\(i\) 一个两阶段流水线,自动发现紧凑的、类别级的属性模式并大规模提取其值,无需人工模式工程。

\(ii\) 一个结合知识蒸馏(到紧凑型LLM Qwen3-4B)与超并行解码的实际大规模用例,处理跨多个市场的数亿产品,相比基础LLM基线实现了92%的成本降低。

\(iii\) 一项全面评估,涵盖模式质量、提取准确性、数量理解、确定性和效率,并提供了详细的成本和吞吐量分析。

## 2 相关工作

#### 产品属性值提取。
电子商务领域的属性值提取(AVE)从嘈杂的目录内容中恢复结构化的产品属性,以支持搜索、推荐、比较和目录丰富化(Yang 等人,2022 (https://arxiv.org/html/2609.09716#bib.bib1);Brinkmann 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib2))。先前工作将AVE定义为序列标注(Zheng 等人,2018 (https://arxiv.org/html/2609.09716#bib.bib12))或基于产品上下文的问答(Wang 等人,2020 (https://arxiv.org/html/2609.09716#bib.bib13))。这些方法改进了为预定义属性的提取,但通常假设模式可用,并且在处理大量属性和类别时可能变得昂贵。

#### 生成式AVE。
近期工作探索了生成式AVE,使用编码器-解码器或基于LLM的模型直接从产品文本生成属性值(Blume 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib4);Shinzato 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib5);Khandelwal 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib3);Brinkmann 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib2))。这些方法能处理异构输入和灵活的输出格式,但生产级部署仍然需要可扩展的模式构建和对大型目录的高效提取。我们的工作通过自动模式发现和低成本生成式提取,同时针对这两个挑战。

#### 模式发现与知识库构建。
开放世界属性挖掘和产品模式建模旨在以有限的人工监督发现或维护产品属性(Xu 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib6);Huang 等人,2025 (https://arxiv.org/html/2609.09716#bib.bib11))。更广泛地说,自动化知识库构建包括从非结构化源提取、集成和维护结构化知识(Weikum 等人,2021 (https://arxiv.org/html/2609.09716#bib.bib14)),近期工作利用LLM重塑了本体工程、知识提取和知识融合的经典流程(Bian,2025 (https://arxiv.org/html/2609.09716#bib.bib15))。在电子商务领域,Hongwimol 等人(2026 (https://arxiv.org/html/2609.09716#bib.bib16))提出了一个多智能体LLM框架,按需归纳产品类型和属性键,并将其整合为全局一致的产品知识图谱;而Peshevski 等人(2025 (https://arxiv.org/html/2609.09716#bib.bib17))则从非结构化产品描述中自动化本体创建和知识图谱填充,无需预定义模式。我们的工作共享自动化产品知识库构建的目标,但侧重点不同:我们寻求紧凑的、购买区分度高的类别级模式,并通过并行解码优先考虑极致的提取效率,以实现数亿产品规模的部署。

#### 高效可扩展的提取。
可扩展性是AVE的核心挑战,因为现实世界的产品关联着大量属性。一些QA式的方法针对不同的目标属性重复处理相同的产品上下文(Chen 等人,2023 (https://arxiv.org/html/2609.09716#bib.bib7))。提示内并行解码(Glavas 等人,2026a (https://arxiv.org/html/2609.09716#bib.bib18))通过将多个问题堆叠到单个提示中,并通过注意力掩码操作同时解码它们的答案,解决了这个常见上下文瓶颈。近期工作通过缓存上下文表示和使用轻量级的属性-上下文交互来提高效率(Yang 等人,2024 (https://arxiv.org/html/2609.09716#bib.bib8)),而“终身”AVE则解决了适应不断演变的产品、类别和属性的需求(Zhang 等人,2024 (https://arxiv.org/html/2609.09716#bib.bib9))。我们的提取阶段是互补的:我们针对结构化值提取对小型语言模型进行专门化,并使用超并行解码(HPD)从同一产品上下文中并行解码多个条件独立的属性值(Glavas 等人,2026b (https://arxiv.org/html/2609.09716#bib.bib10))。

## 3 可扩展的模式引导属性值生成

电子商务目录包含数十亿产品,每个产品都有其独特的属性集和值。为每个产品单独提取这些属性值对,会在整个目录中产生大量语义相似但名称不同的属性,这使得它们既难以管理又难以在下游使用。我们提出一个两阶段流水线:首先为每个产品类别确定一组关键的、购买区分度高的紧凑属性集,随后提取该类别中每个产品对应这些属性的值。需要注意分类粒度的选择很重要:粒度过粗(类别少)会导致属性过于泛化;而粒度过细则会导致属性集规模急剧增大。

图 1:我们用于可扩展模式引导属性值生成的两阶段流水线概览。阶段1使用大型基础LLM为每个类别发现一个包含N个购买区分度高属性的紧凑模式。阶段2使用经过微调的紧凑型LLM配合超并行解码,从产品目录文本中提取属性值,同时生成所有N个值。
### 3.1 问题描述
设P\\mathcal\{P\}表示一个大规模电子商务产品目录,被划分为|T|个高级类别(|\mathcal\{T\}|)。每个产品p∈P(p\\in\\mathcal\{P\})具有目录上下文x_p(\\mathbf\{x\}\_\{p\}),包含其标题、描述和其他非结构化产品详情,并关联一个类别t(p)(t\(p\)\\in\\mathcal\{T\})。我们试图为每个产品p生成一个结构化表示φ(p)=\{(a_i, v_i)\}_{i=1}^N(\\phi\(p\)\\;=\\;\\bigl\\\{\\,\(a\_\{i\},\\;v\_\{i\}\)\\bigr\\\}\_\{i=1\}^\{N\}),其中A_{t(p)}=\{a_1,...,a_N\}(At⁡\(p\)=\{a1,...,aN\})是在类别级定义的N个购买区分度高属性的模式(\\mathcal\{A\}\_\{t\(p\)\}=\\\{a\_\{1\},\\ldots,a\_\{N\}\\\}),每个v_i(v\_\{i\})是从x_p(\\mathbf\{x\}\_\{p\})中提取的属性a_i(a\_\{i\})的值(如果存在)。这分解为两个子问题:
属性模式发现:对于每个类别t∈T(t\\in\\mathcal\{T\}),识别一个对该类别内消费者购买决策最具信息量的属性模式A_t=\{a_1,...,a_N\}(At=\{a1,...,aN\})(\\mathcal\{A\}\_\{t\}=\\\{a\_\{1\},\\ldots,a\_\{N\}\\\})。
属性值生成:对于每个产品p∈P(p\\in\\mathcal\{P\}),给定模式A_{t(p)}(At⁡\(p\)...)和目录上下文x_p(\\mathbf\{x\}\_\{p\}),从x_p(\\mathbf\{x\}\_\{p\})中提取每个属性a_i∈A_{t(p)}(a\_\{i\}\\in\\mathcal\{A\}\_\{t\(p\)\})的值v_i(v\_\{i\})。关键的设计约束是类别级模式共享:所有属于同一类别t(t)的产品共享相同的属性模式A_t(\\mathcal\{A\}\_\{t\}),确保对于任意两个产品p, p'(p,p^\{\\prime\})且t(p)=t(p')(t\(p\)=t\(p^\{\\prime\}\)),它们的φ(p)(\\phi\(p\))和φ(p')(\\phi\(p^\{\\prime\}\))是可比较的。
### 3.2 阶段1:属性模式发现
#### 类别特定属性规范
对于每个类别,我们随机选择k个满足客户参与度指标最低阈值的产品,以确保质量和多样性的平衡选择。然后,我们使用Claude Sonnet 4 LLM从每个产品的标题和描述中识别该类别的M个关键属性。提示词经过调整,同时提取每个属性的描述、数据类型(数值型、分类型、单值、多值或自由文本)以及该属性在给定类别中可能取值的标准化值列表。
#### 全局属性规范
虽然每个产品都有其独特的属性集(例如,耳机的降噪能力或硬盘的存储容量),但某些属性普遍适用于所有产品。我们用以下全局属性集补充类别特定属性:总包装尺寸、总重量、总体积、单件重量、单件体积。
#### 属性名称标准化
虽然为每个类别定义固定数量的M个属性限制了局部模式,但在P个类别上运行阶段1可能产生M×P个属性(范围从几个到数万个),并存在语义冗余(例如,防水性、防水等级、IP防水等级)。我们开发了一种基于LLM的聚类方法来标准化这些属性。我们使用Qwen3-8B嵌入模型嵌入所有属性名称,并应用层次凝聚聚类将语义相似的属性分组。然后,通过以下两种方法之一为每个聚类分配一个规范名称:a) 启发式:将所有聚类成员替换为最频繁的代表名称,前提是满足最低相似度阈值;或 b) 基于LLM:使用LLM生成一个标准化名称,同时保留特定领域的上下文。
### 3.3 阶段2:并行属性值生成
一旦生成了标准化的属性集,下一步是从所有目录产品中提取这些属性的值。一种直接的方法是使用预定义属性和产品目录信息提示基础LLM。虽然最先进的LLM可以高精度地完成此任务,但以经济高效的方式扩展到数亿产品是一个重大挑战。即使按乐观估计每小时处理10万件产品,处理完整目录

相似文章