SynthAVE:可扩展的电子商务合成标注与LLM-Arena验证

arXiv cs.CL 论文

摘要

本文介绍了SynthAVE,一个大规模人工验证的电子商务属性值提取基准,采用多LLM竞技场框架(含21种裁判配置)来高效且经济地验证合成标签,同时保持与人工审核相当的质量。

arXiv:2607.07469v1 公告类型: 新 摘要: 微调大型语言模型(LLM)用于电子商务属性提取需要涵盖数千种产品类型、属性和多种语言的标注数据。这种组合规模意味着数百万的标注量,使得人工标注成本过高。尽管近期研究展示了使用LLM生成合成标签的方法,但在工业规模上部署此类方法需要集成质量控制机制。我们提出了SynthAVE,一个大规模人工验证的属性值提取基准,涵盖12,726种产品、229种产品类型、792个属性和4种语言(西班牙语、法语、意大利语、德语)。为了大规模验证合成标签,我们引入了一个多LLM竞技场框架,其中样本由21种裁判配置(7个模型族 × 3种提示)独立评估,最终标签通过多数投票确定。多数投票集成与人类专家的一致性达到Cohen's κ = 0.92(95.2%一致),而单个裁判表现出显著的模型间一致性(Fleiss' κ = 0.76)。这表明,具有不同个体判断的多样化模型能够聚合为高度可靠的预测,从而在保持与人工审核质量相当的前提下,实现大规模且经济高效的验证。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:50

# SynthAVE:面向电子商务的可扩展合成标注与LLM竞技场验证

**来源:** https://arxiv.org/html/2607.07469

Andrea Scarinci¹, Virginia Negri¹, Brayan Impata¹, Suleiman Khan¹, Victor Martinez¹, Marcello Federico¹

¹亚马逊  
{andscar, vrgngr, biimpata, suleimkh, vicmg, marcfede}@amazon.com

---

###### 摘要

对大型语言模型(LLM)进行微调以用于电子商务属性提取,需要有涵盖数千种产品类型、属性和多种语言的代表性标注数据。这种组合规模转化为数百万条标注,使得人工标注成本过高。尽管近期工作已展示使用LLM进行合成标注生成(Negri 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib1)),但在工业规模上部署此类方法需要集成质量控制机制。我们提出SynthAVE,一个大规模人工验证的属性值提取基准,涵盖12,726件产品、229种产品类型、792个属性和4种语言(西班牙语、法语、意大利语、德语)。为了大规模验证合成标注,我们引入了一个多LLM竞技场框架,其中样本由21个评判模型配置(7个模型家族×3种提示)独立评估,最终标注通过多数投票确定。多数投票集成与人类专家的一致性达到了Cohen’s κ=0.92(95.2%一致率),而单个评判模型之间也显示出显著的跨模型一致性(Fleiss’ κ=0.76)。这表明,尽管不同模型的个体判断存在差异,但其汇总结果能够产生高度可靠的预测,从而在保持与人工审查同等质量的前提下,实现成本效益高的大规模验证。

**SynthAVE:用于电子商务的可扩展合成标注与LLM竞技场验证**

Andrea Scarinci¹, Virginia Negri¹, Brayan Impata¹, Suleiman Khan¹, Victor Martinez¹, Marcello Federico¹

¹亚马逊  
{andscar, vrgngr, biimpata, suleimkh, vicmg, marcfede}@amazon.com

---

## 1 引言

为电子商务应用微调与评估大型语言模型(LLM)需要大量高质量标注数据。具体而言,从非结构化目录文本(如产品标题、描述、要点)中预测和评估产品属性值,需要有覆盖三个关键维度的代表性标注样本:产品类别(如电子产品、服装、家具)、属性(如颜色、材质、尺寸)以及语言。在目录规模下——数千种产品类别、数千个属性和多种语言——要达到可靠的模型性能,每个(产品类别×属性×语言)三元组需要数百个标注样本。这种组合需求转化为数百万条标注,使得人工标注成本过高。

先前工作已展示了使用LLM为电子商务属性值提取生成合成标注的可行性(Negri 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib1))。然而,在工业规模上部署此类方法面临一个关键挑战:如何在不进行全面人工审核的情况下,高效验证跨异构属性和语言的标注质量。一个可扩展的解决方案必须将合成标注生成与自动化质量控制机制相结合。

本文提出了 SynthAVE(属性值提取的合成数据),一个大规模人工验证的基准,它增强了先前的生成方法(Negri 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib1)),并附带了可扩展的质量保证。我们引入了一个多LLM审计框架,每个生成的标注由21个评判模型配置(7个模型家族×3种提示)独立评估,最终标注通过多数投票确定。为了减轻系统性偏差,我们采用了来自不同供应商的多样化模型以及多样化的提示策略。校准该系统的真实标签通过人工验证12,726件产品建立。实证评估表明,具有不同偏差的多样化模型汇总后能产生高度可靠的预测:集成模型与人类专家的一致性达到95.2%(Cohen’s κ=0.92),同时实现了成本效益高的大规模验证。

我们的主要贡献包括:

- **SynthAVE:** 一个人工验证的基准,涵盖12,726件产品、229种产品类别、792个属性和4种语言,用于多语言属性提取研究。¹¹ 公开版本将额外包含使用相同流程生成的英语标注,覆盖范围扩展至5种语言。

- **多LLM验证框架:** 一种审计方法,在多样化评判模型配置间采用多数投票,与人工评估的一致性达到95.2%,同时实现了成本效益高的大规模验证。

## 2 相关工作

从非结构化网络文本中提取信息(IE)是大型电子商务系统和知识库构建的基础能力。常见应用包括产品属性提取、实体填充、目录丰富以及从异构在线源获取事实(Zhang 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib14); Martinez-Rodriguez 等人, 2020 (https://arxiv.org/html/2607.07469#bib.bib13); Dagdelen 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib12))。大型语言模型(LLM)的最新进展大幅降低了跨领域和模式部署灵活提取系统的门槛(Zhu 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib10))。然而,评估提取信息质量仍然是一个核心挑战,主要原因是缺乏高质量人工标注数据,且现代IE系统运行规模庞大。

IE的经典评估方法依赖人工标注的真实标签数据集,并使用精确率、召回率和F1分数等指标报告性能(Xu 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib11); Zhu 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib10))。虽然在受控研究环境中有效,但这种范式无法扩展到现实世界的网络和电子商务应用。标注成本高昂、耗时,且通常需要领域专业知识,尤其在提取目标涉及复杂或演进的模式时(Deng 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib2); Hsu and Roberts, 2025 (https://arxiv.org/html/2607.07469#bib.bib3))。因此,许多生产管线运作时仅有有限甚至没有黄金标准评估数据,这推动了在弱监督或无监督条件下工作的评估方法的发展。

现有的产品属性提取基准体现了规模与质量之间的这种矛盾。多源属性值提取(MAVE)数据集(Yang 等人, 2022 (https://arxiv.org/html/2607.07469#bib.bib44))提供了来自亚马逊产品简介的220万条属性值标注,覆盖1,257个属性——通过自动化流程实现了令人印象深刻的规模。然而,MAVE的质量保证主要依赖基于分类器的过滤,而非对属性值标注的全面人工验证。此外,MAVE仅限英语,且侧重于提取任务而非验证任务。这些局限性促使我们探索合成评估方法并开发更严格的验证框架。

针对这些约束,近期工作探索了减少或消除对人工标注真实标签依赖的评估策略。Seitl 等人 (2024 (https://arxiv.org/html/2607.07469#bib.bib40))提出了一个基于合成真实标签生成的自动IE评估框架,其中人工构建的结构化事实被注入自然文档,系统根据恢复这些事实的能力进行评估。尽管具有可扩展性,合成评估方法引入了与真实性相关的局限性——人工注入的事实可能无法完全捕捉自然发生的电子商务文本中的歧义、不一致和噪声(Negri 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib1))。

另一条研究路线调查了使用LLM生成用于下游评估的标注数据集。通过利用LLM作为标注器,可以快速构建大量人工标注不可行的标注数据(Mohta 等人, 2023 (https://arxiv.org/html/2607.07469#bib.bib6); Tan 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib8))。在电子商务语境中,这支持跨多样产品类别对提取流程进行近似评估(Nadaş 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib26))。然而,自动生成的标注可能反映特定模型的偏差或系统性错误,需要仔细验证和选择性人工监督(De 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib7))。管线设计选择——将提取分解为多个阶段、结构化输出格式和规范化规则——进一步提升了性能(Jaradeh 等人, 2023 (https://arxiv.org/html/2607.07469#bib.bib9); Sabeh 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib4); Satyadharma 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib5)),但在缺乏标准化基准时使评估复杂化。

## 3 任务与数据集

**属性值提取任务。** 属性值提取(AVE)任务要求确定给定的属性值是否可以从非结构化产品文本中验证。给定产品的非结构化文本(标题、要点、描述)和一个属性值对,任务是指定三个标签之一:CORRECT(正确)、INCORRECT(错误)或 UNKNOWN(未知)。我们用一个具体例子来说明。给定产品标题“便携式笔记本电脑支架,可调节高度,铝合金结构,银色表面处理,兼容10-17英寸设备”,标签取决于属性值对:

- (color, Silver) 为 正确,因为文本提到“银色表面处理”;
- (color, Black) 为 错误,因为它与文本矛盾;
- (weight, 1.2kg) 为 未知,因为没有重量信息。

训练模型可靠地执行这种三分类需要跨多样化产品类别、属性和语言的所有情况的标注样本。我们的合成数据生成流程大规模产生此类样本,而我们的验证框架确保其质量。

**合成数据生成。** 我们分两个阶段构建数据集。首先,我们从大型电子商务目录中抽样真实产品,涵盖4种语言(西班牙语、法语、意大利语、德语),确保所有语言中都存在产品类别,且每个类别至少30件产品。其次,对于每件抽样产品,我们使用 Negri 等人 (2025 (https://arxiv.org/html/2607.07469#bib.bib1))的受控生成方法生成合成变体。此过程创建严格的一一对应关系:每个合成产品实例恰好与一个目标属性和一个值槽配对。生成流程产生所有三种标签类型:正确(文本显式或隐式支持的值)、错误(文本与值矛盾)和未知(无法从可用文本确定属性)。

**表 1:按语言划分的数据集统计**

合成数据集包含12,726件产品,涵盖229种产品类别、792个唯一属性和2,607个不同的产品属性组合。数据集涵盖主要产品领域,包括电子产品、服装、家居家具和体育用品。每个类别至少包含30件产品,其中较大的类别如 NOTEBOOK_COMPUTER 达到209件产品。类别根据领域特定属性进行评估(例如,电子产品的 connectivity_technology,服装的 closure.type)。完整的类别和属性分布见附录 B (https://arxiv.org/html/2607.07469#A2)。

**验证挑战。** 尽管初步人工分析显示合成流程达到92.6%的准确率,但这一错误率对基准评估而言是有问题的——在含噪声的真实标签上计算的指标会产生误导性结论。然而,对12,726件产品在4种语言上进行全面人工审核成本过高。第4节 (https://arxiv.org/html/2607.07469#S4) 提出了我们的解决方案:一个多LLM验证框架,以较低的成本实现了人类级别的准确率。

## 4 多LLM验证框架

在定义了属性值提取任务和数据集构建过程之后,我们现在应对核心挑战:在不进行全面人工审核的情况下大规模验证合成标签。在已有生成方法的基础上(Negri 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib1)),我们提出了一个多LLM审计框架,将多样化的模型判断聚合成可靠的质量估计。

我们的框架将LLM评判模型视为独立评估者,其集体判断在适当汇总后可近似于人类专家共识。这需要仔细关注两个基础方面:确保评判模型之间的独立性,以及建立与传统人工审核员标准相匹敌的资格标准。

**评判模型选择与配置。** 为了使汇总判断在统计上有意义,各个评判模型必须提供真正独立的评估。我们通过两个维度的多样性来强制执行这一点。

- **模型家族多样性。** 我们从不同供应商中选择了7个LLM家族(表2 (https://arxiv.org/html/2607.07469#S4.T2)):Claude(Anthropic, 2024 (https://arxiv.org/html/2607.07469#bib.bib39))、Nova(Amazon Artificial General Intelligence, 2024 (https://arxiv.org/html/2607.07469#bib.bib36))、GPT(OpenAI 等人, 2024 (https://arxiv.org/html/2607.07469#bib.bib38))、Mistral(Mistral AI, 2025 (https://arxiv.org/html/2607.07469#bib.bib43))、DeepSeek(Guo 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib41))、Qwen(Bai 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib45))和 Gemma(Gemma Team 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib42))。这确保了跨模型规模和训练目标(通用型、推理聚焦型、多语言型)的多样性,使输出独立于家族特定偏差。

**表 2:在本竞技场中评估的LLM模型。**

- **提示多样性。** 对于每个模型,我们开发了三种显著不同的提示版本(详见附录 D (https://arxiv.org/html/2607.07469#A4))。这防止了模型输出反映因相同措辞导致的提示过拟合或人为一致性。

该设计产生了 7×3=21 个独立的评判模型配置。每个配置评估所有12,726件产品(4种语言:西班牙语、法语、意大利语、德语),产生总计267,246条判断。

![图1:多LLM评判模型配置框架。七个模型家族结合三种提示变体,产生21个独立评判模型。](图1说明)

**资格标准。** 除了独立性外,每个LLM评判模型还需满足与人类审核员传统标准平行的资格标准。

- **一般能力** 建立基线能力:模型必须在既定基准上达到最低性能阈值,例如 LiveBench 上全球平均得分≥70%(White 等人, 2025 (https://arxiv.org/html/2607.07469#bib.bib34)),这与人类审核员的教育或认证要求类似。

- **任务特定能力** 确保领域相关性:模型必须通过内部基准评估,展示对属性验证的充分理解,这类似于

相似文章

JudgeArena:可复现的LLM裁判评估统一框架

arXiv cs.CL

JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。

ARES:可扩展LLM强化学习的自动评估标准合成

arXiv cs.CL

ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。