LLMs 何时真正有效?评估 LLMs 作为数据质量标注器
摘要
本研究评估了 LLMs 在电子商务任务中作为数据质量标注器的表现,发现当需要背景知识时,它们优于基线方法,但对于具有强烈词汇信号的任务优势有限,同时展示了跨运行的高度一致性。
arXiv:2608.18158v1 公告类型:新
摘要:LLMs 越来越被用于自动捕获数据质量问题,但我们对这些判断的实际一致性知之甚少。本研究在一个 LLM 上测试了两个电子商务数据质量任务——实体匹配和品牌错误标注,与基于规则的基线以及人类验证的真实情况对比,采用零样本和少样本提示。在实体匹配任务中,使用 Abt Buy 基准数据集(2,194 个标注对),一个简单的基于规则的基线(F1=0.950)表现与 LLM 零样本提示(F1=0.948)相当。此外,一个在小验证样本上看起来有效的少样本提示修订将整体性能降低到 F1=0.914。这表明小样本提示评估可能会产生误导。在品牌错误标注检测中,使用 500 个 Amazon 产品列表并注入合成标注错误,LLM 明显优于朴素的基于规则的基线(F1=0.833 vs 0.721),因为它能利用品牌产品关系的背景知识,而简单规则无法访问。测试跨重复运行的一致性(200 对,5 次运行,温度 0.7)显示模型平均在 99.7% 的情况下与自己一致,99% 的配对在所有 5 次运行中给出相同答案。在这些运行中使用多数投票仅将 F1 提高了 0.005,但推理成本增加了 5 倍。这些结果表明,使用 LLM 而非传统方法的价值在很大程度上取决于任务。当存在强烈的词汇信号时,LLMs 提供的优势很小,但当任务需要背景知识时,则有明显优势,同时在重复查询中保持高度一致性。
查看缓存全文
缓存时间: 2026/08/20 10:07
# 大型语言模型何时真正有助于数据质量?评估LLM作为数据质量标注器 来源:https://arxiv.org/html/2608.18158 Praphulla Lal Shrestha ###### 摘要 大型语言模型日益被用于自动检测数据质量瑕疵,但我们对其判断的实际一致性知之甚少。本研究在零样本和少样本提示条件下,针对两个电子商务数据质量任务——实体匹配与品牌错误标注——对LLM进行测试,比较基准为基于规则的方法和人工验证的基准真相。在实体匹配任务中,使用Abt-Buy基准数据集(2,194条标注数据对)时,简单的基于规则的基准方法(F1=0.950)表现与LLM零样本提示(F1=0.948)相当。此外,一种在小规模验证样本上看似有效的少样本提示修订版,却将整体性能降低至F1=0.914。这表明基于小样本的提示评估可能具有误导性。在品牌错误标注检测任务中,使用500个亚马逊商品列表(内含合成注入的标签错误),LLM明显优于朴素的基于规则的基准方法(F1=0.833 vs 0.721),因为它能够利用简单规则无法获取的品牌与产品关系的背景知识。通过重复运行测试一致性(200对数据,5次运行,温度0.7),发现模型在99.7%的情况下自洽,99%的数据对在所有5次运行中给出相同答案。在这些运行中采用多数投票法仅将F1提高了0.005,而推理成本却增加了5倍。这些结果表明,使用LLM相对于传统方法的价值在很大程度上取决于具体任务。当任务已存在强词汇信号时,LLM优势甚微;但当任务需要背景知识时,则优势明显,同时在重复查询中保持高度一致性。 ## I 引言 随着组织严重依赖网络抓取的电子商务数据集用于搜索、推荐系统、分析及业务决策,大规模结构化数据的质量变得日益重要。然而,保持数据质量仍面临巨大挑战。重复记录、错误品牌分配、不一致的元数据、缺失值等常见数据问题,在数据采集和整合过程中频繁出现。尽管人工审核和基于规则的验证技术被广泛用于识别这些问题,但当数据集从数百条记录扩展到数百万条时,这些方法就变得难以扩展。在需要持续监控数百万条记录的工业数据管道中,对能够以最少人工干预进行可靠数据质量判断的自动化方法需求日益增长。 大型语言模型(LLM)近期因其理解自然语言和超越显式规则进行泛化的能力,成为此类任务的潜在解决方案。因此,它们正越来越多地被探索用于实体匹配、数据标注、记录验证和异常检测等应用的灵活标注器。尽管采用度日益提高,大多数评估仍侧重于一次性预测性能,而对标注本身可靠性的关注相对较少。在实际的数据质量工作流程中,一个标注器若对相同输入在重复执行时产生不同输出,无疑会降低对自动化决策的信心。因此,仅测量准确率是不够的,评估LLM在重复推理下是否产生一致的判断至关重要。 本研究通过两个代表性的电子商务数据质量任务——实体匹配和品牌错误标注检测——评估LLM作为数据质量标注器的可靠性,测试模型为GPT-4o-mini。实体匹配实验在公开的Abt-Buy基准数据集上进行,而品牌错误标注则使用一个合成损坏的亚马逊产品数据集进行评估。对于每个任务,基于LLM的方法与既定的基于规则的基准方法进行比较。除了比较零样本和少样本提示策略外,还进行了重复推理实验,以量化LLM预测在多次独立运行中的一致性。 结果表明,LLM的价值很大程度上取决于数据质量任务的特性。对于实体匹配,零样本LLM提示达到了与简单Jaccard相似度基准方法相当的性能,这表明对于此问题,LLM相较于传统方法优势有限。相比之下,在检测品牌错误标注时,LLM显著优于基于规则的方法,这证明了在显式规则不足时,上下文和语义推理的优势。一致性实验进一步揭示模型在多次重复运行中产生高度稳定的预测。总体而言,这些发现为LLM何时适合作为自动化数据质量标注器提供了实践依据,并突出了评估基于提示系统时的重要考量。 ## II 相关工作 经典实体解析。实体解析是指链接引用同一真实世界实体(无共享标识符)的记录,它早于基于LLM的方法数十年。Binette和Steorts追溯了该领域从统计记录链接到确定性、概率性和基于聚类的方法。他们指出,确定性匹配作为一个长期存在、可解释的基准,在属性噪声增加时性能会下降。这促使了更丰富的概率方法的出现,如Fellegi-Sunter模型。这为本研究中使用的Jaccard基准方法奠定了基础,解释了第4.1节中发现的低重叠失败案例。 基于LLM的实体匹配。Wang等人比较了成对“匹配”、成对“比较”和列表“选择”提示策略,发现利用候选记录间的关系显著提高了F1(比较比匹配高10.7分;选择比比较进一步提高5.3分)。他们提出的COMEM框架结合了不同优势的模型,以更低的成本将F1提高了2%到18%。本研究仅使用简单的成对“匹配”策略,因此[2]关于独立分类忽略全局一致性(如一对一映射)的批评直接适用,并在第5节中重新讨论。更直接可比的是Bopardikar等人,他们评估了相同的Abt-Buy基准,测试了多步推理提示和基于辩论的替代方案。他们的零样本基准F1(0.849)显著低于本研究获得的0.948,可能是因为[6]使用了完整的、严重不平衡的DeepMatcher划分(1,028个正例 vs. 8,547个负例),而非本研究构建的平衡的2,194对数据集。Bopardikar等人[6]还发现,在此数据集上增加的推理复杂度对零样本提示有帮助,但损害了少样本提示,这与本研究自身的少样本泛化失败(第4.1节)高度相似,表明一旦基准信号存在,增加的提示复杂度不一定能可靠地提供帮助。 产品属性与品牌数据质量。Wang等人[7]致力于验证目录属性值(如品牌),其动机与本研究第二个任务相同,并明确指出,当一个值在文本上存在但被错误分配给其他属性时,朴素的关键词存在性检查会失败,这正是第4.2节中基于规则基准方法低精确率(0.564)背后的失败模式。他们提出的MetaBridge模型需要训练和每个类别的未标记数据,不同于本研究使用的无需训练的零样本提示,后者在无需任何训练的情况下达到了相当的正确性检测(F1=0.833)。更近期的自动提示级联方法[8]从小型种子集合中引导特定于类别的指令,将Claude 3.5 Sonnet的正确性F1从67.37%提高到91.13%,同时将人工指令编写工作量减少了约99%。本研究通用的零样本提示更接近[8]的基线层级,而非其精炼的级联版本,这表明特定于类别的自动生成提示是进一步改进品牌错误标注检测的具体方向(第6节)。 LLM作为数据标注器。Aguda等人[3]评估了GPT-4、PaLM 2和MPT Instruct作为金融关系抽取标注器与专家及个人众包标注者的表现,发现LLM显著优于非专家众包标注者(GPT-4:68.4% vs. MTurk的38.6%)。值得注意的是,[3]中的所有模型,包括GPT-4,在两次相同运行中均未达到完美的自洽,且提示选择对一致性的影响大于温度设置。这与本研究在更简单二元任务上近乎完美的自洽性(99.7%)形成对比,支持了第5节中提出的观点,即一致性取决于任务难度和标签模糊性,而不仅仅是模型能力。 重复采样下的可靠性与一致性。Sharma等人[9]研究了认知扭曲检测,其中人工基准真相本身不可靠(专家一致性33.7%),并以跨运行一致性作为可靠性代理,发现超过84%的示例在5次运行中多数标签稳定。这与本研究不同,后者的基准真相是客观验证的而非主观的,因此这里的一致性是确认性信号,而非基准真相的替代品。Alvarado Gonzalez等人[4]表明,单次运行的LLM评估会产生不稳定的排序(83%的条件相对于3次运行的多数投票显示出排序反转),并建议至少进行两次重复运行作为实际最低要求。另一项关于LLM作为评判者设置中温度的因果研究[10]发现,一致性在高温下急剧下降,这主要由输出格式错误而非判断质量下降驱动,本研究简单的二元输出格式可能限制了此效应,因为在温度0.7时也未出现零个无法解析的响应。这两项研究都促使了第5节中讨论的局限性,即本研究仅在一个非零温度点测量一致性,而非完整扫描。 成本高效的LLM管道与小模型评估。Schnabel等人[11]表明,一个廉价的、结构分解的相关性评估管道(一个二元过滤器后接精炼)可以优于单次昂贵的旗舰模型调用,甚至将GPT-4o自身的准确性提高了9.7%。这与本研究自身的复杂化尝试形成对比,本研究的少样本提示修订和5次运行多数投票都增加了成本,却仅带来边际或负面回报。Han等人[12]同样发现,在文献综述筛选的六个LLM和五种提示策略中,自我反思提示持续表现不佳,这是第三个复杂化未能带来帮助的独立实例。Han等人[12]还发现,GPT-4o-mini在仅一小部分成本的情况下与更大模型竞争力相当,这支持了本研究的模型选择,并得到OpenAI自身基准测试[13]的证实,该测试显示GPT-4o-mini在通用推理(MMLU 82.0% vs. 77.9%)上优于Gemini Flash和Claude Haiku等价格相似的模型。 ## III 方法论 ### III-A 数据集 对于实体匹配,本研究使用Abt-Buy基准数据集,包括Abt.csv(1,081个产品)和Buy.csv(1,092个产品),以及一个人工验证的完美映射文件,该文件标识了两个目录之间的真实匹配。由此构建了2,194行标注数据对集合:正对直接从映射文件中提取,负对通过随机不匹配采样生成,形成类别平衡的数据集。 对于品牌错误标注,本研究使用Amazon.csv(来自Amazon-Google Products基准数据集),抽样至500行,这些行包含非空的制造商字段。由于该数据集中不存在现有的错误标注基准真相,因此合成了基准真相:大约一半的行将其制造商字段与从数据集其他地方抽取的另一个真实制造商互换,而其余行保持不变,从而生成了带有已知可验证基准真相的标注正确性数据集。 ### III-B 基准方法 对于实体匹配,基准方法是在归一化产品名称(小写、去除标点符号)上计算的Jaccard词语重叠相似度度量,通过相似度阈值确定匹配。在测试的阈值中,发现阈值0.2能获得最佳F1分数,并在整个研究中作为报告的基准。 对于品牌错误标注,基准方法是朴素的子字符串检查:如果制造商名称出现在产品标题中,则产品被标记为正确标注,否则标记为错误标注。 ### III-C LLM设置 所有LLM实验均通过OpenAI API使用GPT-4o-mini。两个任务都主要使用零样本提示,所有主要结果的温度设置为0以确保可重现性。对于实体匹配,还额外测试了一种少样本提示变体,其中提示包含明确指导,优先考虑共享型号或SKU代码作为匹配的强证据,并附有两个工作示例。一致性测试仅针对实体匹配任务进行,在温度0.7下对200对分层子样本进行五次重复运行。 ### III-D 评估 所有方法均使用精确率、召回率、F1分数和准确率相对于基准真相进行评估。对于一致性测试,使用了两个额外指标:五次重复运行中每对数据的一致率,以及跨越这五次运行的多数投票预测的准确率。 ## IV 结果 ### IV-A 实体匹配(Abt-Buy,2,194对) 表I:在Abt-Buy基准数据集(2,194对标注数据)上评估的三种实体匹配方法的精确率、召回率、F1分数和准确率。图2:Abt-Buy基准数据集上三种实体匹配方法的精确率、召回率、F1分数和准确率对比。进行了一项错误分析,比较了零样本LLM预测与基于规则的基准方法。在2,194对数据中,两种方法一致且正确的有2,022对。基于规则方法正确而LLM错误的有67对,LLM正确而基于规则方法错误的有64对,两种方法均错误的有41对。
相似文章
人类与LLM标注中的挑战:以评价性语言为例
本文比较了受训中的语言学家、一位训练有素的语言学家和LLM在使用评价理论标注评价性语言时的表现,发现LLM表现出色,能够辅助完成复杂的标注任务。
LLM作为数据标注者的有效性:AMALIA关于权威的研究
本文探讨了将LLM用作数据标注者的有效性,重点关注葡萄牙为欧洲葡萄牙语开发的AMALIA-9B模型。研究发现,虽然该模型与人类编码者表现出一致性,但其对表面相关性的依赖引发了对构念效度的担忧,这对主权LLM项目具有启示意义。
大语言模型能否进行具有法律意义的推理?基于欧洲人权法院案例的小规模研究
本小规模研究通过欧洲人权法院案例评估了大语言模型在法律案件预测中的推理能力,发现模型能够生成结构完整但实质浅薄的分析,且基于大语言模型的评估器与人类标注者的一致性较低。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。