Lines and Ladders:一种面向大规模零售价格分类法的上下文感知多智能体框架
摘要
这篇来自沃尔玛全球技术的arXiv论文提出了一种上下文感知的多智能体框架,可自动构建大规模零售目录的“Lines and Ladders”定价分类法,在生产环境中取得了优异的F1值和精确率。
查看缓存全文
缓存时间: 2026/08/14 09:27
# 线条与阶梯:面向大规模零售价格分类法的上下文感知多智能体框架 来源:https://arxiv.org/html/2608.12674 Ravi Teja ChunduriSrikaran Reddy Boya隶属机构:沃尔玛全球技术,美国阿肯色州本顿维尔 Srikaran\.Reddy\.Boya@samsclub\.comDeep Narayan Mishra隶属机构:沃尔玛全球技术,美国加利福尼亚州桑尼维尔 deep\.mishra@walmart\.comAjay Kumar B隶属机构:沃尔玛全球技术,美国华盛顿州西雅图 Ajay\.Kumar10@walmart\.comKarthik Kumaran隶属机构:沃尔玛全球技术,美国加利福尼亚州桑尼维尔 karthik\.kumaran@walmart\.comPranay Kona隶属机构:沃尔玛全球技术,美国加利福尼亚州桑尼维尔 pranay\.kona@walmart\.com ###### 摘要 对于全球零售商而言,保持价格一致性并执行“天天低价”策略至关重要。然而,面对数百万个在售商品的目录,人工管理价格关系是不可行的。商品变体之间的定价不一致会扭曲客户的价值感知,并蚕食销售额。为解决这一问题,我们提出了一种可扩展的、上下文感知的多智能体框架,旨在自动构建“线条与阶梯”定价分类法。我们的框架采用专门的LLM智能体,通过识别关键属性、提取多模态值以及应用分层分组逻辑,来构建这些连贯的定价结构。该系统已在实际企业数据上完成评估并部署到生产环境。我们的3智能体系统在“线条”任务上取得了0.83的F1分数,优于单智能体基线,同时减轻了认知过载。该系统在食品与消耗品类别中实现了>90%的精确率和>75%的召回率,在非结构化的日用商品目录中实现了80.2%的分配准确率。 ###### 索引术语:多智能体系统、分类法构建、多模态信息提取、产品聚类、电子商务 © 2026 IEEE。允许个人使用此材料。所有其他用途,包括以任何当前或未来媒体形式转载/重新发布此材料用于广告或促销目的、创建新的汇编作品、转售或再分发到服务器或列表,或在此作品中以其他方式重用任何受版权保护的组件,都必须获得IEEE的许可。 ## I引言 零售定价直接决定零售商的核心盈利能力[13 (https://arxiv.org/html/2608.12674#bib.bib8)]。为了保持一致性,零售商将产品组织为“线条与阶梯”——一种按特征、质量和业务背景对商品进行分组的逻辑层级结构[11 (https://arxiv.org/html/2608.12674#bib.bib9)]。传统上,这些结构由专家主导的人工流程创建,品类经理基于深厚的领域知识做出决策[1 (https://arxiv.org/html/2608.12674#bib.bib10)]。然而,这种方法本质上是静态的,无法满足现代零售目录的动态特性。对于全球零售商而言,价格治理的复杂性呈非线性增长。面对数百万个在售商品,高SKU周转率使得人工监管不可行。核心问题不仅在于商品数量,还在于目录数据的不一致性和非标准化特性所造成的运营瓶颈。当商品间关系被忽略时,不合理的定价差距就会出现,导致客户套利[16 (https://arxiv.org/html/2608.12674#bib.bib11)] [9 (https://arxiv.org/html/2608.12674#bib.bib16)]。在未受管理的目录中,我们经常观察到两种差距:变体不一致(例如,相同的自行车仅因颜色不同而定价为238美元与199美元)和数据差异(例如,镜子尺寸中0.1英寸的笔误造成7.50美元的差价)。为应对这一可扩展性挑战,我们提出了一种上下文感知的多智能体框架。与传统的基于规则的系统不同,我们的方法利用专门的智能体自动将产品聚类为有意义的“线条与阶梯”。该系统自动识别和提取每个ProductType所定制的关键属性。我们利用这一架构在规模上模拟和复制人类专家的决策逻辑[14 (https://arxiv.org/html/2608.12674#bib.bib12)]。该框架服务于自动化价格治理的首要目标,为下一代自主定价系统(如算法需求预测和动态定价模型)奠定结构基础[7 (https://arxiv.org/html/2608.12674#bib.bib13)]。本文的主要贡献总结如下: - •形式化分类法构建:我们通过3智能体架构将定价治理分解为相似性与差异发现。 - •可扩展的多模态执行:我们详细介绍了一个利用多模型路由策略的分布式流水线,以高效处理数百万个商品。 - •验证工业效能:我们提供了广泛的消融研究和发布后指标,证明了该系统在实际企业环境中的可扩展性和运营影响力。 ## II相关工作 “线条与阶梯”的概念在零售战略中已间接确立数十年。Dean[4 (https://arxiv.org/html/2608.12674#bib.bib1)]最初将“价格线”定义为以特定、不同的价格点提供一系列产品,以向消费者传达不同质量水平的做法。尽管关于产品线定价问题已有大量文献,Guiltinan[8 (https://arxiv.org/html/2608.12674#bib.bib2)]对此进行了全面综述,但我们的工作解决的是一个根本不同的挑战。与专注于设定价格的数学优化的传统方法不同,我们的目标是根据质量和特征自动将海量目录聚类为连贯的产品线。这种结构组织是可扩展价格治理的前提,而不是价格设定本身。“阶梯”是一个较新的术语,可以有多种解释。Dobbs[5 (https://arxiv.org/html/2608.12674#bib.bib5)]将阶梯描述为一种批发定价合同形式,其中批发价格取决于零售价格,从而促进制造商进行分层定价。在营销语境中,价格阶梯化与价格线密切相关,通常涉及“好-更好-最佳”策略[10 (https://arxiv.org/html/2608.12674#bib.bib4)]。此外,“攀登阶梯”的概念指的是激励客户在所提供的商品集中升级到更高质量产品的策略,如[3 (https://arxiv.org/html/2608.12674#bib.bib7)]和[15 (https://arxiv.org/html/2608.12674#bib.bib6)]所述。Draganska和Jain[6 (https://arxiv.org/html/2608.12674#bib.bib3)]进一步区分了垂直和水平产品差异化。在垂直差异化中,产品因质量而异;而在水平差异化中,企业提供的产品在气味、颜色或口味等特征上有所不同,而非质量。他们的实证分析证实,产品线可以作为有效的价格歧视工具,验证了基于质量对不同产品线定价、同时将变体(例如口味或颜色)统一定价的常见策略。虽然文献中对阶梯给出了各种定义,但在大规模零售的背景下,我们特别将阶梯定义为数量激励。因此,在本文中,我们将“数量折扣阶梯”简称为阶梯。尽管这些概念解释了战略上的“为什么”,但它们未能解决海量非结构化数据在运营上的“如何做”。前LLM(大型语言模型)方法依赖于结构化表格数据和大量特征工程[12 (https://arxiv.org/html/2608.12674#bib.bib15)],而现代零售目录的异构性使得这种工作流程不切实际。跨数百万个商品标准化属性所需的人工工作几乎是不可能的。LLM带来了范式转变,使得直接解释非结构化文本和图像、在规模上自动化特征提取成为可能。 ## III方法论 为克服人工治理的局限性,我们提出了一种上下文感知的多智能体框架。我们避免使用单一提示的方法,因为它会产生不稳定的输出。相反,该系统利用专门的LLM执行双管齐下的分析,从非标准化数据中发现关键属性。 ### III-A问题定义与范围界定 设C=\{i_1,i_2,...,i_N\}为包含N个商品的目录,每个商品具有原始元数据R_i(例如,标题、描述、图像)。如图1 (https://arxiv.org/html/2608.12674#S3.F1)所示,我们将每个商品映射到一个线条(L_k):一个共享功能等价性的商品子集(例如,仅口味或颜色不同的相同商品),其中∀i_a,i_b∈L_k⟹Price(i_a)=Price(i_b),并且线条聚合成一个阶梯(M_j):一组通过基于价值的差异化(例如,体积、包装规格)相连的线条,执行分层定价逻辑,其中Volume(L_a)>Volume(L_b)⟹UnitPrice(L_a)<UnitPrice(L_b)。自动构建此分类法需要为每个ProductType生成一组判别性属性。我们在图2 (https://arxiv.org/html/2608.12674#S3.F1)中展示了所提出的架构。最近关于LLM驱动提取的工作[2 (https://arxiv.org/html/2608.12674#bib.bib14)]证明,LLM从非结构化输入中发现模式的能力显著优于传统训练模型。受此启发,我们的架构由以下部分组成: - •上下文感知多智能体识别器(Ψ_identify):此过程发现判别性属性A_pt,并定义用于分组的可操作特征。 - •多模态属性提取器(f_LLM):此系统从原始元数据中提取属性值。 - •属性清洁器与标准化器(Ψ_std):此组件通过标准化和插补减少提取噪声。 - •线条与阶梯聚类器(Ω):此组件将标准化信息转换为连贯的分类结构。 ### III-B上下文感知多智能体识别器(Ψ_identify) 我们引入了一个3智能体系统,其中每个智能体具有不同的角色,并迭代处理输入以发现关键属性。 #### III-B1智能体1:属性架构师 此智能体执行三个顺序步骤: - •步骤1(上下文上下文生成):输入到步骤1的是商品标题、描述和图像样本。输出是ProductType感知的上下文提示,C_context。提示有效载荷包括分类法元数据(商品目录层级结构、品类、ProductType)、商品样本批次(尺寸B_cat×大小S)、图像模式和零售业务规则。 - •步骤2(种子生成):使用上下文提示C_context,智能体1生成一组候选判别性属性,A_candidate = {a_1, a_2, ..., a_m}。每个a_j进一步结构化为{"attr_name", "values", "attr_type"},其中attr_type表示分类、数值、多值或语义类型。 - •步骤3(关键性分类):基于目标策略和输入上下文,将A_candidate分类为关键(A_pt ⊆ A_candidate)或辅助(A_aux)属性。 #### III-B2智能体2:属性评价器与细化器 此智能体执行两个关键任务: - •冲突解决:审查集成指令(即A_candidate)的分歧。 - •综合提炼:通过应用零售验证规则来细化属性,确保判别性特征可操作。 给定候选属性A_candidate,智能体2使用可操作的提示策略对其进行逐步评估,并向智能体1提供结构化修订请求。此反馈循环扩展了发现空间,并确保识别出的属性既与零售业务规则保持一致,又具有判别力。 #### III-B3智能体3:最终判定器 在智能体1和智能体2收敛后,智能体3提供与业务策略对齐的最终决策。此外,当历史偏差被识别时,它会驳回或覆盖建议的属性。此层级结构支持灵活的模式生成,模拟人类专家优先考虑属性的方式。 ### III-C多模态属性提取器(f_LLM) 为了从一个非结构化、异构的目录中提取属性值,我们使用多模态LLM进行零样本提取。受[2]启发,我们利用图像和文本信息。对于每个商品i,提取函数定义为: f_LLM: (R_i, A_pt, S_pt) → V_i 其中R_i表示原始元数据,A_pt是识别的属性,S_pt是每个ProductType的提示策略。输出V_i = {v_1, v_2, ..., v_p}是每个属性的提取值集合。此方法使得每个ProductType的表达方式具有特异性,例如,玻璃杯的“material”与金属水瓶的“material”可能不同。 ### III-D属性标准化(Ψ_std) 由于LLM提取可能引入格式偏差,我们应用数据清洁与标准化流水线Ψ_std = (N_syn ∪ N_num ∪ N_del)来规范化提取的属性值: - •同义词归一化(N_syn):解析上下文别名以确保一致表示,特别是对于品牌产品。 - •数值归一化(N_num):对不同数值格式、单位和粒度进行标准化。 - •清理(N_del):移除无关噪音和提示痕迹。 应用此流水线可提高数据质量,并为分类奠定基础。 ### III-E基于提示的发现稳定性 我们设计了Ψ_identify以在单次运行中完成识别,确保方法可扩展。每个智能体以角色指定的输入开始,并生成结构化输出。然而,与直接推理不同,智能体3主动将最终输出与业务策略进行对比,从而赋予最终输出可审计的、可验证的属性。 ### III-F分类法构建(Ω) 在提取、标准化之后,我们采用两阶段层次分组逻辑来构建线条和阶梯。 #### III-F1属性归约与插补 对于每个ProductType,我们使用针对p_pt的上下文感知归约来筛选所选属性A_pt: - •特征归约:在预定义阈值内剔除具有>65%缺失率或>70%基数的特征;保留较稀疏的特征持续导致产品线的人为碎片化。保留属性中的缺口使用S_pt默认值进行插补。 - •数值分箱:为处理数值方差,我们应用ε邻域聚类。根据严格的业务要求,将5%容差内的值(例如,12.0盎司与12.3盎司)合并为单一离散值v_bin。 #### III-F2分层分组逻辑 设A_cat为分类属性集合,A_num为数值/体积属性集合。 - •线条生成:商品按完整集合A_total = A_cat ∪ A_num进行分组。每个唯一组合形成一个线条(L_k),并分配一个持久UUID: L_k={i∈C | V_i(A_total)=const} - •阶梯生成:通过排除A_num放宽约束,我们按A_cat进行分组,将线条聚类为阶梯(M_j),连接仅在尺寸或包装数量上不同的商品: M_j={i∈C | V_i(A_cat)=const} 因此,阶梯被定义为其组成线条的并集:M_j=⋃_k L_k。此逻辑自动组织目录,将功能等价的商品放入线条,并通过基于体积的阶梯将它们连接起来。 ### III-G人在回路反馈机制 尽管多智能体框架提供了稳健的基线,但LLM固有的随机性以及业务战略的特殊性(例如,在母品牌级别对软饮料进行定价)需要人工干预。我们引入了一个人在回路(HITL)机制,将商家修正捕获为高质量标签信号。此反馈更新特定ProductType的上下文记忆,P_context,旨在推动未来的流水线优化。 - •战略对齐:智能体1和智能体2将学习根据商家偏好优先或忽略属性。 - •模式细化:智能体3将更新其合并逻辑,以尊重特定业务的命名约定并优化提取提示。 随着P_context的积累,智能体会召回这些修正,以确保后续运行与已建立的业务逻辑保持一致,从而使系统逐步演变为领域适应型专家。虽然这种HITL架构成功捕获了即时的战略意图,但量化系统向专家级行为收敛的长期表现仍是我们在部署环境中持续进行实证验证的一个领域。 ## IV规模部署 该系统部署在分布式计算集群上,以实现水平可扩展性和容错性(图8 (https://arxiv.org/html/2608.12674#S4.F8)),由刷新编排器管理,支持两种执行模式:全量刷新(重新计算属性模式)和增量刷新(重用持久化模式进行稳态更新)。参见图8说明:线条与阶梯系统设计 ### IV-A分布式流水线架构 按部门→ProductType分解流水线可实现独立的故障域。为了在规模上平衡推理能力和成本,我们采用多模型路由策略,使用前沿商业多模态LLM的安全企业托管部署: - •多智能体属性识别器:协调三个智能体。推理密集型任务(模式生成、冲突解决)被路由到专有的、企业托管的前沿LLM(在规模和能力上可与>100B参数指令调优的“思考”模型相媲美)。一个低延迟RDBMS实现持久记忆(P_context),使用确定性SQL查询来检索历史商家规则并注入到提示中。为防止上下文溢出,注入的历史信息被严格截断为自上次全量刷新以来收集的反馈。由于企业保密要求,无法披露确切的商业模型名称。然而,所有智能体均使用最先进的前沿模型,并将温度严格设置为0以最大化确定性。 - •多模态属性提取器:执行提取函数f_LLM。为了处理数百万个商品,提取被路由到来自同一系列的高效、成本优化的多模态模型(规模类似于7B-13B参数的视觉语言模型),专为高吞吐量、低延迟执行而设计。 - •属性清洁器与标准化器:通过流水线Ψ标准化值。一个基于SQL的语义缓存存储同义词映射(例如,“Soy”→“Soy Wax”),以优化延迟并减少增量刷新期间的冗余LLM调用。 - •线条与阶梯聚类:使用层次逻辑(第3.6.2节)将标准化向量转换为线条(L_k)和阶梯(M_j)。 ### IV-B异步反馈循环 人工验证采用事件驱动架构。商家UI修正向分布式消息总线发出事件,智能反馈分类器按错误类别对其进行路由: - •缺失属性→触发智能体细化。 - •提取错误→更新提取器提示。 - •标准化错误→更新SQL缓存。 - •战略决策→更新记忆P_context。 ### IV-C性能与可扩展性 我们使用10个工作节点在30分钟内处理了约1,700个ProductType(约100万件商品)。 - •吞吐量:分布式实现支持在可用LLM配额内实现工作节点的线性扩展。 - •成本优化:LLM推理占支出主导(约4K个token/商品)。识别阶段的微批处理和采样显著降低了成本。 - •可观测性:结构化日志支持部分重跑和ProductType级别的回归分析。 该架构在可持续的成本范围内保持严格的目录新鲜度SLA。 ## V实验评估 为验证该框架,我们评估了架构消融、结构准确性和发布后的业务影响。 ### V-A架构消融 为证明多智能体设计的合理性,我们在14个类别中进行了消融研究。我们特别评估零样本LLM架构,而非传统的监督命名实体识别(NER)模型(例如,微调的BERT)。零售目录需要动态模式生成(例如,为蜡烛提取“wax_type”,但为搅拌机提取“motor_power”);因此,为每个可能类别训练和维护静态模型在实践和成本上都不可行。相似文章
An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals
Presents an emerging retail portfolio management application that uses personalized, tax-aware reinforcement learning with natural language goal input, featuring a three-phase pipeline and integration with live brokerage APIs.
索引不可读之物:LLM原生的递归构建与服务分类检索
本文提出 A2X,这是一个 LLM 原生的流水线,用于递归构建和搜索分层服务分类体系,以克服在智能体互联网中进行服务发现时 LLM 有效上下文窗口受限的问题。与全上下文和基于嵌入的基线相比,它显著提高了检索准确性并降低了 token 消耗。
市场目录的自动研究:从遗留表单到AI原生匹配
本文提出一个自动研究循环,用于在服务市场中生成服务提供者偏好分类法,利用大语言模型从遗留表单过渡到AI原生匹配,并展示了来自一个主要U.S.市场的部署结果。
E-Commerce Bench:针对长期自主业务运营的LLM代理评估基准
E-Commerce Bench是一个开源基准,用于评估LLM代理在电子商务中长期自主业务运营的能力,特色包括多店铺谈判和模拟一年内的动态事件。
Agent Bazaar:在多智能体市场中实现经济对齐
介绍Agent Bazaar,一个用于评估LLMs经济对齐的多智能体模拟框架,识别出算法不稳定性和Sybil欺骗等失败模式,并通过针对性强化学习训练出一个超越前沿模型的9B模型。