多买家市场中的策略性议价:基于可验证奖励的强化学习用于大语言模型谈判
摘要
本文提出一个框架,利用基于可验证奖励的强化学习来训练大语言模型,用于多买家市场中的策略性议价,解决并发谈判中的私有信息和剩余抽取问题。
查看缓存全文
缓存时间: 2026/07/08 04:45
# 1 引言 来源:https://arxiv.org/html/2607.05863 在管理科学和运筹学领域,谈判是一项基础性过程,是价格非静态环境下价值发现与资源配置的主要机制(Simchi-Levi 等,2005 (https://arxiv.org/html/2607.05863#bib.bib21),Backus 等,2020 (https://arxiv.org/html/2607.05863#bib.bib53))。从采购与供应链签约到争端解决和在线市场,代理必须进行策略性互动以协调并实现交易收益(Cachon and Lariviere,2001 (https://arxiv.org/html/2607.05863#bib.bib20),Desai and Purohit,2004 (https://arxiv.org/html/2607.05863#bib.bib14))。在管理科学文献中,对这些策略互动的分析主要聚焦于协调分散化激励并消解交易伙伴间的信息差距(Nagarajan and Sošić,2008 (https://arxiv.org/html/2607.05863#bib.bib18),Lovejoy,2010 (https://arxiv.org/html/2607.05863#bib.bib19))。任何谈判中的核心挑战在于,代理拥有私有信息——具体而言,卖方有愿意接受的最低成本,买方有愿意支付的最高预算——这些信息对对方是隐藏的(Chatterjee and Samuelson,1983 (https://arxiv.org/html/2607.05863#bib.bib52))。要在这些不对称条件下获取有意义的价值,卖方必须保持严格的策略纪律。这要求同时执行多项任务:实施私有成本边界以防止亏损交易,解读买方信号以提取最大市场剩余,以及与买方有效协调以确定共同价格点并达成交易。虽然经典文献通常关注双边(一对一)交易(Nash 等,1950 (https://arxiv.org/html/2607.05863#bib.bib50),Rubinstein,1982 (https://arxiv.org/html/2607.05863#bib.bib74),Chatterjee and Samuelson,1983 (https://arxiv.org/html/2607.05863#bib.bib52)),但在现代管理中一个极为常见的情境是并发谈判,即一个焦点卖方同时在多个独立的密封渠道中与多个买方互动(Backus 等,2020 (https://arxiv.org/html/2607.05863#bib.bib53))。这种并行结构是 eBay 等数字市场和 B2B 采购平台的核心,在这些平台上,卖方通过与潜在买方池进行谈判来分配可用资产或供应合同(Backus 等,2020 (https://arxiv.org/html/2607.05863#bib.bib53))。关键的是,由于卖方在这些并行渠道中的通信能力有限,其面临着探索与利用之间的基本权衡。卖方无法与每个参与者进行漫长的谈判周期;相反,它必须平衡广泛的市场筛选以识别具有最高隐藏估值的交易对手,以及集中的单一买方谈判以最大化剩余提取。当在这些环境中部署自主或自动化代理作为公司的直接代表时,未能找到最优合作伙伴或与早期出价者达成微薄利润会导致组织价值的直接损失。 为了大规模管理这些并发谈判,企业正在积极部署大型语言模型(LLMs)作为自主谈判代理。在 Facebook Marketplace 等数字平台上,自动化工具通过管理同时进行的价格查询并在独立买家渠道中起草实时报价来协助用户(Meta,2026 (https://arxiv.org/html/2607.05863#bib.bib2))。同样,在企业采购中,沃尔玛等零售巨头利用自动化谈判系统与数千家尾端供应商执行具有约束力的合同,绕过了人类采购团队的能力限制(Van Hoek 等,2022 (https://arxiv.org/html/2607.05863#bib.bib3))。然而,这些当前实现主要作为旨在最小化对话摩擦的被动文本过滤器(Meta,2026 (https://arxiv.org/html/2607.05863#bib.bib2)),而非策略性收益管理系统(Gallego and Hu,2014 (https://arxiv.org/html/2607.05863#bib.bib10))。面对有限的通信预算,代理的首要任务不是对话流畅性,而是利用对话来筛选隐藏的买方估值,并通过将沟通努力分配给最高价值的对手方来保护利润率。 我们的分析揭示,这种所需的策略纪律与前沿通用模型的操作行为之间存在关键的错配。虽然标准 LLM 擅长维持对话流畅性,但它们通常表现出一种“随和偏差”,即以牺牲整体经济剩余为代价最大化交易总量(Ouyang 等,2022 (https://arxiv.org/html/2607.05863#bib.bib76),Perez 等,2023 (https://arxiv.org/html/2607.05863#bib.bib27),Sharma 等,2024 (https://arxiv.org/html/2607.05863#bib.bib1))。由于这些模型通过基于人类反馈的强化学习进行优化以追求礼貌与合作,它们倾向于做出次优让步,而不是调查买方池以发现隐藏的高估值。因此,这种偏差将其对话流畅性变成了财务负担,阻止代理最大化捕获的剩余。 本文针对这些局限性展开研究。我们做出三项主要贡献: 1. **一个用于评估探索-利用权衡的并发谈判框架(第3节 (https://arxiv.org/html/2607.05863#S3))。** 我们建立了一个结构化环境,卖方通过私密的一对一沟通渠道与预算多样的多个买方同时进行谈判。该设置使我们能够衡量代理在有限沟通轮次下平衡策略性发现高预算买方与集中谈判以提取剩余的能力。 2. **一项识别前沿LLM探索失败的行为分析(第5节 (https://arxiv.org/html/2607.05863#S5))。** 我们证明,即使是最先进的通用模型,包括具有专门推理能力的模型,也无法在多买家环境中最大化剩余。我们的结果揭示了一种系统性倾向:专注于早期高报价而非调查更广泛的买方池以识别具有更高私有预算的买方,从而导致达成次优交易。 3. **一种利用可验证奖励强化学习(RLVR)训练策略代理的专门配方(第4节 (https://arxiv.org/html/2607.05863#S4))。** 我们证明,可验证奖励强化学习(RLVR)能有效弥合对话流畅性与策略效用之间的差距。我们的公式利用客观经济结果——特别是交易剩余——以及严格的指令遵循协议来指导学习过程。我们的结果表明,该方法能够催生主动的市场发现机制,如诊断性探查和价格锚定,使代理即使在面对不熟悉的买方行为和未见过的预算分布时也能识别有利可图的合作伙伴。 本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.05863#S2) 回顾了管理科学中的谈判与LLM代理的相关工作。第3节 (https://arxiv.org/html/2607.05863#S3) 将并发谈判环境形式化为马尔可夫决策过程,并详细说明代理系统。第4节 (https://arxiv.org/html/2607.05863#S4) 分析了强化学习训练过程中观察到的行为演变和阶段转换。第5节 (https://arxiv.org/html/2607.05863#S5) 展示了与前沿模型在分布内性能基准测试中的比较结果,第6节 (https://arxiv.org/html/2607.05863#S6) 评估了我们代理的策略鲁棒性和市场泛化能力。最后,第7节 (https://arxiv.org/html/2607.05863#S7) 讨论了我们发现的更广泛策略意义,第8节 (https://arxiv.org/html/2607.05863#S8) 对全文进行总结。 ## 2 相关工作 我们将相关文献组织为以下几个流:管理科学中的谈判、LLM作为策略代理的评估、自动化谈判系统、语言模型的强化学习,以及经典谈判理论的基础。 ### 2.1 管理科学与运营中的谈判 在管理科学中,谈判是价格发现和供应链协调的基本机制,特别是当企业缺乏对合作伙伴私有成本或保留阈值的直接可见性时。管理科学的研究广泛评估这些谈判动态,以优化在信息不对称环境下采购和产能合同中的激励对齐。传统管理科学文献通常通过筛选菜单、策略性信息共享框架或去中心化网络来解决这些信息差距,以重新分配议价能力(Cachon and Lariviere,2001 (https://arxiv.org/html/2607.05863#bib.bib20),Lu 等,2006 (https://arxiv.org/html/2607.05863#bib.bib5),Nagarajan and Sošić,2008 (https://arxiv.org/html/2607.05863#bib.bib18),Lovejoy,2010 (https://arxiv.org/html/2607.05863#bib.bib19))。此外,当库存有限且买家具有策略性时,谈判与经典产能合同和收益管理深度交织,因为卖方必须预测合作伙伴估值和成本视野如何随时间变化(Aviv and Pazgal,2008 (https://arxiv.org/html/2607.05863#bib.bib16),Su,2010 (https://arxiv.org/html/2607.05863#bib.bib17));这种运营紧张关系需要定制化合同,调整支付时机以平衡各供应链阶段的库存选择与财务成本(Tong 等,2020 (https://arxiv.org/html/2607.05863#bib.bib11))。 在数字平台和零售运营中,市场格局已迅速从静态标价转向高度响应、竞争性的动态定价框架(Gallego and Hu,2014 (https://arxiv.org/html/2607.05863#bib.bib10),Wang and Hu,2014 (https://arxiv.org/html/2607.05863#bib.bib7),Ban and Keskin,2021 (https://arxiv.org/html/2607.05863#bib.bib4)),同时伴随着多轮双边谈判和顺序清算过程(Desai and Purohit,2004 (https://arxiv.org/html/2607.05863#bib.bib14),Backus 等,2020 (https://arxiv.org/html/2607.05863#bib.bib53))。这一转变根本性地改变了平台资源分配、跨期价格歧视以及市场剩余的策略性分布。大规模实证市场数据证实,顺序反报价占在线交易的很大一部分,将多轮对话确立为价格发现的主要渠道(Backus 等,2020 (https://arxiv.org/html/2607.05863#bib.bib53),Bergemann 等,2026 (https://arxiv.org/html/2607.05863#bib.bib54))。 我们的工作位于这些领域的交叉点,通过对一个并发市场结构进行建模,其中单个卖方必须将有限数量的沟通轮次分配给多个独立的、私密的谈判渠道。这一同时挑战与收益管理流一致,该流表明企业通过同时而非顺序执行学习与运营行动来最大化绩效(Agrawal 等,2014 (https://arxiv.org/html/2607.05863#bib.bib6),Wang 等,2014 (https://arxiv.org/html/2607.05863#bib.bib8))。在此框架下,通过策略性互动收集市场数据成为保护保留成本和确保整体盈利能力的一项核心要求(Guo,2023 (https://arxiv.org/html/2607.05863#bib.bib13))。为了在不依赖严格结构假设的情况下应对这一高维环境,我们的方法建立在将数据驱动的规范性分析与机器学习直接集成到运营决策规则中的日益增长范式之上(Ban and Rudin,2019 (https://arxiv.org/html/2607.05863#bib.bib9))。 ### 2.2 LLM作为谈判与策略代理 近期研究越来越多地将大型语言模型(LLMs)用作自主代理,应用于从工具辅助推理到复杂决策任务的目标导向场景(Yao 等,2022 (https://arxiv.org/html/2607.05863#bib.bib37),Liu 等,2024 (https://arxiv.org/html/2607.05863#bib.bib38),Wang 等,2024a (https://arxiv.org/html/2607.05863#bib.bib93),Zeng 等,2024 (https://arxiv.org/html/2607.05863#bib.bib36))。然而,系统性评估揭示了它们策略推理和操作逻辑中的显著行为缺陷。Xia 等 (2024 (https://arxiv.org/html/2607.05863#bib.bib96)) 发现前沿模型经常违反谈判理性的原则,且易受对抗性压力影响;而 Davidson 等 (2024 (https://arxiv.org/html/2607.05863#bib.bib82)) 记录了它们在多轮互动中无法保持一致的策略目标。此外,通用LLM常常难以管理合作与竞争之间的张力,而这正是有效谈判的核心要求(Fu 等,2023 (https://arxiv.org/html/2607.05863#bib.bib89))。为评估这些能力,Bianchi 等 (2024 (https://arxiv.org/html/2607.05863#bib.bib84)) 建立了一个平台来分析通用模型如何应对谈判动态。随后,Bergemann 等 (2026 (https://arxiv.org/html/2607.05863#bib.bib54)) 和 Liu 等 (2026 (https://arxiv.org/html/2607.05863#bib.bib56)) 证明,专门的强化学习可以增强代理在双边(一对一)交易中的策略能力。 虽然这些现有方法局限于双边谈判环境,但我们开发了一种用于并发多买家市场的强化学习方法。这使得我们能够解决一种系统性的市场探索失败问题:前沿模型固守即时报价而非调查替代候选者。与纯粹的一对一训练不同,我们的方法使代理能够解决市场发现与价值提取之间更广泛的张力。
相似文章
When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains
This paper studies how LLM agents negotiate in a dynamic supply chain bargaining problem, benchmarking nine models from OpenAI, Google, and Alibaba against a Bayesian equilibrium and finding that capability, provider identity, and prompt design shape surplus creation and division.
从被动代理人到战略谈判者:使用 SocialRL 强化小型语言模型中的社会推理能力
本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。
多智能体协商中基于对手建模的偏好估计
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
A3M: 自适应、对抗性与多目标学习用于重复拍卖中的战略投标
介绍了A3M,一个结合自适应深度强化学习、对抗性推理和多目标奖励设计的框架,用于重复拍卖中的战略投标,实现了30-40%的遗憾降低。
LLM代理是否理性谈判?一个基于A2A/MCP的可验证多代理交互机制设计框架
本文提出了一种机制设计框架,用于验证使用A2A/MCP协议的LLM代理中的谈判和分配任务。它评估了多个模型的理性行为,发现机制级的激励兼容性并不会自动转移到LLM代理上。