PACT,LLM 正面交锋谈判基准。20 轮买卖双方议价博弈:每轮 AI 可互发消息,买方提交出价,卖方提交要价。若出价 ≥ 要价,则以中间价成交。涵盖数千场对局。
摘要
PACT 推出了针对 LLM 的对抗性谈判基准测试,通过 20 轮买卖双方议价博弈来评估模型的说服力与适应能力。顶尖模型包括 GPT-5.5 和 Opus 4.7,评分由 Glicko-2 算法计算,并采用类 Elo 评分体系展示。
相似文章
When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains
This paper studies how LLM agents negotiate in a dynamic supply chain bargaining problem, benchmarking nine models from OpenAI, Google, and Alibaba against a Bayesian equilibrium and finding that capability, provider identity, and prompt design shape surplus creation and division.
LLM代理是否理性谈判?一个基于A2A/MCP的可验证多代理交互机制设计框架
本文提出了一种机制设计框架,用于验证使用A2A/MCP协议的LLM代理中的谈判和分配任务。它评估了多个模型的理性行为,发现机制级的激励兼容性并不会自动转移到LLM代理上。
CollabBench:通过主动参与与多样玩家基准测试并释放LLM协作能力
CollabBench是一个新的基准测试,用于评估和训练LLM智能体在合作游戏中的表现,具有多样玩家模拟和协作训练范式。实验表明,与基础模型相比,效率提高19.5%,情感性能提升24.4%。
Show HN:Mediator.ai —— 运用纳什谈判博弈与 LLM 使公平协商流程化
Mediator.ai 是一款将纳什谈判博弈论与 LLM 相结合的工具,旨在促进公平的协作式谈判。它会基于双方明确的需求生成并评估候选协议,直至找到最优解。
人人皆独特:面向催收的行为异质性协商对话系统
本文介绍了DebtBench——首个针对催收协商的个性化基准测试,以及DebtGPT——一个同时优化财务回收与交互体验的催收代理。实验表明,大多数大型语言模型在这一真实场景中表现不佳,而DebtGPT达到了与GPT-4o相当的性能。