PACT,LLM 正面交锋谈判基准。20 轮买卖双方议价博弈:每轮 AI 可互发消息,买方提交出价,卖方提交要价。若出价 ≥ 要价,则以中间价成交。涵盖数千场对局。

Reddit r/singularity 工具

摘要

PACT 推出了针对 LLM 的对抗性谈判基准测试,通过 20 轮买卖双方议价博弈来评估模型的说服力与适应能力。顶尖模型包括 GPT-5.5 和 Opus 4.7,评分由 Glicko-2 算法计算,并采用类 Elo 评分体系展示。

PACT 在不完全信息环境下测试谈判能力,涵盖说服力、承诺、欺骗、锚定效应、威胁以及多轮重复中的适应性。更多信息、对局日志与图表见:[https://github.com/lechmazur/pact](https://github.com/lechmazur/pact)。排名前 5 的模型为 GPT-5.5、Opus 4.7、DeepSeek V4 Pro、Gemini 3.1 Pro 和 Kimi K2.6。请注意,不同模型的对手阵容组合各不相同,且诸如“每轮平均利润”等图表未对此进行控制。评分由 Glicko-2 算法计算,采用类 Elo 评分体系展示,新上榜模型起始分为 1500。
查看原文

相似文章

人人皆独特:面向催收的行为异质性协商对话系统

arXiv cs.AI

本文介绍了DebtBench——首个针对催收协商的个性化基准测试,以及DebtGPT——一个同时优化财务回收与交互体验的催收代理。实验表明,大多数大型语言模型在这一真实场景中表现不佳,而DebtGPT达到了与GPT-4o相当的性能。