PrefBench:评估零样本LLM智能体在隐藏偏好个性化定价谈判中的表现
摘要
PrefBench是一个新基准,旨在评估零样本LLM智能体在具有隐藏偏好的个性化定价谈判中的表现,考察它们在谈判场景中推断和适应用户偏好的能力。
arXiv:2605.22855v1 Announce Type: cross \n摘要:个性化定价谈判是LLM智能体的一个具有挑战性的测试平台,因为成功的交互并不能保证盈利决策。卖家可能采取有效行动并达成许多交易,但当买家支付意愿和讨价还价特征隐藏时,仍可能定价不当。本文提出了PrefBench,一个基于模拟器的基准测试,用于隐藏偏好个性化定价谈判。每个回合将一个模拟买家与一个固定的车辆定制捆绑包配对;卖家观察公开的角色描述、捆绑包信息和谈判历史,而潜在买家变量则影响估值、耐心、还价行为和退出决策。PrefBench通过一个面向LLM的状态摘要协议来评估这一设置,该协议约束智能体在固定的隐藏信息边界下返回严格的JSON动作。我们在7,500个回合中评估了零样本LLM卖家与启发式基准的表现。测试的LLM可靠地遵循协议,交易率超过0.99,但其卖家利润结果仍然较弱:最佳LLM平均利润仅略高于随机基线,远低于相同回合流下的简单让步启发式。这些结果表明,结构化动作合规和寻求协议的行为可以与弱利润敏感谈判共存。PrefBench为评估隐藏买家偏好下的定价智能体行为提供了一个受控基准。
查看缓存全文
缓存时间: 2026/05/25 09:01
# PrefBench:在隐藏偏好个性化定价谈判中评估零样本LLM代理 来源:https://arxiv.org/abs/2605.22855 书目工具 ## 书目与引用工具 书目浏览器 切换 代码、数据、媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和共享新的arXiv功能。 与arXivLabs合作的个人和组织均已接受并认同我们的开放、社区、卓越和用户数据隐私价值观。arXiv致力于这些价值观,仅与遵守这些价值观的合作伙伴合作。 有一个能为arXiv社区增值的项目的想法?**了解更多关于arXivLabs** (https://info.arxiv.org/labs/index.html)。
相似文章
POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准
POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。
Ψ-Bench:评估说服性对话中的人设敏感影响
介绍Ψ-Bench,一个用于评估大语言模型通过带有个人档案的说服性对话影响用户能力的基准。测试了10个前沿LLM,发现仍有显著改进空间,而访问档案平均提升18.24%的性能。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。
多智能体协商中基于对手建模的偏好估计
本文提出了一种新颖的偏好估计方法,将大型语言模型(LLM)的自然语言信息集成到结构化贝叶斯对手建模框架中,用于多智能体协商。该方法利用LLM从话语中提取定性线索,并将其转换为概率格式,在多方协商基准上展示了改进的协议达成率和偏好估计准确性。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。