标签
PrefBench是一个新基准,旨在评估零样本LLM智能体在具有隐藏偏好的个性化定价谈判中的表现,考察它们在谈判场景中推断和适应用户偏好的能力。
研究表明,LLM智能体在谈判中能够建模对手的偏好,但未能将这种知识转化为战略性讨价还价以改善结果,这限制了它们在多轮谈判中的有效性。
据传腾讯与梁文锋(深度求索)谈判投资,腾讯要求20%股份被拒,最终接受2%股份,引发业内对AI赛道势力格局变化的讨论。
腾讯试图以500亿美元估值认购DeepSeek 20%股份但被拒绝,最终仅获2%股份,且DeepSeek要求腾讯绑定其生态,反映出DeepSeek在AI投资中的强势地位。
本文提出了一种方法,通过将表格特征与基于LLM的文本表示以及来自冻结观察者模型的隐藏状态相结合,在谈判游戏中预测不熟悉AI代理的决策,优于直接提示方法。
PACT 推出了针对 LLM 的对抗性谈判基准测试,通过 20 轮买卖双方议价博弈来评估模型的说服力与适应能力。顶尖模型包括 GPT-5.5 和 Opus 4.7,评分由 Glicko-2 算法计算,并采用类 Elo 评分体系展示。
Mediator.ai 是一款将纳什谈判博弈论与 LLM 相结合的工具,旨在促进公平的协作式谈判。它会基于双方明确的需求生成并评估候选协议,直至找到最优解。
Anthropic 开展了一项实验,员工使用 Claude 驱动的代理人在微型市场中进行书籍交易,以研究代理表示和模型强度对谈判结果的影响。