标签
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
IAB@NeurIPS 2026 竞赛(GLEE Competition)公告,参赛者需构建能在实时多轮博弈中进行讨价还价、谈判与说服的 AI 智能体,总奖金池 6,000 美元,并可选择性提交论文。
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
本文介绍了DebtBench——首个针对催收协商的个性化基准测试,以及DebtGPT——一个同时优化财务回收与交互体验的催收代理。实验表明,大多数大型语言模型在这一真实场景中表现不佳,而DebtGPT达到了与GPT-4o相当的性能。
一个基于社交强化学习(SocialRL)训练的新型4B参数AI模型在谈判任务中超越了GPT-5模型,表明让AI成为愉快助手的特质(顺从性、透明度)反而降低了谈判效率。
一名受雇代表受害者的勒索软件谈判者秘密为BlackCat攻击者工作,分享机密客户信息以最大化赎金支付,最终被判6年监禁。
本文形式化了多轮智能体谈判中的行为隐私泄露问题,并提出了一种自适应随机策略,该策略在提供差分隐私保证的同时,保持较高的谈判效用。
Ivo 推出 Benchmarks,这是一款通过利用公司全部合同谈判历史来审阅并批注协议的工具,旨在改进未来的谈判。
一位开发者在4天内为黑客马拉松构建了一个由6个智能体组成的卫星碰撞规避AI系统,并分享了经验教训。
六个AI模型被要求结成联盟,以赢得一份资金提案挑战。它们独立协商伙伴关系,形成了三个竞争团队,展示了自主协调和战略谈判能力。
本文介绍了一种用于人类谈判的自动化调解器,它使用结构化LLM模块流水线进行前期调解。在人类受试者实验中,该系统在偏好推断方面降低了误差,同时实现了与专业人类调解员相当的准备效果。
一位保险理赔员描述了汽车贷款机构如何部署AI机器人,利用不准确的数据对全损车辆估值提出异议,浪费理赔员时间,并使其难以联系到真人代表。该帖子寻求绕过这些AI系统与真人通话的建议。
PrefBench是一个新基准,旨在评估零样本LLM智能体在具有隐藏偏好的个性化定价谈判中的表现,考察它们在谈判场景中推断和适应用户偏好的能力。
研究表明,LLM智能体在谈判中能够建模对手的偏好,但未能将这种知识转化为战略性讨价还价以改善结果,这限制了它们在多轮谈判中的有效性。
据传腾讯与梁文锋(深度求索)谈判投资,腾讯要求20%股份被拒,最终接受2%股份,引发业内对AI赛道势力格局变化的讨论。
腾讯试图以500亿美元估值认购DeepSeek 20%股份但被拒绝,最终仅获2%股份,且DeepSeek要求腾讯绑定其生态,反映出DeepSeek在AI投资中的强势地位。
本文提出了一种方法,通过将表格特征与基于LLM的文本表示以及来自冻结观察者模型的隐藏状态相结合,在谈判游戏中预测不熟悉AI代理的决策,优于直接提示方法。
PACT 推出了针对 LLM 的对抗性谈判基准测试,通过 20 轮买卖双方议价博弈来评估模型的说服力与适应能力。顶尖模型包括 GPT-5.5 和 Opus 4.7,评分由 Glicko-2 算法计算,并采用类 Elo 评分体系展示。
Mediator.ai 是一款将纳什谈判博弈论与 LLM 相结合的工具,旨在促进公平的协作式谈判。它会基于双方明确的需求生成并评估候选协议,直至找到最优解。