大型语言模型个性化能力的基准测试

arXiv cs.AI 论文

摘要

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。

arXiv:2607.20471v1 公告类型:new 摘要:个性化,即在保持发送者、渠道和时间不变的情况下,通过变化信息来促使特定接收者采取行动的行为,在心理学和营销学中有着悠久的传统,被视为一个双方问题,其中发送者和接收者各自拥有独立的目标。大型语言模型通过根据推断出的接收者状态生成连续的信息变体,消除了传统检索与排序方法中库存有限的限制,从而引发了当前模型在经典意义上如何执行个性化的问题。现有的LLM个性化基准衡量的是发送者侧适应,即接收者就是模型所服务的同一用户。而双方问题——生成的信息是否能在第三方中引发预期行动——仅通过A/B测试和小规模人类研究进行了探索,这些研究无法按需针对新模型重新运行。我们将Kamenica和Gentzkow(2011)的贝叶斯说服框架应用于生成式智能体,并在销售领域中实例化该公式,其中接收者的行动通常根据引发这些行动的外联活动进行记录。我们发布了SDR-Bench,这是一个包含6,279个客户成功故事的公开语料库,涵盖22个行业和约200家企业,并通过一个时间受限的模拟来提供,以防止未来数据泄露。对于前沿大语言模型和深度研究智能体,我们观察到一致的个性化瓶颈,并且在一个财富100强科技公司群体中,没有模型能在统计上将成功与不成功的外联区分开来。一项与12名专业销售代表合作的现场部署验证了该框架,其中48%的模型生成内容被评为立即可用,高级专家的一致性达到皮尔逊系数0.82。我们公开发布了SDR-Arena和SDR-Bench,以支持大规模可复现的生成式个性化研究。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:00

# 大语言模型个性化能力的基准测试 来源:https://arxiv.org/html/2607.20471 Ashutosh Srivastava、Siddharth Yedlapati、Vinay Aggarwal、Yaman K Singla、Shashwat Dixit、Jitendra Ajmera、Balaji Krishnamurthy ![[未配图说明]](https://arxiv.org/html/2607.20471v1/figures/adobe_logo.png)Adobe 媒体与数据科学研究 behavior\-in\-the\-wild@googlegroups\.com ###### 摘要 个性化,即在保持发送者、渠道和时间固定的前提下,为了从特定接收者那里引发行动而改变消息的行为,在心理学和营销学中有着悠久的传统,被视为一个双方问题,其中发送者和接收者具有各自独立的目标。大语言模型摆脱了经典检索与排序方法中库存有限的限制,能够基于推断出的接收者状态生成连续的消息变体,这引发了一个问题:当前模型在经典意义上的个性化表现如何?现有的 LLM 个性化基准衡量的是发送者端的适配,即接收者就是模型正在服务的同一个用户。而双方问题——生成的消息是否能在第三方身上引发预期行动——仅通过 A/B 测试和小规模人工研究进行过探讨,无法按需针对新模型重复实验。我们将 Kamenica 与 Gentzkow(2011 年)提出的贝叶斯说服框架适配到生成式智能体,并在销售场景中对这一公式进行实例化,其中接收者的行动会与引发该行动的对外联系信息一起被常规记录。我们发布了 SDR\-Bench,这是一个包含来自约 200 家企业、覆盖 22 个行业的 6279 个客户成功故事的公开语料库,并通过时间约束模拟提供服务,以防未来数据泄露。在多个前沿 LLM 和深度研究型智能体上,我们观察到一致的个人化天花板现象;在一个财富 100 强科技企业队列中,没有任何模型能统计上显著地区分成功与不成功的对外联系。一项有 12 名专业销售开发代表参与的现场部署证实了该框架的有效性,模型生成的内容中 48% 被立即评为有用,资深专家一致性达到皮尔逊相关系数 0.82。我们公开发布了 SDR\-Arena 和 SDR\-Bench,以支持可重复的大规模生成式个性化研究。参见标题下的图 1:SDR\-Arena 概览,展示了如何将 LLM 生成的输出与销售邮件、对话记录和成功故事等人工制品进行比较,以评估其个性化能力。

## 1 引言

拉斯韦尔(Lasswell,1948)的开创性工作将沟通定义为五个变量的结合:谁、通过什么渠道、对谁、说了什么、产生了什么效果、在什么时间。在此框架内,个性化可以被定位为改变消息(即“说什么”)的行为,同时以(并保持)说话者、接收者、渠道和时间不变为条件。这一行为涉及双方,其利益最初未必一致;发送者选择消息,旨在从接收者那里引发某种行动;而接收者则拥有独立的偏好,并选择是否行动。关于发送者如何塑造消息以引发接收者行动的研究,在心理学、经济学和营销学等多个领域有着悠久的传统,始于耶鲁沟通与态度改变项目(Hovland 等人,1953),并延续至精细加工可能性模型(Petty 与 Cacioppo,1986)和贝叶斯说服的形式化信号博弈处理(Kamenica 与 Gentzkow,2011)。迄今为止,机器学习在个性化方面的研究一直是将此问题视为学习一个策略,从固定的候选项库中检索和排序项目。推荐系统根据用户历史信号对目录中的项目进行排序(Ricci 等人,2010);广告平台在预制的固定创意池中优化广告的选择和定向(Choi 等人,2020);基于人格的对话系统在响应生成时以显式人格表示为条件,但始终局限于相对狭窄的对话领域(Zhang 等人,2018)。

大语言模型将这种个性化从检索排序问题转变为生成问题。LLM 可以针对给定的(说话者、接收者、渠道、时间)元组,根据从可用上下文中推断出的接收者属性,生成连续的消息变体。越来越多的研究将 LLM 应用于营销(Matz 等人,2024)、教育(Tasdelen 与 Bodemer,2025;Sharma 等人,2025)和人机交互(Chen 等人,2024)中的生成式个性化。这些应用成果引出了一个问题:当前 LLM 在经典文献所研究的个性化意义上表现如何?即发送者为了引发特定的接收者行动而选择“说什么”。然而,虽然存在一些衡量 LLM 个性化的研究,但它们所衡量的属性与心理学和经济学文献中所讨论的个人化(Lasswell,1948;Kamenica 与 Gentzkow,2011)截然不同。LaMP(Salemi 等人,2024)评估的是以用户过去互动历史为条件的个性化文本生成。PersoBench(Afzoon 等人,2024)衡量的是开放域对话中的人格一致性。PersonaConvBench(Li 等人,2025)对基于人格的对话质量进行评分。PersonaLens(Zhao 等人,2025)评估在声明用户偏好下的助理性状。PersonaMem(Jiang 等人,2025)衡量跨会话的用户属性长时记忆。在这些研究中,LLM 生成消息的接收者就是模型所服务的同一个用户,优化目标是单方面的:模型输出与发出提示的用户偏好之间的一致性,类似于 RLHF 将助手指向其用户。而双方问题——发送者和接收者具有独立目标,并且发送者的成功通过接收者是否行动来衡量——主要通过随机化人类被试实验进行研究,其中参与者暴露于人类或 LLM 生成的说服性消息,并根据随后的态度转变、认同度或行为意图进行评估(Matz 等人,2024;Durmus 等人,2024)。这类研究依赖于特定的方法,需要数周时间执行,并且无法按需针对新模型重复。因此,不同 LLM 与人类专家在双方个性化上的比较仍局限于个别研究,无法跨系统直接对比。因此,需要一个形式化的个性化模型,该模型兼顾消息的发送者和接收者,足以支持一个可重复、自动化的基准测试,并适用于任意生成系统。该公式需要一个实证环境,其中接收者的行动被观察并记录在引发它们的特定消息之下,消息是在接收者层面而非细分群体层面撰写的,并且能够大规模获得已知识别成功引发行动的、由人类撰写的真实结果。销售对外联系人工制品提供了一个良好的测试平台,因为接收者行动(回复、安排通话、达成交易)会与引发这些行动的具体对外联系信息一起被常规记录(Terho 等人,2022b)。销售对外联系由销售开发代表(SDR)针对特定潜在客户一对一地草拟。在一项与某财富 100 强企业合作进行的内部研究中,我们观察到,在为类似潜在客户群体推广相同产品时,个性化 SDR 对外联系的点击率大约是模板化对外联系的七倍。此外,销售漏斗在已知的成功转化点上生成了一系列分层的人类撰写人工制品,即:确保通话的对外联系邮件、确保交易讨论的通话记录,以及记录达成交易内容的交易后客户成功故事。这些特性共同使得销售成为双方公式的一个自然实证实例,其中漏斗中的每件人工制品都作为同一(销售方、潜在客户、产品)元组在不同阶段的真实结果,从而支持分阶段的生成式个性化评估。我们在此实证环境上开发了我们的框架 SDR\-Arena(如图 1 所示),并列出我们的贡献如下:

- • 我们将贝叶斯说服适配到生成式智能体,将个性化恢复为智能体生成内容与真实销售对外联系人工制品中隐含的、针对接收者的内容之间的信息对齐。
- • 我们构建了 SDR\-Bench,这是一个包含来自约 200 家企业、覆盖 22 个行业的 6279 个客户成功故事的公开语料库,每个故事都配有所需的销售方、潜在客户、产品和历史时间戳,用于评估智能体能否预测促成交易的内容。
- • 我们发布了 SDR\-Arena,一个在 SDR\-Bench 和专有销售人工制品上实现该形式化的评估框架;为了防止未来数据泄露(即智能体检索到它被要求预测的那个成功故事),SDR\-Arena 会为智能体提供每个评估实例历史时间戳时刻的固定公共网络视图。
- • 我们将该框架应用于来自一家财富 100 强科技公司和一家中型医疗保健公司的专有销售邮件和销售对话记录语料库,包含由 124 名 SDR 撰写的约 115,000 封筛选后的对外联系邮件和 5435 次对外联系通话,并根据是否引发了成功的接收者行动进行了标注。
- • 我们通过与合作伙伴企业的 12 名专业销售开发代表的现场部署,以及与来自五家企业的资深 SDR 进行的黄金标准演练,验证了该框架。

在多个前沿 LLM 和开源深度研究型智能体上,包括 STORM(Shao 等人,2024)、ODR(LangChain,2025)、GPT\-4o(OpenAI,2023)、Claude Sonnet 4.6(Anthropic,2026)和 Qwen\-2.5(Yang 等人,2024),我们观察到一致的个人化天花板现象。对齐分数集中在 30% 到 43% 的范围内;在科技企业队列上,没有模型能统计上显著地区分成功与不成功的对外联系。像 STORM 这样的专门智能体达到了该范围的上限,但推理成本却高出 1 到 2 个数量级;带有时间约束搜索的标准 LLM 则占据了一条更节省算力的边界。参见标题下的图 2:销售旅程:从寻源到对外联系,到通话,再到最终达成交易并发布成功故事。

## 2 问题形式化

我们首先描述销售开发生命周期,然后将个性化建模为一项贝叶斯说服任务,其中生成的对外联系旨在引发销售漏斗内接收者的特定行动,以此形式化销售场景中的生成式个性化。

### 2.1 销售开发生命周期

一个销售旅程(如图 2 所示)始于销售开发代表(SDR)研究潜在客户账户以识别需求和预算信号,然后发送量身定制的对外联系邮件以安排初步通话。该通话进一步挖掘潜在客户的需求,并朝着达成交易的方向推进;有些机会最终成为交易,有些则没有。在成功达成交易后,工作流程通常会以一份“客户成功故事”告终:一份由销售方公司公开发布的案例研究,展示其产品如何帮助客户克服关键挑战。这些故事以网络文章的形式发布,通过记录从“痛苦状态”到“成功状态”的转变(Terho 等人,2022a)来验证合作伙伴关系。例如来自 Oracle、Salesforce 和 Adobe 的成功故事。

### 2.2 贝叶斯说服公式化

我们将 Kamenica(Kamenica 与 Gentzkow,2011)的贝叶斯说服框架适配到个性化对外联系建模中,将其视为发送者(SDR 或替代 SDR 的 LLM 智能体)与接收者(潜在客户)之间的信号博弈。该框架天然契合个性化,因为它认识到接收者在进入互动时对自己的需求持有先验信念,发送者的角色是提供一个信号——即个性化消息——将接收者的后验信念更新为有利于行动的方向。未观察到的接收者状态 ω 表示接收者需求与发送者产品之间的潜在匹配度。我们在时间 t 将 ω 分解为元组 ω_t = {n_i, w_i},其中 n 表示接收者的显性需求(功能需求、当前痛点),w 表示他们的隐性需求(战略目标、价值创造途径)。接收者选择行动 a ∈ {0,1},其中 a=1 代表成功进入销售漏斗的下一个阶段(例如,邮件导致通话,或通话导致交易讨论),而 a=0 代表未能推进。遵循 Kamenica(Kamenica 与 Gentzkow,2011),接收者被视作一个理性的贝叶斯智能体,对 ω 持有先验信念 μ。当且仅当基于其信念的条件期望效用 u_R 超过保留阈值 τ 时,接收者才会采取行动 a=1:E[u_R(a=1, ω_t, ξ) ∣ μ] ≥ τ。发送者的效用 u_S 与接收者采取行动 a=1 保持一致。因此,发送者的目标是传递一个信号,使接收者的后验信念得到更新,从而满足上述条件。注意,效用函数还受到外生因素 ξ(时机、组织紧迫性、先前背景、噪声)的影响,这些因素独立于发送者的信号,但会影响接收者的效用。发送者的信号可以改变 μ 朝向有利行动的方向,但无法控制 ξ。因此,即使是最优的信号也不能保证引发 a=1,接收者的行动最好被理解为概率性的。

相似文章

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

arXiv cs.AI

This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.

APeB:大型语言模型智能体个性化能力的基准测试

arXiv cs.AI

提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。

评估大语言模型中个性化的隐藏成本

Hugging Face Daily Papers

本文介绍了PRISK,一个用于评估LLM个性化风险的框架,发现个性化上下文在13个模型中增加了不相关个性化、偏好狭窄和谄媚偏见。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。