PersonalBench: 衡量大型语言模型个性化中的作者身份差距
摘要
PersonalBench 是一个新的基准,通过作者身份验证、LLM-as-judge 和文体测量学来评估 LLM 中的推理时个性化方法。研究发现,虽然这些方法能产生作者区分的输出,但它们并未缩小与人类作者之间的差距。
arXiv:2608.19746v1 公告类型:新
摘要:个性化文本生成旨在让 LLM 以特定个人的风格写作,然而现有的基准衡量的是任务准确性或偏好对齐,而不是模型的输出是否真正类似于目标作者的写作风格。我们引入 PersonalBench,一个通过三个独立视角评估推理时个性化方法的基准:LUAR(一个训练有素的作者身份验证模型)、LLM-as-judge 和自动化文体测量学。在 50 位作者、1,000 次生成和两个模型家族(Qwen 3, GLM-4)的跨域测试中,我们发现个性化方法确实产生了作者区分的输出(LUAR 在生成文本中识别目标作者的 AUC=0.918),但这种区分从未跨越人类-LLM 边界。所有方法在 LUAR 上与真实作者的相似度范围在 0.484-0.508 之间,低于跨作者的人类下限 0.626(上限 0.756)。LLM 自身的作者指纹占主导地位:生成文本与任何人类作者的距离比随机人类之间的距离更远。方法在 LUAR 上统计上无法相互区分(差异 0.024),尽管在 LLM judge 上显得不同,我们将这一差异追溯到特征提取和档案提取之间的循环性。我们验证了 LUAR 在我们的语料库中可靠地衡量作者身份(AUC=0.76 单帖, 0.96 多帖)。我们发布 PersonalBench 作为校准的测量工具:推理时个性化调节了 LLM 的风格,但并未缩小与人类作者之间的差距。
查看缓存全文
缓存时间: 2026/08/21 10:10
# PersonalBench:衡量LLM个性化中的作者身份差距 来源:https://arxiv.org/html/2608.19746 ###### 摘要 个性化文本生成旨在让大语言模型以特定个体的风格写作,但现有基准测试衡量的是任务准确度或偏好对齐度,而非模型输出是否真正类似于目标作者的写作风格。我们推出 **PersonalBench**,该基准测试通过三个独立维度评估推理时个性化方法:LUAR(经过训练的作者身份验证模型)、LLM 裁判以及自动化文体计量学。在 50 位作者、1,000 次生成以及两个模型系列(Qwen 3、GLM-4)的测试中,我们发现个性化方法**确实**能产生具有作者区分度的输出——LUAR 在生成的文本中识别目标作者的 AUC 达到 0.918——但这种区分度始终未能跨越人类与 LLM 之间的边界。所有方法的 LUAR 与真实作者的相似度范围在 0.484–0.508 之间,低于人类跨作者基线的下限 0.626(上限为 0.756)。LLM 自身的作者指纹占据主导地位:生成的文本与任何人类作者的距离,都比随机人类彼此之间的距离更远。尽管在 LLM 裁判看来这些方法表现出区分度,但在 LUAR 上它们之间没有统计学差异(差值仅 0.024)——我们追溯到特质提取与轮廓提取之间的循环性问题。我们验证了 LUAR 在我们的语料库中能可靠测量作者身份(单篇帖子 AUC=0.76,多篇帖子 AUC=0.96)。我们发布 PersonalBench 作为校准后的测量工具:推理时个性化可以调整 LLM 的风格,但无法弥合其与人类作者身份之间的鸿沟。 111 代码与数据:https://github.com/yashsawant22/personalbench ## 1 引言 大型语言模型越来越多地被部署在需要个性化的场景中:匹配用户声音的写作助手、保持品牌语调的客服代表,以及适应个人偏好的内容工具。这些应用有一个共同的核心需求:模型必须“像特定的人”来写作。标准方法是推理时个性化——在生成时通过少量示例、风格轮廓或对比提示来调整模型,而不修改模型权重。 但这真的有效吗?目前的个性化基准测试无法回答这个问题,因为它们衡量的指标不对。LaMP(Salemi 等人,2024)评估任务准确度(标题生成、产品评分)。PersonalLLM(Zollo 等人,2025)衡量偏好对齐度。PRISM(Kirk 等人,2024)捕捉陈述的价值偏好。这些都没有评估生成的文本是否“听起来像”目标作者——即模型的底层作者指纹是否真正向目标作者偏移。 我们提出了一个直接的问题:推理时个性化方法改变的是模型的“写作方式”还是仅改变其“写作内容”?为了解答这个问题,我们需要超越表面文本相似度的评估方法,需要基于作者身份科学的指标——这是一门已有数十年历史的从写作风格识别作者的学科。 我们推出 **PersonalBench**,该基准测试通过三个独立维度评估个性化: 1. **LUAR**(Rivera-Soto 等人,2021):一个在数百万 Reddit 帖子上训练的神经作者身份验证模型,提供校准后的相似度分数。这是我们的主要指标。 2. **LLM 裁判**:解耦的二元特质匹配与同作者判断,提供可解释的风格诊断。 3. **自动化文体计量学**:功能词分布、标点符号模式和词汇重叠度。 我们的核心发现是:推理时个性化产生了具有作者区分度的输出,但这些输出仍然困在 LLM 自身的风格空间内。在生成的文本中,LUAR 以 AUC=0.918 识别出目标作者——个性化**确实**在起作用。但当将生成的文本与真实人类文本比较时,所有四种方法在 LUAR 上的得分在 0.484 到 0.508 之间——低于人类跨作者基线的下限 0.626(上限 0.756)。LLM 的作者指纹如此主导,以至于个性化输出与目标作者的距离,甚至比随机人类作者彼此之间的距离更远。轮廓提取在 LLM 裁判上看似“胜出”(TMR=0.542 对比基线 0.384),但 LUAR 并未显示相应优势(0.502 对比 0.484),这暴露了裁判的特质提取与方法的轮廓提取之间的循环性。 我们验证了这并非测量失败。LUAR 在我们的博客语料库中实现单篇帖子作者判别的 AUC=0.76,在多篇帖子时提升至 0.96。人类与 LLM 文本之间的作者身份差距真实且可测量——推理时个性化可以在 LLM 范式内调节风格,但无法弥合这一差距。 我们的贡献包括: 1. **PersonalBench 基准测试**:50 位作者,1,000 次生成,四种方法,三种独立的评估指标(包括 LUAR 作者身份验证)——首个基于作者身份科学的个性化基准。 2. **多指标评估框架**:结合训练的作者身份嵌入(LUAR)、LLM 裁判评估和经典文体计量学,揭示跨指标相关性几乎为零(主要指标之间 |r|<0.07;加入 ROUGE-L 后最高 |r|=0.17),并表明单指标评估不可靠。 3. **关于人类-LLM 作者身份差距的严格验证发现**:推理时个性化在 LLM 的风格空间内产生具有作者区分度的输出(生成文本之间 AUC=0.918),但无法弥合与人类作者身份的差距(生成文本对真实文本 AUC=0.632),该结论得到校准基线、两个模型系列和三种指标收敛证据的支持。 ## 2 相关工作 ##### 个性化基准测试 LaMP(Salemi 等人,2024)使用任务特定准确度评估跨七个任务的个性化语言模型预测。LongLaMP(Kumar 等人,2024)将其扩展到长文本生成,引入内容摘要提示以区分风格与内容——我们也采用了这一方法。PersonalLLM(Zollo 等人,2025)使用合成多样化用户轮廓评估偏好个性化。PRISM(Kirk 等人,2024)提供真实的人类偏好数据,但目标是价值对齐。这些均未评估作者风格保真度,也未使用作者身份验证模型进行评估。 ##### 作者身份验证 计算作者身份分析从功能词频率到神经方法(Stamatatos,2009)。LUAR(Rivera-Soto 等人,2021)通过对比学习在 Reddit 数据上学习通用作者身份表征,具有强大的跨域迁移能力。我们采用 LUAR 作为主要指标,因其提供校准后的作者身份相似度分数。 ##### LLM 风格评估与检测 Wang 等人(2025)发现 LLM 在 400+ 位作者中“仍难以模仿日常作者”——我们的 LUAR 分析印证并量化了这一点。Panza(Nicolicioiu 等人,2024)和 ExPerT(Salemi 等人,2025)评估个性化生成,但针对单一系统;我们提供了一个带有校准基线的基准框架。AI 生成文本检测文献(Mitchell 等人,2023;Kirchenbauer 等人,2023)已证实 LLM 输出携带独特指纹。我们发现的低于人类基线的“生成文本区间”与此一致:LLM 的作者身份信号难以被个性化抹除。 ##### LLM 裁判 Prometheus(Kim 等人,2024)发现 60–70% 的 Likert 评分集中在 3–4 分;RULERS(Hong 等人,2026)提出基于二元证据锚定的评分。我们在此基础上构建二元特质匹配和参考锚定(Salemi 等人,2025),增加了一个解耦协议,将特质评分与整体作者身份判断分离。 ## 3 PersonalBench 基准测试 ### 3.1 数据 我们使用 Blog Authorship Corpus(Schler 等人,2006),包含来自 19,320 位博主的 681K 篇帖子及人口统计数据。我们选择 50 位符合以下条件的作者:(i)至少 200 篇训练帖子,(ii)至少 50 篇测试帖子,(iii)平均帖子长度 ≥100 词。按作者 80/20 划分训练集和测试集,产生 104K 篇训练帖子和 26K 篇测试帖子。预处理包括移除 URL 占位符(urlLink)和 HTML 残留。完整的 200 位合格作者语料库包含在发布中,以支持扩展实验;本文报告基于 50 位作者的结果。 ##### 语料库特征 帖子时间跨度为 1999–2004 年,涵盖个人日记、观点文章、创意写作和日常观察。平均帖子长度为 207 词(σ=189)。作者展现出显著的风格多样性:平均句子长度范围在 8.4 至 24.1 词;类符-形符比从 0.38 到 0.71;功能词分布显示出独特的个人模式。 ### 3.2 提示构建与污染消融 一个关键设计决策是如何从测试帖子中生成写作提示,同时不泄露作者的声音。简单方法——提取第一句话——会将数百字的作者原始文本嵌入提示中,包括独特的词汇、标点和语调标记。 我们证明这并非理论问题。当提示提取为原始第一句话时,未个性化的基线在同作者判断上达到 50%。替换为 LLM 提取的内容摘要——对帖子**内容**的中性描述——将基线降至 22%,降低了 **28 个百分点**(表 1)。遵循 Wang 等人(2025)、Nicolicioiu 等人(2024)和 Kumar 等人(2024)的方法,我们通过提示提取内容摘要:“用 1–2 句中性的话总结这篇博文。描述其内容,而非写作方式。不要复制作者的措辞、语调或词汇。” **表 1:提示构建对基线分数的影响。简单提取泄露作者声音,在未个性化基线上使同作者判断分数虚高 28 个百分点。** ### 3.3 个性化方法 我们评估四种推理时方法,涵盖从无个性化到显式量化风格信号的递进。所有方法接收相同的内容摘要提示;区别仅在于作者信息的表示方式。 ##### 非个性化(控制) 模型仅接收内容摘要,无作者信息。 ##### Few-Shot(显式风格迁移) 提供目标作者的五个随机采样训练帖子,并附有明确的系统指令:匹配作者的写作风格、句子结构、语调、词汇和修辞模式。 ##### 轮廓提取(显式抽象风格迁移) 两阶段方法:(i)LLM 阅读最多 10 篇训练帖子,生成结构化风格轮廓,涵盖语调、正式度、词汇、句子结构和修辞手法;(ii)生成模型仅接收此**抽象轮廓**(无原始样本)并生成内容。该轮廓按作者提取一次,并在不同提示中重复使用。 ##### 带特征的对比(显式量化风格迁移) 模型接收作者样本,同时提供来自另外三位作者的对比样本(标记为“避免这些风格”),以及计算的文体计量特征:目标作者与对比作者的平均句子长度、词汇丰富度和常用功能词频率。 ### 3.4 评估框架 我们通过三个独立维度评估生成的文本,按其与作者身份科学的关联强度排序。 #### 3.4.1 LUAR 作者身份相似度(主要指标) LUAR(学习通用作者身份表征)(Rivera-Soto 等人,2021)是一个通过对比学习在数百万 Reddit 帖子上训练的 Transformer 模型,用于生成具有作者区分度的文本嵌入。给定两段文本,我们计算其 LUAR 嵌入的余弦相似度。相似度越高,表明文本越可能共享同一作者。 我们采用 LUAR 作为主要指标,因为它将语法、词汇选择和语篇模式中的作者身份信号整合为一个校准后的分数,并在作者身份验证基准测试中得到验证。 #### 3.4.2 LLM 裁判:解耦二元评估(次要指标) 我们的裁判采用三个解耦阶段: (1)**特质提取**(按作者缓存):裁判阅读 10 篇训练帖子,提取 5 个独特的风格特质,以“是/否”问题形式,仅限于写作风格。 (2a)**特质评分**:单独调用,为每个特质提供“是/否”评分及证据,仅查看生成的文本。 (2b)**同作者判断**:另一个单独调用,将生成的文本与作者的参考帖子进行比较,询问“这些文本可能由同一人撰写吗?” 阶段 2a 和 2b 是解耦的,因为经验发现结合它们会导致整体问题影响特质答案。我们使用 Qwen 3 32B(Qwen 团队,2025)进行生成,GLM-4 32B(GLM 团队,2024)进行裁判,以减轻自我增强偏差(Zheng 等人,2023)。 ##### 派生指标 - • **特质匹配率**(TMR)= traits_present/5:可解释的逐特质诊断。 - • **同作者率**(SA%):获得“是”判断的百分比。 #### 3.4.3 自动化文体计量学(第三级指标) 我们计算生成文本与作者训练帖子之间的文体计量相似度: - • **功能词余弦相似度**(FuncCos):60 个常见功能词频率分布的余弦相似度——公认的个人写作风格标志(Argamon 等人,2003)。 - • **标点余弦相似度**:10 种标点符号分布的相似度。 - • **ROUGE-L**(Lin,2004):与参考帖子的最长公共子序列重叠度。 ## 4 实验 ### 4.1 设置 我们评估 50 位作者 × 5 个提示 × 4 种方法 == 1,000 次生成。生成器为 Qwen 3 32B 4-bit,通过 mlx-lm 本地服务。LLM 裁判为 GLM-4 32B 4-bit(不同模型系列)。LUAR 嵌入使用 Rivera-Soto 等人(2021)的预训练模型计算。总计算量:在单台 Apple M4 Pro(48GB)上约 3,300 次 LLM 调用,耗时约 24 小时。 ### 4.2 LUAR 验证:任务可测量 我们验证了尽管在 Reddit 上训练,LUAR 仍能在我们的博客语料库中区分作者身份。在 2,500 对同作者和 2,500 对跨作者文本对中,单篇帖子 LUAR 实现 **AUC=0.76**(对比 TF-IDF 基线 AUC=0.54);使用 5 篇帖子聚合时,AUC 提升至 **0.96**。同作者相似度平均为 0.756(上限)。
相似文章
在LLM个性化中重新以人类为中心
本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。
Ψ-Bench:评估说服性对话中的人设敏感影响
介绍Ψ-Bench,一个用于评估大语言模型通过带有个人档案的说服性对话影响用户能力的基准。测试了10个前沿LLM,发现仍有显著改进空间,而访问档案平均提升18.24%的性能。
大型语言模型个性化能力的基准测试
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
我花了大量精力构建一个测量LLM政治倾向、伦理价值观与人格特质的基准
Black Bench是一个旨在构建基准以测量LLM在政治倾向、伦理价值观与人格特质方面表现的项目,目前正寻求对该倡议的支持。