LLM能否从聊天记录推断对话代理用户的个性特征?
摘要
苏黎世联邦理工学院的研究人员表明,经过微调的RoBERTa模型可从ChatGPT聊天日志中以高于随机44%的准确率推断用户的大五人格特征,凸显对话AI的隐私风险。
arXiv:2604.19785v1 公告类型:新增
摘要:敏感信息(例如个人性格知识)可能被滥用以影响行为(如通过个性化信息推送)。为评估基于LLM的对话代理(CA)互动能在多大程度上推断个体性格,我们分析并量化使用CA带来的相关隐私风险。我们收集了来自668名参与者的真实ChatGPT日志,包含62,090条独立对话,并统计了共享数据类型及用例。我们微调了RoBERTa-base文本分类模型,以从CA互动中推断人格特征。结果显示,这些模型在多项任务中实现高于随机的三元分类准确率。例如,在外向性维度上,针对关系与自我反思类互动,准确率较基线提升+44%。本研究揭示CA互动带来的隐私风险,并细化不同互动类型所对应的风险水平。
查看缓存全文
缓存时间: 2026/04/23 10:02
# 大语言模型能否从聊天记录推断对话智能体用户的性格特征? 来源:https://arxiv.org/html/2604.19785 11institutetext:苏黎世联邦理工学院,瑞士 ###### 摘要 诸如个体性格等敏感信息可被滥用于影响行为(例如通过个性化信息推送)。为评估基于大语言模型(LLM)的对话智能体(CA)在多大程度上会泄露个人性格,我们量化分析了使用 CA 所带来的隐私风险。我们收集了来自 668 名参与者的真实 ChatGPT 日志,共 62,090 条对话,并统计了共享数据类型与使用场景。我们微调了 RoBERTa-base 文本分类模型,用于从 CA 交互中推断性格特征。结果显示,在三分类任务中,模型准确率多次优于随机基线。例如,在“人际关系与自我反思”类对话中,外向性推断准确率相对基线提升 44%。本研究揭示了 CA 交互带来的隐私风险,并细粒度地刻画了不同交互场景的风险等级。 ## 1 引言 随着大语言模型(LLM)性能提升,ChatGPT 等对话智能体(CA)几乎零门槛地面向大众开放。然而,这类工具也可能给个人乃至整个社会带来隐私问题,例如大规模精准操纵。已有研究表明,用户常在 CA 中泄露大量敏感信息,包括健康相关内容 [zufferey_ai_2025]。这些数据不仅本身敏感,还可被用于进一步推断更多个人信息。尽管多篇论文探讨了 LLM 从文本推断性别、收入、位置等信息的能力 [staab_beyond_2023, peters_large_2024],但尚无研究直接聚焦于“从 CA 交互日志推断性格”。本研究填补这一空白,量化评估 CA 使用带来的隐私风险,并为缓解操纵与虚假信息传播提供依据。心理学研究早已指出,预先掌握性格可显著提升说服效果 [hirsh_personalized_2012, alkis_impact_2015],而剑桥分析事件 [gibney_scant_2018] 已证明基于性格的微定向广告可影响大选。本文贡献如下: 1) 采集 668 名参与者的真实 ChatGPT 日志(62,090 条对话),细粒度统计共享数据类型与用例; 2) 结合用户问卷得到的“真实标签”,微调 RoBERTa-base 进行性格推断,并给出通用/用例维度的三分类准确率分析。 ## 2 背景:性格特征 个体性格通常采用“大五人格”模型(OCEAN)评估,包含开放性、尽责性、外向性、宜人性与神经质五项,长期被证实具有跨时间稳定性 [cobb-clark_stability_2012]: - 开放性:高分者好奇、富有想象;低分者保守、实际。 - 尽责性:高分者谨慎、负责、有条理;低分者散漫、不可靠。 - 外向性:高分者健谈、活跃;低分者内向、拘谨。 - 宜人性:高分者友善、合作;低分者多疑、冷漠。 - 神经质:高分者焦虑、情绪化;低分者冷静、稳定。 性格属于高度敏感信息,可被用于精准影响用户,详见第 4 节。 ## 3 相关工作 既往研究已从位置 [chorley_personality_2015]、社交媒体 [lima_multi-label_2014, kosinski_manifestations_2014]、文本帖子 [minamikawa_blog_2011]、饮食 [weston_personality_2020]、通话记录 [monsted_phone-based_2018]、手机使用 [stachl_predicting_2020] 及可穿戴设备 [zufferey_watch_2023] 等数据推断大五人格。早期多用传统机器学习,近年 LLM 被证明可从文本推断位置、收入、性别 [staab_beyond_2023]。文本性格推断方面,El-Demerdash 等 [demerdash_deep_2022] 用 BERT 做二分类,在作文与 Facebook 数据上测试;Zhu 等 [zhu_lexical_2022] 扩展至 YouTube 字幕与推文;Molchanova [rapp_exploring_2024] 仅用作文做外向性二分类;Peter 等探索了基于社交网络活动的 LLM 推断。多数工作准确率比随机基线高 20%–60%。Wright 等 [wright_assessing_2026] 发现外向性与神经质在语音转写中最易被推断。然而,尚无研究专门从“CA 交互日志”推断性格,本文首次量化该场景的隐私风险。 ## 4 攻击者模型 我们主要考虑 LLM 服务提供商及其商业伙伴。服务商存储日志,天然具备访问权;云存储、API 供应商甚至数据经纪商也可能获取。除“诚实但好奇”的窥探外,更恶意的场景包括利用性格特征进行精准广告或政治宣传(OpenAI 已宣布 2026 年开始向美国用户测试广告 [openai2026_advertising])。此外,2025 年夏天,大量 Grok 与 ChatGPT 日志因界面设计缺陷被谷歌索引泄露 [mcmahon_hundreds_2025, sims_thousands_2025];某些 VPN 应用亦植入窃听脚本 [dardikman_8_2025]。攻击者获取日志后,既可提取用户直接泄露的信息,又可进一步推断性格等敏感属性,用于自动化 persuasion [matz_potential_2024] 或债务催收 [duhigg_what_2009] 等大规模操纵。 ## 5 研究方法 详见技术附录(含数据集、提示词、训练超参)。 ### 5.1 数据收集 通过 Prolific 与 Clickworker 招募美英两国英语流利用户。问卷含 60 题 IPIP-60 大五量表与人口统计信息,并要求用户上传 ChatGPT 历史。最终 668 人通过注意力检测且上传有效日志,共 62,090 条对话。 ### 5.2 伦理与开放科学声明 研究通过本校 IRB 审批,遵循心理伦理规范。全程约 30 分钟(问卷 20 min + 上传 10 min),报酬 £7.70/€8.7。上传文件加密,仅存放于校内安全服务器,五年内彻底删除。因内容高度敏感,原始数据集不公开,论文仅报告聚合去标识结果。分析均在校园安全虚拟机完成,未使用任何外部 API 或云存储。 ### 5.3 数据集 以 IPIP-60 得分作为真实标签,按三分位将每项性格划为“低/中/高”三档。每条用户日志视为一个样本,仅保留用户输入文本与对话标题,剔除模型回复。用户平均对话数 92 条,中位数 28 条(std=185.72)。
相似文章
AI人格会成长吗?分析与基准测试LLM智能体在生活事件后的人格演变
本文研究LLM智能体在经历重大生活事件后人格如何演变,使用大五人格特质,并引入名为BFI-Adapt的基准,以评估14个模型中事件诱发人格变化的方向保真度。
动态内群体人格生成以增强人机融洽关系
本文介绍了一种基于LLM的聊天机器人动态生成内群体人格的方法:首先识别用户的主要关切,然后创建一个共享该关切点的合成人格。一项人类受试者研究表明,与基线条件相比,该方法在感知融洽度和用户参与度方面有显著提升。
面向任务对话的人格引导LLM代理
本文探讨了在面向任务对话中,LLMs如何作为人格引导的代理,并通过GPT-4o和Gemini 2.0 Flash等模型评估,分析了人格适应对任务性能和用户满意度的影响。
ChatGPT 情感使用与情感幸福感的早期研究方法
OpenAI 和 MIT Media Lab 研究人员进行了两项并行研究,分析了与 ChatGPT 的情感互动如何影响用户幸福感。该研究结合了对 4000 万次对话的分析和对 1000 名参与者的随机对照试验,以了解其对孤独感、社交互动和有问题的 AI 使用的影响。
大型语言模型捕捉人类性格的效果如何?
本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。