评估大语言模型在社交媒体分析中的能力:多任务探索
摘要
犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。
查看缓存全文
缓存时间: 2026/04/22 08:29
# 评估大模型在社交媒体分析中的能力:多任务探索 来源:https://arxiv.org/html/2604.18955 Ramtin Davoudi 犹他州立大学 [email protected] Kartik Thakkar 犹他州立大学 [email protected] Nazanin Donyapour 独立研究者 [email protected] Tyler Derr 范德堡大学 [email protected] Hamid Karimi 犹他州立大学 [email protected] ###### 摘要 本文首次对现代大模型——包括 GPT-4、GPT-4o、GPT-3.5-Turbo、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2 和 BERT——在 Twitter(X)数据集上三项核心社交媒体分析任务进行系统评估: I. 社交媒体作者身份验证 II. 社交媒体帖子生成 III. 用户属性推断 在作者身份验证中,我们提出系统抽样框架,覆盖多样化用户与帖子选择策略,并在 2024 年 1 月之后新采集的推文上测试泛化能力,以缓解“已见数据”偏差。 在帖子生成中,我们用综合指标评估大模型生成真实、类用户内容的能力。 连接任务 I 与 II,我们开展用户调研,测量真实用户对以其风格生成内容的感知。 在属性推断中,我们使用 IAB Tech Lab 2023 与 2018 美国标准职业分类(SOC)两大标准分类体系标注职业与兴趣,并将大模型与基线对比。 整体而言,本研究提供新见解,并建立可复现的大模型社交媒体分析基准。代码与数据见补充材料,录用后公开。 ## 1 引言 在线社交平台已成为现代生活的一部分,产生海量用户内容,为营销、公共卫生、危机管理等提供独特洞察,形成“社交媒体分析”这一活跃领域。尽管自 Facebook、Twitter(现 X)兴起以来该领域进展显著,但仍面临关键挑战:用户文本非正式、歧义、低质(如垃圾、梗图),且语言演化迅速(新俚语、新梗),导致模型易过时。 近期大模型(GPT、DeepSeek、Gemini 等)在海量多样化语料上训练,展现出在动态噪声环境中理解与生成语言的强大能力,在情感分析、立场检测、谣言识别、主题提取、摘要等任务上仅需极少监督即可取得竞争力结果。 本文在统一框架下实证评估大模型三项核心社交媒体分析任务: I. 社交媒体作者身份验证 II. 社交媒体帖子生成 III. 用户属性推断 任务 I 判断某帖是否由指定用户撰写,虽在数字取证、抄袭检测中已有研究,但社交媒体文本短、质量低,挑战更大。 任务 II 生成符合用户风格与偏好的帖子;虽文本生成已被广泛研究,但真实个性化社媒内容仍难生成,大模型正被越来越多地用于此目的。 任务 III 从文本预测用户属性(职业、兴趣),支撑个性化与大规模行为分析,但标签歧义、细粒度分类要求高。 为何将三项任务放在一起?社交媒体通过用户生成内容的可观测痕迹表征“用户身份”。我们将其概念化为三层: - 用户独特身份(任务 I) - 用户独特风格、语气(任务 II) - 潜在人口属性(任务 III) 因此,三项任务可连贯评估大模型对身份的推断与识别能力。 本文在大型 Twitter(X)数据集上评估 GPT、Gemini、DeepSeek、Llama、BERT 等 SOTA 大模型及传统 ML 基线,贡献如下: - 首次在统一框架下系统评估多款现代大模型在三项基础社交媒体分析任务。 - 任务 I 设计多样化用户/帖子抽样策略,并用 2024-01 之后新推文评估,避免数据泄露。 - 任务 II 提出基于活跃、资料丰富用户的结构化生成评估协议,结合词法、语义、多样性指标衡量真实性与流畅度权衡。 - 首次开展用户调研,比较自动指标与人类对 LLM 推文真实度的判断。 - 任务 III 采用 IAB Tech Lab 内容分类 v3.1 与 2018 美国 SOC 两大标准体系预测职业与兴趣,实现可复现标签与层级分析。 整体建立统一、可复现的基准框架。 备注:文中 Gemini、DeepSeek、Llama 均省略版本号。 ## 2 方法 见图 1:三项社交媒体分析任务总览。 所有任务均基于 Kheiri 等人 2023 的 Twitter 数据集(含时序好友图与用户帖子,见附录 A)。选 Twitter(X)因其文本中心、关系信号明确(关注网络、交互),利于可控基准。方法平台无关,可迁移。 ### 2.1 社交媒体作者身份验证 二分类:判断帖子是否由目标用户撰写。 **正例用户(与帖子)抽样** - 随机(Rnd) - 近期活跃(Rec):近三周活跃 - 高活(Top):发帖最多 对每位正例用户,按时序取: - k 条旧帖作 few-shot 示例 - m₁ 条新帖作正例评估 **负例帖子抽样** 与正例评估帖同时间段内取 m₂ 条他人帖子,策略: - 随机 - 主题相似:用嵌入取最相似帖 - 社交图:从关注/被关注/互关用户中取样,得 Followers-only、Followees-only、Reciprocal 三子集 **LLM 提示** 见附录 B Prompt 1。 **无偏(未见过)数据验证** 用 2024-01 之后推文(远超大模型训练截止)评估泛化。从 VAPOR 活跃用户(见 2.2)选 50 位,每人至少 k+m₁ 条原创推文, Prompt 同 Prompt 1。 **评估指标** 加权 F1。 ### 2.2 社交媒体帖子生成 评估大模型代用户生成逼真推文的能力,要求反映其风格、话题、社交语境。 **用户抽样** 限 2018–2020 期间原创推文≥200、粉丝≥500、关注≥100、个人简介非空且含 ade
相似文章
大型语言模型用于安全数据提取的基准测试
本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。
理解大语言模型的能力、限制和社会影响
来自 OpenAI 和斯坦福大学研究人员的全面讨论总结,涵盖 GPT-3 的技术能力、限制以及跨越计算机科学、语言学、哲学和政策等多个学科的更广泛社会影响。
大型语言模型能否模仿人类语音进行临床评估?基于LLM的数据增强方法用于认知评分预测
本文提出了一种基于大型语言模型的数据增强框架,利用GPT-5从书面锚点生成合成口语独白,用于从语音中预测认知评分。一种相似性引导的选择策略持续降低了预测误差,特别是对于少数低分参与者。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
SPIEval:评估大语言模型作为移动助手在分散个人信息上的表现
SPIEval是一个人工构建的基准测试,用于评估大语言模型作为移动助手在分散个人信息任务上的表现,涵盖10个应用中的250个任务。结果显示,即使是最佳模型GPT-5.5(xhigh),准确率也仅为57.3%,大多数失败源于信息定位不准确和验证不足。