评估大语言模型在社交媒体分析中的能力:多任务探索

arXiv cs.CL 论文

摘要

犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。

arXiv:2604.18955v1 公告类型:新增 摘要:本研究首次对现代大语言模型——包括GPT-4、GPT-4o、GPT-3.5-Turbo、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2和BERT——在Twitter(X)数据集上的三大核心社交媒体分析任务进行系统评估:(I)社交媒体作者身份验证,(II)社交媒体帖子生成,(III)用户属性推断。针对作者身份验证,我们提出系统采样框架,涵盖多样化用户与推文选择策略,并在2024年1月起新收集的推文上评估泛化能力,以缓解“已见数据”偏差。在帖子生成任务中,采用综合评估指标衡量LLM生成真实、类用户内容的能力。连接任务I与II,我们开展用户研究,测量真实用户对基于其自身写作风格生成的LLM帖子的感知。对于属性推断,我们使用两套标准化分类体系(IAB Tech Lab 2023与2018美国SOC职业分类)对职业与兴趣进行标注,并将LLM与现有基线对比。总体而言,我们的统一评估提供新见解,并建立LLM驱动社交媒体分析的可复现基准。代码与数据见补充材料,并将在论文发表后公开。
查看原文
查看缓存全文

缓存时间: 2026/04/22 08:29

# 评估大模型在社交媒体分析中的能力:多任务探索  
来源:https://arxiv.org/html/2604.18955  

Ramtin Davoudi 犹他州立大学 [email protected]  
Kartik Thakkar 犹他州立大学 [email protected]  
Nazanin Donyapour 独立研究者 [email protected]  
Tyler Derr 范德堡大学 [email protected]  
Hamid Karimi 犹他州立大学 [email protected]  

###### 摘要  
本文首次对现代大模型——包括 GPT-4、GPT-4o、GPT-3.5-Turbo、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2 和 BERT——在 Twitter(X)数据集上三项核心社交媒体分析任务进行系统评估:  
I. 社交媒体作者身份验证  
II. 社交媒体帖子生成  
III. 用户属性推断  

在作者身份验证中,我们提出系统抽样框架,覆盖多样化用户与帖子选择策略,并在 2024 年 1 月之后新采集的推文上测试泛化能力,以缓解“已见数据”偏差。  
在帖子生成中,我们用综合指标评估大模型生成真实、类用户内容的能力。  
连接任务 I 与 II,我们开展用户调研,测量真实用户对以其风格生成内容的感知。  
在属性推断中,我们使用 IAB Tech Lab 2023 与 2018 美国标准职业分类(SOC)两大标准分类体系标注职业与兴趣,并将大模型与基线对比。  
整体而言,本研究提供新见解,并建立可复现的大模型社交媒体分析基准。代码与数据见补充材料,录用后公开。  

## 1 引言  
在线社交平台已成为现代生活的一部分,产生海量用户内容,为营销、公共卫生、危机管理等提供独特洞察,形成“社交媒体分析”这一活跃领域。尽管自 Facebook、Twitter(现 X)兴起以来该领域进展显著,但仍面临关键挑战:用户文本非正式、歧义、低质(如垃圾、梗图),且语言演化迅速(新俚语、新梗),导致模型易过时。  

近期大模型(GPT、DeepSeek、Gemini 等)在海量多样化语料上训练,展现出在动态噪声环境中理解与生成语言的强大能力,在情感分析、立场检测、谣言识别、主题提取、摘要等任务上仅需极少监督即可取得竞争力结果。  

本文在统一框架下实证评估大模型三项核心社交媒体分析任务:  
I. 社交媒体作者身份验证  
II. 社交媒体帖子生成  
III. 用户属性推断  

任务 I 判断某帖是否由指定用户撰写,虽在数字取证、抄袭检测中已有研究,但社交媒体文本短、质量低,挑战更大。  
任务 II 生成符合用户风格与偏好的帖子;虽文本生成已被广泛研究,但真实个性化社媒内容仍难生成,大模型正被越来越多地用于此目的。  
任务 III 从文本预测用户属性(职业、兴趣),支撑个性化与大规模行为分析,但标签歧义、细粒度分类要求高。  

为何将三项任务放在一起?社交媒体通过用户生成内容的可观测痕迹表征“用户身份”。我们将其概念化为三层:  
- 用户独特身份(任务 I)  
- 用户独特风格、语气(任务 II)  
- 潜在人口属性(任务 III)  

因此,三项任务可连贯评估大模型对身份的推断与识别能力。  

本文在大型 Twitter(X)数据集上评估 GPT、Gemini、DeepSeek、Llama、BERT 等 SOTA 大模型及传统 ML 基线,贡献如下:  
- 首次在统一框架下系统评估多款现代大模型在三项基础社交媒体分析任务。  
- 任务 I 设计多样化用户/帖子抽样策略,并用 2024-01 之后新推文评估,避免数据泄露。  
- 任务 II 提出基于活跃、资料丰富用户的结构化生成评估协议,结合词法、语义、多样性指标衡量真实性与流畅度权衡。  
- 首次开展用户调研,比较自动指标与人类对 LLM 推文真实度的判断。  
- 任务 III 采用 IAB Tech Lab 内容分类 v3.1 与 2018 美国 SOC 两大标准体系预测职业与兴趣,实现可复现标签与层级分析。  

整体建立统一、可复现的基准框架。  
备注:文中 Gemini、DeepSeek、Llama 均省略版本号。  

## 2 方法  
见图 1:三项社交媒体分析任务总览。  

所有任务均基于 Kheiri 等人 2023 的 Twitter 数据集(含时序好友图与用户帖子,见附录 A)。选 Twitter(X)因其文本中心、关系信号明确(关注网络、交互),利于可控基准。方法平台无关,可迁移。  

### 2.1 社交媒体作者身份验证  
二分类:判断帖子是否由目标用户撰写。  

**正例用户(与帖子)抽样**  
- 随机(Rnd)  
- 近期活跃(Rec):近三周活跃  
- 高活(Top):发帖最多  

对每位正例用户,按时序取:  
- k 条旧帖作 few-shot 示例  
- m₁ 条新帖作正例评估  

**负例帖子抽样**  
与正例评估帖同时间段内取 m₂ 条他人帖子,策略:  
- 随机  
- 主题相似:用嵌入取最相似帖  
- 社交图:从关注/被关注/互关用户中取样,得 Followers-only、Followees-only、Reciprocal 三子集  

**LLM 提示**  
见附录 B Prompt 1。  

**无偏(未见过)数据验证**  
用 2024-01 之后推文(远超大模型训练截止)评估泛化。从 VAPOR 活跃用户(见 2.2)选 50 位,每人至少 k+m₁ 条原创推文, Prompt 同 Prompt 1。  

**评估指标**  
加权 F1。  

### 2.2 社交媒体帖子生成  
评估大模型代用户生成逼真推文的能力,要求反映其风格、话题、社交语境。  

**用户抽样**  
限 2018–2020 期间原创推文≥200、粉丝≥500、关注≥100、个人简介非空且含 ade

相似文章

大型语言模型用于安全数据提取的基准测试

arXiv cs.CL

本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。

理解大语言模型的能力、限制和社会影响

OpenAI Blog

来自 OpenAI 和斯坦福大学研究人员的全面讨论总结,涵盖 GPT-3 的技术能力、限制以及跨越计算机科学、语言学、哲学和政策等多个学科的更广泛社会影响。

SPIEval:评估大语言模型作为移动助手在分散个人信息上的表现

Hugging Face Daily Papers

SPIEval是一个人工构建的基准测试,用于评估大语言模型作为移动助手在分散个人信息任务上的表现,涵盖10个应用中的250个任务。结果显示,即使是最佳模型GPT-5.5(xhigh),准确率也仅为57.3%,大多数失败源于信息定位不准确和验证不足。