用户对生成式人工智能的看法:应用商店评论中信任与摩擦的跨平台自然语言处理分析

arXiv cs.CL 论文

摘要

本文呈现了一项跨平台自然语言处理分析,针对六大生成式AI应用的17,012条应用商店评论,识别出广告、认证和定价等关键信任与摩擦障碍,并发现跨平台显著的情感差异。

arXiv:2609.19151v1 公告类型:新 摘要:生成式人工智能(GenAI)应用已实现快速的消费者采用,但鲜有大规模研究考察用户感知的质量、信任和采用障碍。我们呈现了首批针对六大GenAI应用(ChatGPT、Gemini、Microsoft Copilot、Claude、DeepSeek和Perplexity)应用商店评论的跨应用分析,包含来自Google Play和Apple App Store的17,012条英文评论。我们结合了BERTopic主题建模和RoBERTa情感分类,并使用卡方检验、Kruskal-Wallis检验和多项逻辑回归(带有Bonferroni校正)评估跨应用差异。两个组件均通过分层抽样的300条评论与人工编码进行验证。结果显示,负面情感集中在广告(91%)、认证(89%)、服务器可靠性(83%)和订阅定价(73%)。情感在不同应用间存在显著差异,其中Claude表现出最高的负面情感(47.7%),同时拥有强烈热情的用户群,表明存在统计学上显著的极化现象。尽管应用间评论数量不均,这些发现仍然稳健。作为探索性观察,部分DeepSeek评论提出了与其中国起源相关的地缘政治和数据隐私关切,而提出的信任摩擦评分将特定于应用的信任和可用性障碍总结为可解释的维度。该研究为消费者生成式AI应用中的用户信任、可用性和采用障碍提供了经过验证且可操作的证据。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:47

# 用户如何看待生成式人工智能:应用商店评论中信任与摩擦的跨平台自然语言处理分析
来源:https://arxiv.org/html/2609.19151 \\tnotemark \[1\]\\tnotetext\[1\]预印本\. 本文已提交至\(Elsevier\),目前正在同行评审中\. \\cormark \[1\]\\credit概念化,方法论,软件,数据管理,写作 \- 初稿 1\]单位=KFCIS, 佛罗里达国际大学, 城市=迈阿密, 州=佛罗里达, 国家=美国 \\credit验证,监督,写作 \- 审阅与编辑 2\]单位=DoA, 孟加拉国工程技术大学, 城市=达卡, 国家=孟加拉国 Umme Nusrat Jahanujaha001@fiu\.eduShouvaggo Sharif Shammoshouvaggo\.shammo@buet\.ac\.bd\[ 
###### 摘要 
生成式人工智能(GenAI)应用已迅速获得消费者采用,但鲜有大规模研究考察用户感知的质量、信任及采用障碍。据我们所知,本文首次对六款主流GenAI应用(ChatGPT、Gemini、Microsoft Copilot、Claude、DeepSeek和Perplexity)的应用商店评论进行了跨应用分析,涵盖了来自Google Play和Apple App Store的17,012条英文评论。我们结合了使用all-MiniLM-L6-v2嵌入的BERTopic主题建模与RoBERTa情感分类,并通过卡方检验、Kruskal-Wallis检验及带有Bonferroni校正的多项式逻辑回归来测试跨应用差异。两个组成部分均通过人工编码进行了验证:对分层抽取的300条评论样本进行了手动主题编码(评估者间κ\\kappa= 0.544),并为相同样本标注了人工情感标签(RoBERTa准确率为75.3%,宏F1值F\_\{1\}= 0.73;评估者间κ\\kappa= 0.89)。正如已确立的、经过情感验证的研究所示,负面情绪集中于特定的摩擦主题——广告(91%负面)、身份验证(89%)、服务器可靠性(83%)和订阅定价(73%)——并且情感在不同应用间存在显著差异;Claude表现出最高的负面情感(47.7%),同时具有强烈热情的用户核心,这是一种经过统计验证的极化现象。这些跨应用结论在考虑了应用评论数量不均衡的情况下依然稳健。作为探索性观察(我们谨慎提出,因为主题建模对抽象构念的捕捉能力较弱),部分DeepSeek评论因其中文背景而出现了与地缘政治和数据隐私相关的担忧,并且我们提出了一个“信任摩擦评分”,可将每个应用的摩擦分解为可操作的子维度(其与负面情绪的等级相关性ρ\\rho= 0.886,在六个应用中具有说明性而非推断性意义)。本研究为消费者GenAI中的质量和信任障碍提供了经过验证的、可操作的证据。
###### 关键词:生成式人工智能\\sep应用商店评论\\sep信任\\sep可用性\\sepBERTopic\\sep情感分析 
{要点}
分析了来自六款领先生成式人工智能应用的17,012条应用商店评论。
应用BERTopic主题建模和RoBERTa情感分析来识别用户关切。
账户摩擦、广告和订阅定价成为主要的采用障碍。
比较分析揭示了GenAI平台间显著的情感差异。
提供了首批基于跨平台自然语言处理的GenAI应用评论研究之一。

## 1 引言
生成式AI应用的演变见证了从实验模型到面向消费者的解决方案的真正显著转变,其速度前所未有。OpenAI的ChatGPT发布后仅两个月,月活跃用户数就已超过1亿,使其成为有史以来采用速度最快的消费技术之一\[hu2023generative\]。此后,其范围不断扩大,成为激烈竞争格局的一部分,其中包括Google Gemini、Microsoft Copilot、Anthropic Claude、DeepSeek和Perplexity等,这些应用今天都服务于数亿用户\[zhao2023survey,chang2024survey\]。移动应用商店已成为此类应用的主要分发平台,生成式AI应用在2025年和2026年 consistently 登上Google Play和Apple App Store最受欢迎类别的榜单\[statista2025genai\]。鉴于这些应用的快速采用,生成式AI为研究用户对智能系统的感知和遇到的困难提供了一个独特的场景。
尽管采用了如此之快,但关于日常使用的生成式AI工具用户体验的学术知识仍然缺乏关注。现有文献表明,用户对基于AI系统的信任取决于多种因素的组合,包括系统的准确性、输出清晰度、数据隐私以及一般情境\[zhang2020effect,jacovi2021formalizing,siau2018building\]。正如可用性研究所示,设计质量、引导流程、身份验证系统和可负担性已被证明是模型能力水平与用户满意度之间的关键中介因素\[amershi2019software,nielsen1994usability\]。然而,该领域的现有实证研究绝大多数由实验室实验、样本量有限的访谈研究或研究人员开发的、在某一时间点测量用户态度的调查所主导\[jakesch2023human,kapania2022because\]。尽管这些方法在确定特定因素方面很重要,但它们无法整合用户与生成式AI工具自然交互时出现的广泛多样和自发的问题。
应用商店评论为解决这一差距提供了一个独特且未被充分利用的数据来源。与基于调查的方法相比,评论撰写是在使用应用时自发进行的可选任务,因此反映了用户对与其重要关切问题的自发反应,而非研究人员预先设定的答案量表\[pagano2013user,chen2014ar\]。评论挖掘已成功应用于软件工程研究领域,用于需求获取、缺陷检测、功能优先级排序和用户满意度评估\[maalej2016automatic,guzman2014users,martin2017survey\]。由于移动应用商店是消费者面向的生成式AI工具的主要访问点,其积累的评论代表了最广泛用户群的声音,包括不太可能参与正式学术研究或对照实验的非专业用户。
然而,目前利用应用商店评论来开发生成式AI应用的努力在范围和方法论上都受到限制。根据Alabduljabbar\[alabduljabbar2024\],仅研究了五款GenAI应用和11,549条评论,使用VADER情感分析和LDA主题建模,这两种方法能够捕捉情感极性,但无法捕捉围绕AI讨论的复杂性。在Meng等人的论文\[meng2026\]中,他们的模型扩展到约10万条评论,但仅考虑了功能提取,忽略了对信任和采用模型的任何考量。重要的是,这两项研究都没有使用最新技术,如DeepSeek、Claude或Perplexity,它们属于全新的人工智能类别。最重要的是,据我们所知,很少有现有研究通过信任、可用性和负责任采用相结合的视角来构建生成式AI应用评论的框架,而这正是日益增长的AI系统人文因素研究领域所呼吁的分析视角\[liao2023ai,weisz2024design\]。
本文通过展示对从六款主要生成式AI应用(ChatGPT、Gemini、Microsoft Copilot、Claude、DeepSeek和Perplexity)收集的用户评论进行的大规模、混合方法分析,来填补这些空白。如表1(https://arxiv.org/html/2609.19151#S3.T1)所示,我们从Google Play和Apple App Store收集了54,748条原始评论。经过语言过滤、最小长度强制和去重后,保留了17,012条英文评论用于分析,时间跨度为2025年9月至2026年5月。我们采用BERTopic\[grootendorst2022bertopic\]配合上下文句子嵌入(all-MiniLM-L6-v2)进行主题建模,并辅以基于RoBERTa的cardiffnlp/twitter-roberta-base-sentiment-latest模型\[loureiro2022timelms\]进行基于Transformer的情感分类。这些自动化分析通过带有Bonferroni校正的卡方检验和非参数统计检验进行补充,并通过对分层抽取的300条评论样本进行手动主题编码进行验证。
该研究由三个研究问题引导:
- RQ1:生成式AI应用的应用商店评论中表达的主要用户关切和讨论主题是什么?
- RQ2:用户情感在主要生成式AI应用之间以及移动平台之间有何不同?
- RQ3:哪些信任、可用性和采用因素与负面用户体验最密切相关?
本工作的贡献有三方面:
1. 1. 首批针对生成式AI应用用户生成评论的跨应用比较研究之一,覆盖六款竞争产品,其中包括三款(DeepSeek、Claude和Perplexity)据我们所知尚未在应用商店挖掘文献中进行过研究,分析了来自Google Play和Apple App Store的17,012条评论。
2. 2. 在先前工作\[alabduljabbar2024\]采用的LDA和VADER流程基础上的方法论进步,展示了使用上下文嵌入的BERTopic和基于RoBERTa的Transformer情感分析实现了更精细的主题粒度。我们还贡献了一个方法论发现:BERTopic能有效处理词汇上区分开的主题(例如,账户问题、订阅相关抱怨),但它无法处理像信任和隐私这样的抽象主题(κ=0.241\\kappa=0.241),这突显了在研究移动应用评论时手动验证主题的重要性。
3. 3. 关于消费者GenAI中的信任、可用性和采用抑制因素的实证发现,包括身份验证和广告作为主要摩擦点、订阅定价作为采用障碍、与DeepSeek中文背景相关的探索性地缘政治-信任主题,以及一种极化模式,即Claude将最高的负面情感与强烈热情的用户核心相结合。完整的统计数据和显著性检验报告在第4节(https://arxiv.org/html/2609.19151#S4)。
本文其余部分组织如下:第2节(https://arxiv.org/html/2609.19151#S2)回顾了关于信任和用户对生成式AI感知、AI应用可用性评估以及应用商店评论挖掘的相关工作。第3节(https://arxiv.org/html/2609.19151#S3)描述了研究方法,包括数据收集、预处理、主题建模、情感分析、统计检验和手动主题验证。第4节(https://arxiv.org/html/2609.19151#S4)按研究问题组织呈现结果。第5节(https://arxiv.org/html/2609.19151#S5)讨论了研究结果及其对研究和实践的启示。第6节(https://arxiv.org/html/2609.19151#S6)阐述了效度威胁,第7节(https://arxiv.org/html/2609.19151#S7)总结全文。
## 2 相关工作
本章介绍了与我们研究相关的三个领域的文献综述:(a) 关于信任和用户对生成式AI感知的文献(第2.1节 (https://arxiv.org/html/2609.19151#S2.SS1)),(b) 关于AI应用可用性评估的文献(第2.2节 (https://arxiv.org/html/2609.19151#S2.SS2))以及最后 (c) 关于作为研究方法的应用商店评论挖掘的文献(第2.3节 (https://arxiv.org/html/2609.19151#S2.SS3))。
### 2.1 生成式人工智能的信任与用户感知
信任的概念长期以来一直被确立为影响潜在用户采用新技术的一个关键因素。Davis提出的明确表示,感知有用性和感知易用性是共同影响采用新系统的行为意向的两个关键要素\[davis1989tam\],而技术接受模型(TAM)的近期扩展将信任作为一个单独因素纳入,在不确定情况下其重要性日益增加。
在自动化和智能领域,Hoff和Bashir\[hoff2015trust\]通过综合十年来关于自动化信任的实证研究,发展了一个精细的三层信任理论。特别是,作者识别了倾向信任( predispositional trust,使个体倾向于信任他人的先天人格因素)、情境信任(situational trust,由情境产生的因素,如任务复杂性和风险)和习得信任(learned trust,通过与系统互动经验获得的信任)。由于生成式AI的出现,信任问题变得比以往更加复杂。其他自动化流程遵循明确的算法,而生成式AI系统灵活、创造性地生成输出,使得检查结果或识别错误变得不可能\[zhang2020effect,jacovi2021formalizing\]。根据Siau和Wang的研究,AI系统初始信任的发展可以通过呈现(系统如何自我介绍)和技术理解来解释,而进一步的信任则基于系统的感知性能、流程可见性及其使用\[siau2018building\]。
实证研究验证了这些理论预期。2025年在全球47个国家对48,000人进行的一项研究指出,虽然66%的人定期使用AI,但只有46%的人愿意信任该系统\[gillespie2025trust\]。这种较低的信任水平趋势并非普遍,而是取决于应用领域、用户特征,更重要的是国籍。随着中国AI技术的发展,与信任相关的地缘政治考量变得更加重要。DeepSeek在2025年1月首次亮相后迅速的国际扩张立即引发了安全担忧,导致台湾、美国部分政府机构和一些欧洲组织对其实施禁令\[deepseek2025security\]。独立的安全评估揭示了DeepSeek安全过滤机制存在重大漏洞\[cisco2025deepseek\],其隐私政策确认用户数据存储在中国的服务器上,受中国数据治理法律管辖。这些地缘政治信任担忧代表了与人机交互研究中传统研究的基于性能的信任因素截然不同的一类问题,但目前还没有实证研究考察普通用户如何通过应用商店评论等自然反馈渠道,用自己的语言表达这些关切。
越来越多的定性和混合方法研究开始通过用户体验视角来审视生成式AI中的信任。使用访谈和日记方法的研究探讨了用户如何在AI介导的情感支持中建立信任\[generativeconfidants2025\],而其他研究则调查了透明度和可解释性在校准对大语言模型输出信任方面的作用\[liao2023ai\]。基于调查的研究证实,对生成式AI的信任是多维度的,包含对能力、善意和互惠性的信念\[chen2025trustscale\]。然而,这些研究通常招募的是已经了解并关注AI的自选参与者,可能错过了

相似文章

生成式AI网站流量份额

Reddit r/singularity

对生成式AI网站流量份额的分析,突出显示哪些平台正在增加或减少访客。

使用生成式AI创建和评估用户画像:81篇文章的范围综述

arXiv cs.CL

本范围综述分析了81篇(2022-2025年)关于使用生成式AI创建和评估用户画像的文章,指出了其在可重复性方面的优势,但同时也揭示了关键问题:45%的研究缺乏评估,86%过度依赖GPT模型,以及存在同一模型既生成又评估画像的循环风险。

人工智能在在线评论中的作用

arXiv cs.CL

本文介绍了一种实证方法,用于衡量大型语言模型供应冲击对在线评论的影响,发现未经验证的评论向更负面方向转变,并且出现活动激增,表明人工智能正在重塑平台动态。