开发并验证大型语言模型依赖量表(LLM-D12-SP)的西班牙语版本
摘要
本文验证了大型语言模型依赖量表(LLM-D12-SP)的西班牙语版本,确认了其双因子结构和良好的心理测量学特性。
arXiv:2607.22041v1 公告类型: new
摘要: 随着大型语言模型(LLMs)越来越多地用于组织及工作场景中的任务执行、决策支持和沟通交流,可靠且经过跨文化验证的心理测量工具的需求日益增长,以评估对LLMs的心理依赖。这一需求在西班牙语人群中尤为突出——尽管LLM应用正在迅速普及,但经过验证的心理测量工具仍然稀缺。本研究首次报告了大型语言模型依赖量表(LLM-D12-SP)西班牙语版本的验证,扩展了之前在英语和阿拉伯语样本中开展的验证工作。LLM-D12是一个双维度量表,测量工具性依赖(依赖LLM执行任务和支持决策)和关系性依赖(心理上依赖LLM获得陪伴和社交互动)。共有386名西班牙语参与者(平均年龄28.0岁,标准差6.1;55%男性)完成了LLM-D12-SP。验证性因子分析支持了原有的双因子结构。量表显示出良好的内部一致性(总Cronbach's alpha = 0.89;工具性维度0.86;关系性维度0.85)。区分效度分析表明,两个子维度代表相关但不同的构念。外部效度验证显示,两个依赖维度均与网络成瘾和对LLM的感知可信度呈正相关,而与认知需求的关联较弱或无关联。结合先前英语和阿拉伯语的验证结果,这些发现为量表结构的跨语言支持提供了证据,并为研究组织情境中LLM使用的心理方面提供了一个心理测量学上可靠的工具。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 开发与验证西班牙语版大型语言模型依赖量表(LLM-D12-SP) 来源:https://arxiv.org/abs/2607.22041 查看 PDF (https://arxiv.org/pdf/2607.22041) > **摘要:**随着大型语言模型(LLM)越来越多地被用于组织和工作场景中的任务执行、决策制定及沟通交流,人们对可靠且经过文化验证的评估工具(用于衡量对LLM的心理依赖)的需求日益增长。这一需求在西班牙语使用者群体中尤为突出——该群体中LLM的应用正在迅速扩展,但经过验证的心理测量工具仍然稀缺。本研究首次报告了西班牙语版大型语言模型依赖量表(LLM-D12-SP)的验证工作,是对先前在英语和阿拉伯语样本中进行的验证的扩展。LLM-D12是一个二维量表,分别评估工具性依赖(依赖LLM完成任务和支持决策)和关系性依赖(依赖LLM作为陪伴和社交互动的心理依赖)。共有386名西班牙语使用者参与(平均年龄28.0岁,标准差6.1;55%为男性),完成了LLM-D12-SP量表。验证性因素分析支持了原有的两因素结构。该量表表现出良好的内部一致性(总量表Cronbach's alpha=0.89;工具性维度0.86;关系性维度0.85)。区分效度分析表明,两个子量表代表了相关但不同的构念。外部验证显示,两个依赖维度均与网络成瘾及对LLM的信任感呈正相关,而与认知需求呈弱相关或不相关。结合先前的英语和阿拉伯语验证结果,这些发现为量表结构的跨语言支持提供了依据,并为在组织环境中研究LLM使用的心理层面提供了心理测量学上可靠的工具。 ## 提交历史 来自:Mo El-Haj [查看邮件 (https://arxiv.org/show-email/aad691d8/2607.22041)] **[v1]** 2026年7月24日星期五 07:09:56 UTC (2,657 KB)
相似文章
评估大语言模型的发展性认知能力
本文引入了发展性句子补全测试(DSCT),用于评估大语言模型识别文本中发展性认知阶段的能力。研究发现,模型在合成人设上的表现优于真实人类回答。
当症状不足以诊断:大型语言模型在精神科筛查中的证据加权模式
本文介绍了一个以SCID为锚定的555次访谈基准,用于评估五种大型语言模型(LLMs)在精神科筛查中的表现。研究发现,虽然模型展现出潜力,但它们在存在功能保留或保护性背景的情况下倾向于低估症状证据,因此需要谨慎验证。
大型语言模型响应的全面评估:多因素评分系统
本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。
大型语言模型能否革新调查研究?以灾害防备响应的实验为例
本文提出一个五阶段框架,将大型语言模型整合到调查研究中,以应对回复率下降、样本偏差和欺诈性完成等问题。基于2024年米尔顿飓风调查数据,作者提出了一种理论知情的LLM(A-TLM),在缺失数据场景中优于经典插补方法,并通过基于事实的拒答机制展示了可控的幻觉风险。
重新思考LLMs的心理测量学评估:自我报告何时以及为何能预测行为
本文研究了自我报告的心理测量指标何时以及为何能预测大型语言模型的实际行为,发现细粒度、行为特定的工具(计划行为理论)在同一对话中达到了人类水平的连贯性,而像大五人格这样的宽泛特质则不能。