大型语言模型能否可靠地编码定性人道主义数据?一项与人类专家裁决对比的基准研究
摘要
这项基准研究评估了46个大型语言模型与人类专家在编码定性人道主义数据方面的表现,发现通过结构化提示和推理,LLM可以达到与人类相当的可靠性,但对于细微主题仍需仔细监督。
arXiv:2606.26541v1 公告类型:新
摘要:受影响人口的数据对于指导人道主义响应至关重要,但其价值取决于对细微需求描述的及时且一致的解读。人道主义组织往往缺乏大规模分析此类信息所需的人员、时间和专业知识。大型语言模型(LLM)可能扩展这一能力,但其在编码定性人道主义数据方面的可靠性尚未得到直接验证。本基准研究使用150份高保真合成人道主义记录,将46个LLM与人类黄金标准进行了比较。评估结合了Krippendorff's alpha的评分者间信度测试、区分正确、接近正确和错误编码的差异分析,以及基于人道主义特定标准(包括歧视、复杂需求层次和非标准沟通方式)的定性评估。作者发现,多个LLM在演绎编码上的可靠性水平可与经验丰富的人类编码员相媲美,尤其是在使用结构化提示和启用推理的配置时。同时,仅靠总体可靠性指标不足以支持部署决策。各模型在识别间接表达的需求、预定义类别之外的需求以及保护相关问题(如人身安全和歧视)方面表现各异。这些结果表明,LLM可以显著扩增人道主义分析能力,但不能替代人类判断。适当使用需要结构化编码手册、支持推理的模型、关注主题特定表现,以及针对误编码将产生最大项目后果的类别进行分层监督。对于敏感的人道主义数据,部署在自有基础设施上的开放权重模型可能提供一种既实现分析可扩展性又加强数据治理的可行途径。
查看缓存全文
缓存时间: 2026/06/26 05:21
# 大型语言模型能否可靠地编码定性人道主义数据?一项与人类专家裁决的基准研究 来源: https://arxiv.org/abs/2606.26541 查看PDF (https://arxiv.org/pdf/2606.26541) > **摘要**:来自受影响人群的数据对于指导人道主义响应至关重要,但其价值取决于对细微需求叙述的及时且一致的解读。人道主义组织通常缺乏大规模分析这些信息所需的人员、时间和专业专长。大型语言模型(LLMs)或可扩展这一能力,但它们用于编码定性人道主义数据的可靠性尚未得到直接验证。本基准研究将46个LLM与基于150份高保真合成人道主义文本的人类黄金标准进行了比较。评估结合了Krippendorff's alpha的信度检验、区分正确、接近正确和错误编码的差异分析,以及针对人道主义特定标准(包括歧视、复杂需求层级和非标准沟通风格)的定性评估。作者发现,多个LLM在执行演绎编码时能达到与经验丰富的人类编码者相当的信度水平,尤其是在使用结构化提示和启用推理能力的配置时。与此同时,仅靠综合信度指标不足以指导实际部署决策。模型在识别间接表达的需求、超出预定义类别的需求以及与保护相关的问题(如人身安全和歧视)方面存在差异。这些发现表明,LLM能够实质性扩展现有的人道主义分析能力,但并不能替代人类判断。合理使用需要结构化的编码手册、启用推理能力的模型、关注主题特定表现,以及针对编码错误会造成最大项目后果的类别进行分层监督。对于敏感的人道主义数据,部署在自托管基础设施上的开放权重模型或许能提供一条兼顾分析可扩展性与更强数据治理的可行路径。 ## 提交历史 **发件人:Patrick Vinck** [查看邮件 (https://arxiv.org/show-email/d048f44d/2606.26541)] **[v1]** 2026年6月25日 星期四 02:27:23 UTC (632 KB)
相似文章
大语言模型可通过正确提示更好地捕捉人类判断
本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
使用大语言模型在危机报告中提取和三角验证因果证据:基于ReliefWeb的研究
本文提出了一种两阶段的大语言模型流水线,用于从人道主义危机报告中提取和三角验证因果证据,在ReliefWeb数据集上取得了较高的F1分数,并提出了一种证据水平评分,用于衡量跨情境的一致性。
大型语言模型能否革新调查研究?以灾害防备响应的实验为例
本文提出一个五阶段框架,将大型语言模型整合到调查研究中,以应对回复率下降、样本偏差和欺诈性完成等问题。基于2024年米尔顿飓风调查数据,作者提出了一种理论知情的LLM(A-TLM),在缺失数据场景中优于经典插补方法,并通过基于事实的拒答机制展示了可控的幻觉风险。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。