让数据说话:利用AI从众包集合中提取关键词

arXiv cs.CL 论文

摘要

本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。

arXiv:2607.09324v1 公告类型:新 摘要:大规模识别和分配关键词是众包馆藏面临的技术、实践和伦理挑战。本文报告了“从众包集合中提取关键词”项目的研究成果,该项目以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。项目评估了三种自然语言处理方法来自动化关键词提取:命名实体识别、关键词提取和主题建模。这些方法在多种人工智能技术中进行了测试,从传统统计方法到现代生成式神经网络。我们的定量和定性结果表明,自然语言处理方法在众包集合中大规模提取关键词方面具有实际潜力,但没有单一方法能提供完整解决方案,且模型选择会显著影响结果。我们认为,在众包馆藏中,元数据是与活着的贡献者互动的直接产物,自动化关键词提取引发了独特的保管责任,这些责任必须与技术性能一并解决。开放权重的提取式模型在我们的评估中脱颖而出,最适合支持负责任部署,而生成式AI尽管具有抽象能力,但引入了问责风险,任何管理众包馆藏的人都应谨慎权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:57

# 让数据说话:利用 AI 从众包集合中提取关键词
来源:https://arxiv.org/abs/2607.09324
查看 PDF (https://arxiv.org/pdf/2607.09324)

> 摘要:大规模识别和分配关键词对于众包集合而言是一项技术、实践和伦理层面的挑战。本文报告了“从众包集合中提取关键词”项目的研究成果,该项目以牛津大学托管的众包二战数字档案馆“他们的光辉时刻在线档案”(Their Finest Hour Online Archive)为案例。项目评估了三种用于自动关键词提取的自然语言处理方法:命名实体识别、关键词提取和主题建模。项目对这些方法在一系列人工智能技术(从传统统计方法到现代生成式 AI 神经网络)上进行了测试。我们的定量和定性研究结果表明,自然语言处理方法在众包集合的大规模关键词提取方面具有实际潜力,但没有任何单一方法能提供完整的解决方案,且模型选择会显著影响结果。我们认为,在众包集合中,当元数据是与活跃贡献者直接互动的产物时,自动关键词提取会带来与性能并存的独特保管责任。开放权重、抽取式模型在我们的评估中脱颖而出,最适合支持负责任部署;而生成式 AI 尽管具有抽象化潜力,却引入了问责风险,任何管理众包集合的人都应谨慎权衡。

## 提交历史

来自:Miguel Arana-Catania [查看电子邮件 (https://arxiv.org/show-email/a0eabe5a/2607.09324)] **[v1]** 2026年7月10日 星期五 12:06:18 UTC (501 KB)

相似文章

使用可解释语言特征检测AI生成假新闻的跨提示词泛化研究

arXiv cs.CL

来自肯尼索州立大学的研究人员利用可解释语言特征(词汇多样性、可读性、情感特征)对检测AI生成假新闻的跨提示词泛化能力展开研究。在一种提示策略上训练、在另一种提示策略上测试的随机森林分类器取得了0.988至1.000的AUC值,表明这些特征能够捕捉AI生成文本的稳定且可泛化的属性。