让数据说话:利用AI从众包集合中提取关键词
摘要
本文评估了三种NLP方法(命名实体识别、关键词提取、主题建模)在自动化提取众包集合关键词中的应用,以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。研究发现,像开放权重模型这样的提取式模型更适合负责任地部署,而生成式AI则带来问责风险。
arXiv:2607.09324v1 公告类型:新
摘要:大规模识别和分配关键词是众包馆藏面临的技术、实践和伦理挑战。本文报告了“从众包集合中提取关键词”项目的研究成果,该项目以Their Finest Hour Online Archive(牛津大学托管的二战众包数字馆藏)为案例研究。项目评估了三种自然语言处理方法来自动化关键词提取:命名实体识别、关键词提取和主题建模。这些方法在多种人工智能技术中进行了测试,从传统统计方法到现代生成式神经网络。我们的定量和定性结果表明,自然语言处理方法在众包集合中大规模提取关键词方面具有实际潜力,但没有单一方法能提供完整解决方案,且模型选择会显著影响结果。我们认为,在众包馆藏中,元数据是与活着的贡献者互动的直接产物,自动化关键词提取引发了独特的保管责任,这些责任必须与技术性能一并解决。开放权重的提取式模型在我们的评估中脱颖而出,最适合支持负责任部署,而生成式AI尽管具有抽象能力,但引入了问责风险,任何管理众包馆藏的人都应谨慎权衡。
查看缓存全文
缓存时间: 2026/07/13 07:57
# 让数据说话:利用 AI 从众包集合中提取关键词 来源:https://arxiv.org/abs/2607.09324 查看 PDF (https://arxiv.org/pdf/2607.09324) > 摘要:大规模识别和分配关键词对于众包集合而言是一项技术、实践和伦理层面的挑战。本文报告了“从众包集合中提取关键词”项目的研究成果,该项目以牛津大学托管的众包二战数字档案馆“他们的光辉时刻在线档案”(Their Finest Hour Online Archive)为案例。项目评估了三种用于自动关键词提取的自然语言处理方法:命名实体识别、关键词提取和主题建模。项目对这些方法在一系列人工智能技术(从传统统计方法到现代生成式 AI 神经网络)上进行了测试。我们的定量和定性研究结果表明,自然语言处理方法在众包集合的大规模关键词提取方面具有实际潜力,但没有任何单一方法能提供完整的解决方案,且模型选择会显著影响结果。我们认为,在众包集合中,当元数据是与活跃贡献者直接互动的产物时,自动关键词提取会带来与性能并存的独特保管责任。开放权重、抽取式模型在我们的评估中脱颖而出,最适合支持负责任部署;而生成式 AI 尽管具有抽象化潜力,却引入了问责风险,任何管理众包集合的人都应谨慎权衡。 ## 提交历史 来自:Miguel Arana-Catania [查看电子邮件 (https://arxiv.org/show-email/a0eabe5a/2607.09324)] **[v1]** 2026年7月10日 星期五 12:06:18 UTC (501 KB)
相似文章
神经数据不再无聊:代理型AI在数据复用中的基准测试
本文对代理型AI系统在加载、理解和重新格式化碎片化的神经科学数据任务上进行基准测试,发现尽管代理在子任务上表现良好,但很少能实现完全无错误的端到端解决方案,人工监督仍然必要。
DocAnnot——利用生成式AI驱动的自动标注加速关键信息提取数据集的创建
介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。
@so_ainsight: 杂乱的文档,一条命令即可转化为结构化知识。向AI喂文档时,一个隐秘的难题是...
Hyper-Extract 是一款 Apache 2.0 开源工具,能将非结构化文档转换为结构化知识库,支持知识图谱、时间序列数据、空间信息,实现高精度AI查询。
利用人类阅读时产生的认知信号增强微博关键词提取
本文研究了脑电图信号能否补充眼动追踪信号用于微博的自动关键词提取。使用ZuCo语料库,作者表明认知信号,特别是脑电图信号,在不同模型上均能提升自动关键词提取的性能。
使用可解释语言特征检测AI生成假新闻的跨提示词泛化研究
来自肯尼索州立大学的研究人员利用可解释语言特征(词汇多样性、可读性、情感特征)对检测AI生成假新闻的跨提示词泛化能力展开研究。在一种提示策略上训练、在另一种提示策略上测试的随机森林分类器取得了0.988至1.000的AUC值,表明这些特征能够捕捉AI生成文本的稳定且可泛化的属性。