Tag
This paper evaluates three NLP approaches (NER, keyword extraction, topic modelling) for automating keyword extraction in crowdsourced collections, using the Their Finest Hour Online Archive as a case study. It finds extractive models like open-weight ones are preferable for responsible deployment, while generative AI poses accountability risks.
This paper constructs a multimodal dataset of 1000 academic papers with text, images, and audio to study keyword extraction, showing that fusing multiple modalities improves performance.