标签
本文提出了MiNER,一个微调的BioBERT模型,用于从疟疾相关临床文本中提取生物医学实体,并发布了一个人工标注的数据集以供未来研究。
介绍AutoSpecNER,一个由专家标注的车辆列表细粒度命名实体识别数据集,包含659条广告,标注了15种实体类型。基准测试结果显示,DeBERTa取得了90%的微平均F1分数,优于基于规则的方法和大型语言模型。
RedactionBench 是一个手工标注的基准,用于评估大语言模型中的上下文个人身份信息(PII)脱敏,提出了 R-Score 指标,并表明上下文脱敏仍是一个未解决的问题。
本文介绍了MHGraphBench,这是一个基于知识图谱的基准测试,用于评估大语言模型在心理健康知识方面的能力,包括实体识别、关系判断和多跳推理。对15个LLM的实验揭示了识别能力与判断能力之间存在差距。
本文介绍了 IRC-Bench,这是一个用于在自传体回忆中识别隐式实体的基准测试,侧重于利用语境线索而非显式提及。文章评估了各种大型语言模型(LLM)和检索配置,发现经过 QLoRA 微调的 Llama 3.1 8B 在开放世界设置中表现最佳。