标签
本文介绍了一个综合基准测试,用于评估大型语言模型在OCR噪声下进行文档键值提取的能力,揭示了显著的性能下降,并强调了需要联合优化OCR质量和LLM推理。
本文介绍了HIPE-2026的结果,这是HIPE评测系列的第三版,专注于从法语、德语和英语的多语言历史文档中提取基于时间的人物-地点关系。对17个参赛团队在预测准确性、计算效率和跨领域泛化能力方面进行了评估。