标签
介绍 EHRNote-ChatQA,这是一个基于证据、覆盖多份出院小结的多轮临床问答基准,经专家验证构建。对 22 个大语言模型的基准测试揭示了在证据溯源和多轮错误累积方面的挑战。
介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。