标签
本文研究基于LLM的指标以评估放射学报告生成中的临床意义,识别现有LLM评估器中的判别偏差,并提出训练轻量级可解释指标以改善错误检测与无害变异容忍之间的平衡。
本文评估了开源权重的大语言模型LLaMA 3.1在从荷兰语脑部MRI报告中自动提取结构化数据方面的表现。该模型在视觉评分方面取得了高性能,并准确检测了发现结果,而少样本提示改进了对数值变量的提取。