我对8个LLM在医疗记录方面进行了基准测试。幻觉罕见;遗漏需关注。

Reddit r/LocalLLaMA 新闻

摘要

对8个LLM在医疗记录中的基准测试发现,幻觉很少,但遗漏需要引起注意。

暂无内容
查看原文

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

标记错误症状:评估医学文本中的LLM水印

arXiv cs.AI

本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。