我对8个LLM在医疗记录方面进行了基准测试。幻觉罕见;遗漏需关注。
摘要
对8个LLM在医疗记录中的基准测试发现,幻觉很少,但遗漏需要引起注意。
暂无内容
相似文章
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
最有趣的基准测试之一及其对对齐的意义
文章讨论了大语言模型幻觉的公共基准测试如何推动快速改进,并探讨了对对齐的启示,强调需要透明度和诚实度的基准测试。
LLMs中的幻觉:基于生命周期的成因、检测、缓解与预防综述
这篇综述论文提出了一种基于生命周期的框架,用于理解LLMs中的幻觉现象,涵盖数据、训练和推理阶段的成因、检测、缓解与预防。
标记错误症状:评估医学文本中的LLM水印
本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。
检测LLMs中的幻觉:追踪受损上下文共享的拓扑特征
本文提出了一种通过分析注意力图中的拓扑特征来检测LLMs中幻觉的方法,在多个基准测试中显示出相对于现有基线的改进。