标签
CRAFT是一种新的LLM框架,用于对临床叙述中的时间推理进行迭代优化,引入了基于验证器的反馈机制,并提出了用于疫苗不良事件报告的MedTempo基准。
本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。