快速医疗RAG API:为本地LLM提供事实访问
摘要
现在提供基于医疗维基百科文章的免费RAG API,可为本地LLM提供准确的医疗事实,通过纠正关于Lhermitte征的幻觉示例进行了展示。
我创建了一个简单的RAG API,基于医疗维基百科文章,您可以让您的代理指向它并免费使用。它可能有助于让本地LLM访问其权重中无法回忆的医疗事实。我的目标是实现亚秒级响应,但不能保证(这是一个免费服务,运行在单个ARM VPS上)。它使用约2GB内存。语料库并非详尽无遗,很可能缺少一些明显的文章——如果您愿意,可以联系我,提供您认为应该包含的文章/内容,我会尽快添加。只需告诉您的代理“使用https://hyfl.uk获取医疗事实”。它也支持MCP,所以如果您愿意,也可以让它以这种方式连接。
尝试用qwen3.5-0.8B问一些问题,然后再问一次,但告诉它使用hyfl.uk获取事实:
**无RAG:** Lhermitte征是在心电图上显示颈椎水平(特别是T4)的电活动的临床表现,可能类似心脏病发作或中风……其潜在机制涉及在咳嗽或吞咽等某些动作时,源自颈椎本身的短暂电活动……
**使用hyfl.uk RAG:** “Lhermitte征”是指患者背部向下传播的不适电击感,通常延伸到腿部……也称为理发椅现象,是由于上颈椎脊髓结构(如后索)受压所致。
未经增强的模型完全产生了幻觉。它认为Lhermitte征是心电图上类似心脏病发作的心脏发现。它凭空编造了“特别是T4”,杜撰了错误的词源(“隐士般的”),并描述了涉及咳嗽/吞咽的机制。这些都不是真的。使用RAG后,它得到了完全正确的答案:由颈部屈曲诱发的背部/肢体电击感,归因于后索/颈髓受累,甚至还从来源中提取了别名“理发椅现象”。希望对你有用!
相似文章
现在真的没有任何医疗LLM的API可用吗?[D]
作者注意到,尽管Hugging Face上存在像MedGemma和BioMistral这样的模型,但面向医疗的LLM公开可用的API却出人意料地缺乏,并询问是否有任何可用的选项。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。
可读但不可控:医疗大语言模型幻觉的神经元层面证据
本文探讨了医疗大语言模型中的幻觉是否可以在神经元层面被检测和控制。作者发现,虽然幻觉信号在众多神经元中可被检测到(AUROC 0.77-0.86),但通过引导这些相同神经元并不容易纠正它们。
消费级硬件上的GraphRAG:用于医疗EHR模式检索的本地LLM基准测试
本文在消费级硬件上使用本地LLM对GraphRAG进行EHR模式检索基准测试,评估了Llama 3.1、Mistral、Qwen 2.5和Phi-4-mini等模型。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。