标签
本文识别了LLM医疗咨询中的预构差距,即模型在临床问题澄清后才进行评估,而非在初始模糊互动期间。通过使用小场景和模拟的对照实验,研究表明指令可以改进响应排序,但不能可靠地确保关键信息的获取。
MedDDC-Eval引入了一个针对多轮医疗咨询智能体的诊断解耦评估测试平台,将策略引导的对话历史与诊断生成分离,以实现对证据获取和诊断有用性的更清晰测量。