标签
本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。
小型开放权重的4B LLM在瑞典医学执照考试题目上达到高达87%的准确率,在启用推理和后训练技术的情况下接近o3级别的性能。
Hybrid-IR 提出了一种双路径检索框架,结合基于图的检索和稠密检索,并采用迭代推理来改进复杂医学问答,克服了现有RAG方法的局限性。在三个基准上的实验表明了其有效性。