标签
本文诊断了由于答案空间结构导致的医学问答测试时强化学习的失败,并介绍了PROSE,它通过奖励推理质量来在无标签数据下提升模型性能。
本文提出RMS-RSP,一种扰动敏感方法,用于选择接受理由监督的医学问题,提升问答系统的稳健准确性和语义一致性。
本研究评估了像 ChatGPT、Claude 和 Gemini 这样的 AI 聊天机器人如何为医学问题检索临床研究,发现模型和用户角色对性能有显著影响,并且对较大样本大小存在偏倚。
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。
本文提出BiRG-LoRA,一种用于医学问答的秩门控LoRA方法,利用临床结构化先验选择稀疏秩子集,在四个基准上达到69.31%的宏平均准确率,同时使用的参数少于混合专家方法。
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
本文提出一种使用GRPO的方差感知奖励框架,以改进LLMs在心脏相关医疗问答上的性能,在一个HealthBench子集上实现了显著的准确率和F1分数提升。
研究人员推出了 DoseBench——一个包含 81 个非处方药剂量场景的基准测试,用于评估大语言模型在对乙酰氨基酚和布洛芬使用中面对时间不确定性时的决策能力。结果表明,大语言模型在滚动时间窗口推理方面频繁出现困难,且可能给出看似自信但缺乏医学依据的回答。
一个教程和项目,演示在AMD MI300X上使用ROCm对Qwen3-1.7B进行LoRA微调,用于临床问答,为医疗AI开发提供无需CUDA的替代方案。