medical-qa

标签

Cards List
#medical-qa

奖励推理,而非答案:修复与约束医学问答中的测试时强化学习

arXiv cs.CL · 昨天 缓存

本文诊断了由于答案空间结构导致的医学问答测试时强化学习的失败,并介绍了PROSE,它通过奖励推理质量来在无标签数据下提升模型性能。

0 人收藏 0 人点赞
#medical-qa

哪些医学问题应获得理由?面向稳健问答的扰动敏感选择方法

arXiv cs.CL · 2026-09-10 缓存

本文提出RMS-RSP,一种扰动敏感方法,用于选择接受理由监督的医学问题,提升问答系统的稳健准确性和语义一致性。

0 人收藏 0 人点赞
#medical-qa

AI 聊天机器人能否找到专家所找的内容?模型、用户角色和样本大小对医学问题研究检索的影响

arXiv cs.CL · 2026-08-17 缓存

本研究评估了像 ChatGPT、Claude 和 Gemini 这样的 AI 聊天机器人如何为医学问题检索临床研究,发现模型和用户角色对性能有显著影响,并且对较大样本大小存在偏倚。

0 人收藏 0 人点赞
#medical-qa

弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配

arXiv cs.CL · 2026-08-04 缓存

本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。

0 人收藏 0 人点赞
#medical-qa

LLM谄媚中权威层级的机制视角

arXiv cs.CL · 2026-07-02 缓存

本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。

0 人收藏 0 人点赞
#medical-qa

面向跨基准医学问答的临床结构化秩门控LoRA

arXiv cs.CL · 2026-07-01 缓存

本文提出BiRG-LoRA,一种用于医学问答的秩门控LoRA方法,利用临床结构化先验选择稀疏秩子集,在四个基准上达到69.31%的宏平均准确率,同时使用的参数少于混合专家方法。

0 人收藏 0 人点赞
#medical-qa

让LLMs相互评判:用于医学问答的多智能体同行评审推理

arXiv cs.CL · 2026-06-16 缓存

本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。

0 人收藏 0 人点赞
#medical-qa

通过方差感知的评分标准奖励与GRPO改进LLMs心脏相关医疗问答

arXiv cs.CL · 2026-06-05 缓存

本文提出一种使用GRPO的方差感知奖励框架,以改进LLMs在心脏相关医疗问答上的性能,在一个HealthBench子集上实现了显著的准确率和F1分数提升。

0 人收藏 0 人点赞
#medical-qa

我还能再服一剂吗?评估大语言模型在非处方药剂量问答中面对时间不确定性的决策能力

arXiv cs.CL · 2026-06-04 缓存

研究人员推出了 DoseBench——一个包含 81 个非处方药剂量场景的基准测试,用于评估大语言模型在对乙酰氨基酚和布洛芬使用中面对时间不确定性时的决策能力。结果表明,大语言模型在滚动时间窗口推理方面频繁出现困难,且可能给出看似自信但缺乏医学依据的回答。

0 人收藏 0 人点赞
#medical-qa

MedQA:在AMD ROCm上微调临床AI——无需CUDA

Hugging Face Blog · 2026-05-08 缓存

一个教程和项目,演示在AMD MI300X上使用ROCm对Qwen3-1.7B进行LoRA微调,用于临床问答,为医疗AI开发提供无需CUDA的替代方案。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈