我还能再服一剂吗?评估大语言模型在非处方药剂量问答中面对时间不确定性的决策能力

arXiv cs.CL 论文

摘要

研究人员推出了 DoseBench——一个包含 81 个非处方药剂量场景的基准测试,用于评估大语言模型在对乙酰氨基酚和布洛芬使用中面对时间不确定性时的决策能力。结果表明,大语言模型在滚动时间窗口推理方面频繁出现困难,且可能给出看似自信但缺乏医学依据的回答。

arXiv:2606.04262v1 Announce Type: new Abstract: 大语言模型(LLM)正越来越多地被用于解答日常健康问题,包括用户能否安全地再次服用某种非处方药(OTC)。然而,这一常见的安全相关场景在现有医疗问答评估中仍未得到充分探索——正确回答此类问题需要追踪用药时间、计算24小时内的滚动累计摄入量、遵守产品标签限制,并处理不完整的用药记录。我们推出了 DOSEBENCH,这是一个专注于成人对乙酰氨基酚和布洛芬使用的精选基准测试,共包含 81 个非处方药剂量场景,并附有人工标注的参考答案。我们对四个大语言模型进行了多轮评估,评估指标涵盖决策正确性、一致性、解释可验证性、失败类型及置信度相关信号,共获得 1,620 条模型回答。结果显示,模型在滚动时间窗口推理和对歧义敏感的场景中频繁出现问题,且表现稳定或看似自信的回答仍可能违反剂量限制。上述发现表明,非处方药剂量问答为评估医疗问答中的时间推理、约束遵从以及安全相关的不确定性处理提供了一个范围聚焦但具有实际价值的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:13

# 我能再服一次药吗?评估大语言模型在非处方药剂量问答中时间不确定性下的决策能力

来源:https://arxiv.org/html/2606.04262
Yibo Hu 伊利诺伊理工大学,美国伊利诺伊州芝加哥 yhu89@illinoistech\.edu

###### 摘要

大语言模型(LLM)越来越多地被用于回答日常健康问题,包括用户能否安全地再次服用一种非处方药(OTC)。然而,这一常见的安全相关场景在现有医疗问答评估中仍未得到充分探索——正确回答需要追踪用药时间、计算滚动24小时摄入量、遵循产品标签约束,并处理不完整的用药历史。我们推出 DoseBench,这是一个包含81个精心整理的OTC用药场景的专项基准测试,聚焦于成人对乙酰氨基酚和布洛芬的使用,并附有人工标注的黄金参考答案。我们对四个LLM进行多轮评估,使用决策正确性、一致性、解释可验证性、失败类型及置信度相关指标,共产生1,620条模型响应。结果显示,模型在滚动窗口推理和歧义敏感场景中频繁出错,且看似稳定或自信的回答仍可能违反剂量约束。这些发现表明,OTC用药问答为评估医疗问答中的时间推理、约束遵循及安全相关不确定性处理提供了一个范围有限但极具实用价值的测试平台。111代码和数据可在 https://github.com/yibo-hu-lab/DoseBench 查阅。

我能再服一次药吗?评估大语言模型在非处方药剂量问答中时间不确定性下的决策能力

Maroof Kousar 伊利诺伊理工大学,美国伊利诺伊州芝加哥 mkousar@hawk\.illinoistech\.edu;Yibo Hu 伊利诺伊理工大学,美国伊利诺伊州芝加哥 yhu89@illinoistech\.edu

## 1 引言

大语言模型(LLM)越来越多地被用于回答日常健康相关问题,包括用户能否安全地再次服用非处方药(OTC)Singhal et al\. \(2025 (https://arxiv.org/html/2606.04262#bib.bib18)\)。对乙酰氨基酚和布洛芬等常见OTC药物随处可买,在搜索引擎、网络论坛和AI助手中频繁被讨论。尽管这些问题看似简单,安全的回答往往需要将药品标签约束应用于用户提供的不完整用药历史。

即便是看似简单的用户提问,也可能产生这种困难,如图1 (https://arxiv.org/html/2606.04262#S1.F1) 所示。用户描述了三次650毫克对乙酰氨基酚的服用,总量仅为1,950毫克,但模型在未解决缺失时间背景的情况下,便自信地拒绝了再次服药的请求。

参见说明图1:OTC用药场景暴露了LLM在滚动24小时和歧义敏感约束下稳定但缺乏医学依据的推理问题。尽管这一场景具有重要的实际意义,现有的医疗问答基准测试主要关注临床知识、专业考试或通用医学推理Abacha et al\. \(2019 (https://arxiv.org/html/2606.04262#bib.bib1)\); Suri et al\. \(2021 (https://arxiv.org/html/2606.04262#bib.bib19)\)。相对而言,将OTC用药作为一个聚焦性安全相关推理问题、以贴近消费者的真实场景呈现的研究较少。与许多开放式临床问答任务不同,OTC用药决策通常基于可系统核查的公开剂量标签约束。在实践中,用户可能忘记之前的用药、误解给药间隔、合并使用多种药物,或在不适时提出模糊的问题。这些特点使OTC用药推理既具有重要的实际意义,也对当前LLM构成挑战。

在本工作中,我们推出 DoseBench,这是一个聚焦于对乙酰氨基酚和布洛芬的现实成人OTC用药场景基准测试。DoseBench 被设计为一个受控诊断环境,用于评估LLM在消费者向用药问题上的可靠性。该基准测试涵盖涉及用药时间、累计摄入量、多药联用、重复用药及不完整用药历史的用户风格场景。

我们使用结构化决策输出("是"、"否"和"模糊")及推理解释对四个指令微调LLM进行评估。除正确性外,我们还分析了多轮运行的一致性、推理可验证性、失败模式以及多轮生成中的置信度相关行为。

在所有评估模型中,我们观察到LLM频繁产生看似稳定或自信、但缺乏医学依据的回答。错误往往源于时间推理失败、歧义处理不当或约束遵循不力,而非仅仅是输出格式问题。这些发现表明,OTC用药为研究消费者向医疗问答中安全导向可靠性提供了一个范围有限但极具实用价值的测试平台。

我们的贡献总结如下:

- •我们推出 DoseBench,这是一个聚焦于成人对乙酰氨基酚和布洛芬用药场景的现实OTC用药基准测试,基于公开剂量标签约束构建。
- •我们设计了一个结构化评估协议,用于衡量决策正确性、多轮运行一致性、解释可验证性、失败类型及置信度相关行为。
- •我们证明,当前LLM可能产生看似稳定且自信的回答,但在安全相关的OTC用药约束下仍然不正确、不可验证或缺乏依据。

参见说明图2:DoseBench 评估框架概览。我们构建了精心整理的对乙酰氨基酚和布洛芬推理场景,并对四个LLM进行多轮评估。每个场景均标注了黄金决策标签、推理复杂度类型和关键剂量事实。模型输出在正确性、一致性、可验证性、置信度不匹配和失败模式等方面进行分析。

## 2 相关工作

### 2\.1 医疗问答

医疗问答基准测试已成为评估LLM在医疗健康领域表现的核心工具。MedQA 和 MedMCQA 等考试风格资源主要评估模型能否回答需要事实性和临床推理的专业医疗问题Jin et al\. \(2021 (https://arxiv.org/html/2606.04262#bib.bib8)\); Pal et al\. \(2022 (https://arxiv.org/html/2606.04262#bib.bib16)\); Kung et al\. \(2023 (https://arxiv.org/html/2606.04262#bib.bib12)\)。MultiMedQA 等更广泛的基准测试集合进一步在多种医疗问答环境中评估模型,包括专业考试和消费者健康问题Singhal et al\. \(2025 (https://arxiv.org/html/2606.04262#bib.bib18)\)。这些基准测试对于衡量通用医学知识很有价值,但它们并未将用药剂量决策作为一项具有时间约束的决策任务加以单独分析。

其他数据集更贴近消费者向和药物相关信息需求。MedicationQA 专注于使用可信来源回答真实消费者用药问题Abacha et al\. \(2019 (https://arxiv.org/html/2606.04262#bib.bib1)\),而 MedExQA 和 MedExpQA 则评估带有解释和多语言覆盖的医疗问答Kim et al\. \(2024 (https://arxiv.org/html/2606.04262#bib.bib11)\); Alonso et al\. \(2024 (https://arxiv.org/html/2606.04262#bib.bib3)\)。此外还有研究探讨了医疗对话问答、现实临床问题及医疗信息检索场景Suri et al\. \(2021 (https://arxiv.org/html/2606.04262#bib.bib19)\); Kell et al\. \(2025 (https://arxiv.org/html/2606.04262#bib.bib10)\); Zhu et al\. \(2019 (https://arxiv.org/html/2606.04262#bib.bib22)\)。这些资源强调现实的健康信息需求,但通常评估的是广泛的医疗或临床问答,而非基于明确公开标签约束的重复OTC用药决策。

DoseBench 与上述先前基准测试互补。它不测试广泛的医学知识,而是专注于模型能否根据有限的用药历史做出安全的消费者向OTC用药决策。这一更为聚焦的场景使我们能够在成人对乙酰氨基酚和布洛芬的明确剂量规则下,研究决策正确性、歧义处理和推理可验证性。

### 2\.2 LLM 置信度与可靠性评估

已有研究表明,LLM 的置信度与正确性并不总是一致的Hu and Khan \(2021 (https://arxiv.org/html/2606.04262#bib.bib6)\); Kadavath et al\. \(2022 (https://arxiv.org/html/2606.04262#bib.bib9)\); Lin et al\. \(2022 (https://arxiv.org/html/2606.04262#bib.bib13)\); Geng et al\. \(2024 (https://arxiv.org/html/2606.04262#bib.bib5)\)。关于校准和不确定性估计的研究探讨了模型能否表达其知识边界、口头置信度与准确性的关系,以及如何将词元级概率用作不确定性信号。在医疗问答中,基于词元概率的方法也被探索用于识别过度自信或不可靠的答案Bentegeac et al\. \(2025 (https://arxiv.org/html/2606.04262#bib.bib4)\)。

重复采样提供了另一种可靠性视角。自我一致性方法表明,在某些场景中多次生成可以提升推理性能Wang et al\. \(2023 (https://arxiv.org/html/2606.04262#bib.bib21)\),而 SelfCheckGPT 等幻觉检测研究则将多次生成之间的分歧作为不可靠性信号Manakul et al\. \(2023 (https://arxiv.org/html/2606.04262#bib.bib14)\)。这些研究表明,重复生成可以揭示不稳定性,但稳定的一致并不必然意味着正确性,在安全敏感场景中尤为如此。

我们的工作将置信度和一致性信号用于诊断,而非提出新的校准方法。DoseBench 使我们能够在一个受约束的用药安全任务中,比较多数投票正确性、多轮运行一致性、口头置信度、内部决策置信度及推理可验证性,该任务的最终决策可根据明确的OTC用药规则进行核查。

## 3 基准测试构建

### 3\.1 基准范围与设计

DoseBench 聚焦于涉及对乙酰氨基酚和布洛芬的成人OTC用药场景。我们有意将基准限定于OTC剂量决策问题,而非更广泛的临床诊断、儿科用药、处方药相互作用或慢性病管理。这一有限范围使我们能够在可根据明确公开剂量指南核查安全答案的环境下评估模型行为。

该基准测试围绕现实的消费者向问题设计,用户询问能否再次服药、需要等待多久,或之前的用药是否影响下次决策。每个场景均基于问题中提供的信息和公开可查的OTC剂量指南,无需访问患者记录或专家专属的临床标注。

对于许多常见OTC产品,相关间隔和累计剂量规则在公开的药品事实标签和DailyMed材料中均有明确说明。222https://dailymed.nlm.nih.gov/dailymed/ 这使该场景适合评估模型能否遵循具体剂量约束并提供可核查的推理,而无需依赖患者记录、专家专属临床标注或开放式诊断推理。

### 3\.2 数据集收集

表1:DoseBench 推理复杂度类别概览。每个问题均根据其最突出的推理挑战进行人工标注。为提高真实性并减少作者特定的措辞偏差,我们在数据集构建过程中有意使用了一小组受调查启发的种子问题。参与者仅被要求提供他们在向AI助手或搜索引擎提问时可能自然提出的OTC用药示例问题。我们未收集个人健康信息、人口统计信息或私人病历。收集的回答经人工筛选,以删除过于笼统、重复或与医疗无关的问题。

最终数据集包含81个人工整理的OTC用药推理场景,主要聚焦于成人对乙酰氨基酚和布洛芬使用场景。

### 3\.3 问题精炼

问题经过人工精炼,以在保持真实对话措辞的同时,确保覆盖基准预定义推理类别。在精炼过程中,我们在必要时对药物名称、剂量强度、时间表达方式和场景措辞进行了标准化,同时保持问题接近自然的用户风格措辞。

精炼过程还确保每个场景包含足够信息以支持黄金决策标签,或在适当情况下,由于信息缺失或不确定而明确需要标注为"模糊"。标注决策以公开药品事实标签和DailyMed剂量指南中保守、安全导向的推理为依据U\.S\. National Library of Medicine \(2025 (https://arxiv.org/html/2606.04262#bib.bib20)\)。

### 3\.4 推理复杂度类别

为更好地描述每个场景的推理挑战,每个问题均经过人工审阅,并标注了其最突出的推理复杂度类型。

表1 (https://arxiv.org/html/2606.04262#S3.T1) 总结了 DoseBench 中的推理类别及其分布。

这些类别旨在支持按推理类型分析模型性能,而非代表相互排斥的医学条件。当一个问题涉及多重挑战时,标注者将类别分配给达到黄金决策所需的最突出推理要求对应的类别。

### 3\.5 黄金标注

表2:保守安全导向黄金标注决策的典型示例,包括时间敏感、歧义敏感及多药联用OTC用药场景。DoseBench 中的每个问题均人工标注了黄金决策标签("是"、"否"或"模糊")、标注理由、推理复杂度类别以及支持决策所需的关键剂量事实。黄金标签依据基于公开OTC用药规则和DailyMed指南的结构化标注规范进行分配U\.S\. National Library of Medicine \(2025 (https://arxiv.org/html/2606.04262#bib.bib20)\)。当产品配方存在差异时,在基准测试中一致应用保守的标准化限制。

黄金标签和推理标注由两名标注者使用共同评分标准进行审阅。标注者审阅了决策正确性、歧义处理、关键剂量事实和推理可验证性。分歧通过讨论解决。由于该任务基于公开剂量标签约束而非开放式临床诊断,这一裁决流程足以满足受控基准测试环境的需求。详细的标注说明和评分标准见附录B (https://arxiv.org/html/2606.04262#A2)。

表2 (https://arxiv.org/html/2606.04262#S3.T2) 展示了保守安全导向黄金标注决策的典型示例。当可用信息不足以在不做出无依据假设的情况下给出医学安全建议时,将分配"模糊"标签。

图2 (https://arxiv.org/html/2606.04262#S1.F2) 总结了整体基准测试构建和评估工作流程。

## 4 实验设置与评估

### 4\.1 模型

我们评估了四个指令微调大语言模型:Qwen2\.5\-7B\-Instruct Qwen Team \(2024 (https://arxiv.org/html/2606.04262#bib.bib17)\)、Meta\-Llama\-3\-8B\-Instruct AI@Meta \(2024 (https://arxiv.org/html/2606.04262#bib.bib2)\)、Mistral\-7B\-Instruct\-v0\.3 Jiang et al\. \(2023 (https://arxiv.org/html/2606.04262#bib.bib7)\) 以及 GPT\-4o\-mini

相似文章

LongMedBench:面向长时程临床决策的医疗智能体基准测试

arXiv cs.AI

LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。

评估药物安全推理中对患者信息的反事实敏感性

arXiv cs.AI

介绍了MedPIC-Bench,一个包含反事实问题的基准测试,用于评估大型语言模型在患者特定条件变化时是否正确应用药物安全规则;在28个LLM中,反事实问题的准确率显著下降,揭示了模型普遍无法修正判断的缺陷。

测量LLMs在误导性医疗语境下的认知韧性

Hugging Face Daily Papers

介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。