CLIR-Bench:不规则临床时间序列的多模态问答基准
摘要
CLIR-Bench是一个针对不规则采样临床时间序列的多模态问答基准,基于ICU记录构建,包含跨越11个临床变量的6,600个问答实例。它揭示了现有通用模型在处理稀疏时间证据方面的困难,突显了开发更强的不规则时间序列推理方法的必要性。
查看缓存全文
缓存时间: 2026/07/14 04:20
# CLIR-Bench: 不规则临床时间序列多模态问答基准测试 来源: https://arxiv.org/html/2607.09880 , Ethan B. Liu 山东大学 中国, Yuan Zhu 山东大学 中国 [email protected] (mailto:[email protected]), Loe Yan 山东大学 中国, Wei Fan 奥克兰大学 新西兰, 以及 Jindong Han 山东大学 中国 [email protected] (mailto:[email protected]) (2018) ###### 摘要. 临床时间序列在患者监测、风险评估和临床决策支持中至关重要。然而,它们常常是稀疏、不规则采样且异步的,这使得模型难以识别临床问答所需的时序证据。现有的基准测试主要关注规则采样的时间序列问答或基于静态数据的医学问答,因此很少评估模型能否将其答案可靠地建立在非规则时序观测之上。为填补这一空白,我们引入了 CLIR-Bench,这是一个基于去标识化ICU记录,通过原则性的四阶段流程构建的不规则临床时间序列问答基准。CLIR-Bench 包含 6,600 个问答实例,涵盖 11 个临床变量,组织成四个能力维度和 11 个任务。每个问题都与明确的时序证据和任务特定的答案推导规则相关联,从而能够同时评估答案准确性和证据使用情况。实验表明,现有通用模型难以检索和推理稀疏的临床证据,凸显了对更强的不规则时间序列推理方法的需求。我们的代码和数据可在 https://huggingface.co/datasets/winall/CLIR-Bench 获取。 不规则临床时间序列,时间序列问答,大型语言模型 ††版权: acm授权 ††期刊年份: 2018 ††doi: XXXXXXX.XXXXXXX ††会议: 请从您的权限确认邮件中填写正确的会议标题; 2018年6月3-5日; 纽约州伍德斯托克 ††isbn: 978-1-4503-XXXX-X/2018/06 ## 1. 引言 参见图注 图 1. CLIR-Bench 的任务类别。 临床时间序列在患者监测、风险评估和临床决策支持中扮演着关键角色 (Li 等人, 2025; Zheng 等人, 2026)。在重症监护室 (ICU) 中,临床医生持续解读生命体征、实验室测量结果和治疗事件,以了解患者病情随时间的变化 (Johnson 等人, 2024; Bui 等人, 2024)。然而,与标准时间序列不同,临床时间序列通常是稀疏、不规则采样且跨变量异步的 (Chung 等人, 2026)。某些测量 (例如心率) 可能每隔几分钟记录一次,而其他测量,如乳酸,可能在数小时内只出现几次。因此,回答临床问题所需的信息通常仅限于散布在长患者记录中的少量观测结果。关键在于确定相关观测结果,对齐不同时间记录的事件,并将其作为可靠答案的证据 (Zhang 等人, 2024)。 大型语言模型 (LLM) 为查询此类复杂的患者记录提供了自然语言界面 (Omiye 等人, 2024; Fleming 等人, 2023; Du 等人, 2026)。与其要求临床医生手动检查冗长且不规则的病程轨迹,LLM 可以辅助解释时序模式并回答有关患者状态和治疗反应的问题 (Chan 等人, 2024; Cui 等人, 2025)。然而,这一能力也带来了一个关键的评估挑战:模型回答正确是因为它使用了相关的患者特定观测结果,还是因为它依赖一般的临床知识或其他捷径 (Kruse 等人, 2025; Pandit 等人, 2025)? 在安全性敏感的环境中,即使答案偶然正确,若没有正确的时序证据支持,也可能不可靠。 现有的基准测试并未完全满足这一需求。传统的时间序列基准测试主要关注预测、分类或异常检测,其输出通常是固定的数值或预定义的标签 (Qiu 等人, 2025a, b)。最近的时间序列问答基准测试将评估扩展到自然语言问题,但其中许多构建于规则、对齐或结构良好的序列之上 (Kong 等人, 2025; Jing 等人, 2026)。与此同时,医学问答基准测试在评估对临床文本、医学图像、结构化知识和静态患者信息的推理方面取得了重大进展 (Yan 等人, 2025; Hu 等人, 2024)。尽管成果丰硕,但现有基准测试很少评估模型能否定位、整合并可靠地使用来自稀疏异步时间序列的时序证据来回答临床有意义的问题。 为填补这一空白,我们引入了 CLIR-Bench,这是一个用于不规则临床时间序列的多模态问答基准测试。CLIR-Bench 通过一个原则性的四阶段流程开发:(1) 从去标识化 ICU 记录中提取时间序列数据,(2) 任务实例化,以可执行和可验证的形式编码分析目标,(3) 生成带有明确时序证据的问答对,以及 (4) 人工验证以确保生成样本的质量。每个问答实例都与时间戳级别的证据和推导正确答案的任务特定规则相关联。这种设计使基准测试具有证据可审计性,即支持证据可以被隔离、移除或编辑以进行受控评估。总体而言,CLIR-Bench 包含 6,600 个问答实例,涵盖 11 个临床变量以及干预信号。该基准测试围绕四个核心能力维度组织:时序理解、推理、预测和决策制定,共产生 11 个临床动机明确的任务。 我们的贡献有三点: - • 我们引入了 CLIR-Bench,一个不规则临床时间序列问答基准测试。它包含 6,600 个基于 ICU 病程轨迹的问答实例,覆盖 11 个临床变量和 11 个临床动机明确的任务。 - • 我们提出了一个证据可审计的基准测试设计。每个问答实例都与明确的时序证据相关联,从而能够评估超出答案准确性之外的指标,包括证据忠实度、证据依赖性和对决定答案的观测结果的敏感性。 - • 我们提供了当前模型的诊断性评估。实验表明,现有 LLM 难以可靠地检索和推理稀疏的时序证据,凸显了对更强的证据选择方法和原生不规则时间序列推理模型的需求。 ## 2. 相关工作 表 1. 与代表性时间序列问答基准测试的比较。 | 基准测试 | 范围与覆盖范围 | 时序能力 | 任务 | 多模态 QA | 不规则 QA | 缺失数据 | 理解 | 推理 | 预测 | 决策 | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | GIFT-Eval (Aksu 等人, 2024) | 11 | ✗ | ✗ | ✗ | – | ✗ | ✗ | ✗ | ✓ | ✗ | | TimeSeriesExam (Cai 等人, 2024) | 55 | ✓ | ✓ | ✗ | 0.7 | 0.7K | ✗ | ✓ | ✓ | ✗ | | EngineMT-QA (Wang 等人, 2025) | 44 | ✓ | ✓ | ✗ | 11 | 11K | ✗ | ✓ | ✓ | ✗ | | Time-MQA (Kong 等人, 2025) | 55 | ✓ | ✓ | ✗ | 200 | 200K | ✗ | ✓ | ✓ | ✓ | | TSRBenchmark (Yu 等人, 2026) | 15 | ✓ | ✓ | ✗ | 4.1 | 4.1K | ✗ | ✓ | ✓ | ✓ | | TSAQA (Jing 等人, 2026) | 66 | ✓ | ✓ | ✗ | 210 | 210K | ✗ | ✓ | ✓ | ✗ | | MMTS-BENCH (Yin 等人, 2026) | 19 | ✓ | ✓ | ✗ | 2.4 | 2.4K | ✗ | ✓ | ✓ | ✗ | | ARFBench (Xie 等人, 2026) | 88 | ✓ | ✓ | ✗ | 0.75 | 0.75K | ✗ | ✓ | ✓ | ✓ | | **CLIR-Bench** | **11** | **✓** | **✓** | **✓** | **6.6K** | **✓** | **✓** | **✓** | **✓** | **✓** | **时间序列分析.** 时间序列分析传统上集中于预测、分类、异常检测和插补 (Lim 和 Zohren, 2021; Ismail Fawaz 等人, 2019; Blázquez-García 等人, 2020; Liu 等人, 2025; Nie 等人, 2026; Liu 等人, 2026)。为支持对这些任务进展的系统评估,古典统计方法和现代学习方法都通过多样化的基准测试套件进行了评估。例如,UCR (Dau 等人, 2019) 和 UEA (Bagnall 等人, 2018) 档案支持单变量和多变量时间序列分类的标准化评估,而 TFB (Qiu 等人, 2025a) 和 GIFT-Eval (Aksu 等人, 2024) 为跨数据集、领域和预测区间的预测模型提供了更广泛的评估设置。这些基准测试实现了可重复的比较,并加速了时间序列建模的进展。然而,它们主要评估数值预测或到预定义任务标签的分配。因此,它们不能直接评估模型是否能够解释、整合和推理时序观测结果来回答开放式的自然语言问题。 **时间序列问答基准测试.** 近期的时间序列问答基准测试通过将时序分析任务表述为自然语言问题,将评估扩展到固定输出预测之外 (Jiang 等人, 2024; Zhang 等人, 2024)。例如,TimeSeriesExam (Cai 等人, 2024) 引入了一种考试式基准测试,用于评估一般的时间序列理解能力,而 ChatTS (Xie 等人, 2025) 则研究了时间序列表示与语言的对齐以实现高效交互。Time-MQA (Kong 等人, 2025) 构建了一个大规模多任务问答数据集,涵盖了预测、插补、异常检测、分类和推理。其他基准测试将时间序列问答扩展到多模态或领域特定的设置。MTBench (Chen 等人, 2026) 结合了金融和天气时间序列与文本报告,而 EngineMT-QA (Wang 等人, 2025) 则将工业多变量传感器数据与自然语言问题对齐。TSAQA (Jing 等人, 2026) 提供了一个跨多个领域和任务格式的统一评估框架,MMTS-BENCH (Yin 等人, 2026) 进一步评估了多模态推理和跨模态对齐。相比之下,ARFBench (Xie 等人, 2026) 专门关注运营遥测和事件响应场景中的异常推理。总的来说,这些基准测试极大地拓宽了时间序列评估。然而,现有的时间序列问答基准测试主要假设规则采样和结构良好的观测数据,而现实世界的临床时间序列通常是稀疏和异步的 (Tipirneni 和 Reddy, 2022; Shukla 和 Marlin, 2021)。为填补这一空白,我们提供了一个聚焦的测试平台,用于评估当前 LLM 是否能够解释和整合稀疏的时序证据来回答有临床意义的问题。 ## 3. CLIR-Bench ### 3.1. 问题形式化 我们如下定义不规则临床时间序列上的问答任务。给定一个患者特定的 ICU 病程轨迹 X = {(t_i, v_i, x_i, c_i)}_{i=1}^{L},其中 L 表示观测条目的数量,每个元组包含一个时间戳 t_i,临床变量 v_i,测量值 x_i,以及可选的干预上下文 c_i,目标是通过对患者不规则、异步且稀疏的临床记录进行推理,回答一个自然语言问题 q。形式上,任务可写为 F: (q, X) ↦ A,其中 A 是生成的答案,F 表示一个解释问题 q 并分析不规则采样时间序列 X 的模型。 ### 3.2. 数据集与任务设计 CLIR-Bench 包含 6,600 个问答实例,涵盖 11 个临床变量和干预信号。它评估通用模型在不规则临床时间序列问答中的四个核心能力维度:理解、推理、预测和决策制定。如图 1 所示,这四个维度进一步细分为 11 个任务,提供了在现实时序不规则性下对模型性能的结构化评估。 #### 3.2.1. 数据整理 CLIR-Bench 基于 MIMIC-IV (Johnson 等人, 2024) 构建,这是一个包含去标识化 ICU 记录的大规模重症监护数据库。我们关注患者级别的时间序列轨迹,因为 ICU 监测本质上是稀疏、异步且受临床干预影响的。整理后的队列包含 500 个 ICU 住院记录。对于每次 ICU 住院,我们提取一组常见的监测生命体征、实验室测量结果、尿量和干预相关事件。生命体征包括心率、平均动脉压 (MAP)、收缩压 (SBP)、舒张压 (DBP)、外周血氧饱和度 (SpO2)、呼吸频率和体温。实验室变量包括乳酸、肌酐和白细胞计数。此外,每条记录包含自 ICU 起经过的时间、观测掩码以及指示自同一变量上次观测以来经过时间的时间间隔特征。详细数据描述请参考附录 A.2。 我们在下面总结了整理后数据集的时序特征。图 2 显示了 ICU 轨迹持续时间的分布。许多轨迹跨越数天的 ICU 住院,大部分持续时间在 24 到 96 小时之间,并且存在超过 240 甚至 480 小时的长尾分布。这避免了将基准测试限制在短时间、规则的窗口内,而是反映了 ICU 监测的长期特性。图 3 进一步强调了数据的不规则性。生命体征相对密集,平均稀疏度为 0.20,而实验室测试则稀疏得多,平均稀疏度为 0.90。这些特性将 CLIR-Bench 与那些假设在公共时间网格上进行规则采样的时间序列问答设置区分开来。
相似文章
ClinicalBench:对 MIMIC-IV 跨入院临床问答中基于断言感知的检索进行压力测试
本文介绍了 ClinicalBench 和 EpiKG 系统,评估了针对 MIMIC-IV 数据在多个人工智能大语言模型(LLM)上的临床问答中基于断言感知的检索能力。研究证明,在检索过程中处理否定和时态信息,相比标准基线能显著提升性能。
当病例罕见时:面向非指南临床问答的检索基准
介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。
EHRNote-ChatQA:基于证据的长篇出院小结多轮临床问答基准
介绍 EHRNote-ChatQA,这是一个基于证据、覆盖多份出院小结的多轮临床问答基准,经专家验证构建。对 22 个大语言模型的基准测试揭示了在证据溯源和多轮错误累积方面的挑战。
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。