Cura 1T:面向智能体医疗的专用模型
摘要
Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。
arXiv:2607.15314v1 Announce Type: new
摘要:医疗领域涉及高风险的沟通、专家推理和工作流执行,然而能够同时涵盖这些用例的专用LLM仍然有限。一个医疗模型必须能够处理患者咨询、基于文本和图像的临床推理、交互式诊断以及电子健康记录(EHR)工具的使用。这些能力在不同的方面会失效,针对单一任务的窄幅更新可能会降低另一任务的表现。我们提出了Cura 1T,一种通过人工门控自我进化循环训练的医疗专用LLM。在每个进化轮次中,一个训练代理规划目标能力,训练模型,评估基准轨迹,并根据观察到的失败改进数据混合。这种以数据为中心的循环通过有针对性的合成和精选示例来改进模型,而不是通过单一通用的医疗数据更新。在医疗评估套件中,Cura 1T在前沿基线中排名靠前或顶尖,同时在域外推理和智能体基准上保持竞争力。
查看缓存全文
缓存时间: 2026/07/20 09:21
# Cura 1T:专为医疗代理场景设计的专用模型 来源:https://arxiv.org/html/2607.15314 \authorOne actAVA AI团队\titledlogo\[1.8cm\]template/actava/actavastyle/assets/actava-logo.png ###### 摘要 医疗领域涵盖高风险的沟通、专家推理和工作流执行,然而能够同时覆盖这些用例的专用LLM仍然有限。医疗模型必须处理患者咨询、基于文本和图像的临床推理、交互式诊断以及电子健康记录(EHR)工具使用。这些能力失败的方式各不相同,针对一项任务的狭窄更新可能会损害另一项任务。我们提出Cura 1T,一个通过人类门控自我进化循环训练的医疗专用LLM。在每个进化轮次中,训练代理规划目标能力、训练模型、评估基准轨迹,并根据观察到的失败优化数据配比。这种以数据为中心的循环通过有针对性的合成和精选示例来改进模型,而不是单一通用的医疗数据更新。在整个医疗评估套件中,Cura 1T在领先基线中名列前茅或接近顶尖,同时在领域外的推理和代理基准上也保持竞争力。 [![[未标题图片]](https://arxiv.org/html/2607.15314v1/template/actava/actavastyle/assets/actava-butterfly.png)Modelactava.ai/cura](https://actava.ai/cura)文档actava.ai/cura/docs (https://actava.ai/cura/docs)GitHubactava-ai/Cura (https://github.com/actava-ai/Cura) 参考图注图1:Cura 1T、前沿模型和Kimi-K2.6基础模型在六个医疗基准面板上的性能:MedAgentBench (Jiang et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib10))、HealthBench Professional 和 Hard (Arora et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib1); OpenAI,2026 (https://arxiv.org/html/2607.15314#bib.bib21))、MedXpertQA (Zuo et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib36)) 和 AgentClinic (Schmidgall et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib24))。## 1 引言 前沿语言模型现在能够回答困难的临床问题 (Singhal et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib27)),但医疗部署需要更广泛且更不容失的能力配置。我们重点关注本报告中反复出现的三个用例。*患者护理*需要面向临床医生和患者的响应,这些响应必须遵循医生指南 (Singhal et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib27); Arora et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib1); OpenAI,2026 (https://arxiv.org/html/2607.15314#bib.bib21))。*临床推理*需要解决跨文本和图像的专业医学问题 (Jin et al.,2020 (https://arxiv.org/html/2607.15314#bib.bib11); Pal et al.,2022 (https://arxiv.org/html/2607.15314#bib.bib22); Singhal et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib27); Zuo et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib36))。*医疗代理任务*需要多轮诊断检查、电子健康记录工具使用以及遵循严格任务协议的长周期医疗工作流 (Schmidgall et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib24); Jiang et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib10); Chen et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib5); Liu et al.,2026b (https://arxiv.org/html/2607.15314#bib.bib14),a (https://arxiv.org/html/2607.15314#bib.bib13); HL7 International,2019 (https://arxiv.org/html/2607.15314#bib.bib8))。这些任务相互关联,但失败方式各不相同:评分标准遗漏、事实缺失、推理脆弱、过早诊断以及格式错误的工具调用,每个都需要不同的修复方法。社区在个别成分上取得了显著进展:医学推理基准和多模态专家QA (Jin et al.,2020 (https://arxiv.org/html/2607.15314#bib.bib11); Pal et al.,2022 (https://arxiv.org/html/2607.15314#bib.bib22); Zuo et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib36))、评分标准评分的临床对话 (Arora et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib1); OpenAI,2026 (https://arxiv.org/html/2607.15314#bib.bib21))、诊断和EHR工具基准 (Schmidgall et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib24); Jiang et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib10))、长周期医疗代理基准 (Chen et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib5); Liu et al.,2026b (https://arxiv.org/html/2607.15314#bib.bib14),a (https://arxiv.org/html/2607.15314#bib.bib13)) 以及持续护理模型系统 (Baichuan AI and THUBPM Group, Tsinghua University,2026 (https://arxiv.org/html/2607.15314#bib.bib3))。然而,针对同时服务于这三个用例而训练的一个专用LLM,相对来说仍未被充分探索。 构建这样一个模型既是数据构建问题,也是模型训练问题。与编程或数学相比,医疗领域的训练信号更少,其敏感性使得高质量监督更难获得。有用的示例分散在指南、考试、患者互动、图像和电子健康记录工作流中;许多结果也无法通过简单的执行器或答案键来检查。由于失败模式在不同任务类别中分布不均,为一个行为添加示例可能会改善该行为,但同时侵蚀其他方面已经正确的行为。因此,核心挑战不仅仅是选择训练算法或超参数配置,而是识别配方中缺失的数据,添加公开可用或合成的替代数据,并策划能够跨任务迁移而不会不必要遗忘的数据组合。 我们构建了Cura 1T,一个医疗专用LLM来解决这一挑战。Cura 1T通过低秩适配器 (Hu et al.,2021 (https://arxiv.org/html/2607.15314#bib.bib9)) 和人类门控自我进化循环进行训练。这种设计也受到近期向递归自我改进和自动化研究工作流转变的启发,这种转变是由更强大的代理模型实现的,这些模型可以规划、执行和检查长期技术任务 (autoresearch contributors,2026 (https://arxiv.org/html/2607.15314#bib.bib2); Yamada et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib31); Novikov et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib20))。手动运行完整的后训练周期——规划运行、启动训练、评估结果、阅读轨迹、诊断失败和重建数据组合——需要大量专家时间,并减慢了迭代速度。在每个实验中,LLM代理定义所需的行为和接受标准,训练候选模型,在相关基准下进行评估,阅读评分轨迹,并根据观察到的失败优化下一个数据组合。代理使用专门的数据构建技能,而不是应用单一的通用“医疗数据”更新。我们在第3.2节 (https://arxiv.org/html/2607.15314#S3.SS2) 中介绍了这种自我进化循环的详细设计和实现。 图1 (https://arxiv.org/html/2607.15314#S0.F1) 和表1 (https://arxiv.org/html/2607.15314#S1.T1) 总结了Cura 1T的主要结果。Cura 1T在六个医疗基准面板中的五个上是最强的模型,在剩余的MedXpertQA多模态任务中排名第二。在表1 (https://arxiv.org/html/2607.15314#S1.T1) 中,同一个模型在患者护理、临床推理和医疗代理评估方面持续优于Kimi-K2.6基础模型。第4节 (https://arxiv.org/html/2607.15314#S4) 给出了完整的基准设置、中间自我进化结果和前沿模型比较。此外,我们报告了数学、科学推理和代理任务方面的域外基准结果。Cura 1T在这些基准上保持了强劲的性能,表明以医疗为重点的训练策略在这些评估下不会明显侵蚀通用推理或代理能力。 表1:Cura 1T相对于Kimi-K2.6基础模型的改进。不同基准的度量不同(HealthBench为评分标准分数,MedXpertQA为精确字母pass@1,AgentClinic和MedAgentBench为任务成功率)。\thd基准\thd基础模型\thdCura 1T\thdΔ\DeltaMedAgentBench0.8470.940+0.093+0.093HealthBench Professional0.5030.662+0.159+0.159HealthBench Hard0.2220.368+0.146+0.146MedXpertQA0.5690.655+0.086+0.086AgentClinic0.7540.796+0.042+0.042 ## 2 相关工作 ##### 医疗AI。 医疗语言模型的工作现在涵盖患者护理、临床推理和代理临床系统。Med-PaLM表明,大型模型可以编码足够的医学知识来回答执业资格考试问题 (Singhal et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib27)),而Baichuan系列,特别是Baichuan-M4,将医学建模扩展到连续护理,包括工具使用、患者记忆、动作约束、证据检索和多模态感知 (Baichuan AI and THUBPM Group, Tsinghua University,2026 (https://arxiv.org/html/2607.15314#bib.bib3))。基准开发也遵循着同样的范围扩展。患者护理基准如HealthBench根据医生编写的评分标准对开放式临床响应进行评分 (Arora et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib1)),而HealthBench Professional将这种设置扩展到真实的临床医生聊天 (OpenAI,2026 (https://arxiv.org/html/2607.15314#bib.bib21))。临床推理基准始于大规模医学考试问答,如MedQA和MedMCQA (Jin et al.,2020 (https://arxiv.org/html/2607.15314#bib.bib11); Pal et al.,2022 (https://arxiv.org/html/2607.15314#bib.bib22));较新的专家基准如MedXpertQA增加了难度并增加了包含真实临床图像和背景的多模态案例 (Zuo et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib36))。代理医疗基准随后评估模型是否能够随时间行动:AgentClinic在模拟诊所中测试多轮诊断 (Schmidgall et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib24)),MedAgentBench针对符合标准的记录评估临床衍生的EHR任务 (Jiang et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib10); HL7 International,2019 (https://arxiv.org/html/2607.15314#bib.bib8)),而近期的系统如CHI-Bench、PhysicianBench和HealthAgentBench将评估扩展到长周期、角色组合、政策驱动的医疗工作流、真实的EHR环境以及统一的代理医疗设置 (Chen et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib5); Liu et al.,2026b (https://arxiv.org/html/2607.15314#bib.bib14),a (https://arxiv.org/html/2607.15314#bib.bib13))。本报告使用这些基准系列来评估Cura 1T在第1节 (https://arxiv.org/html/2607.15314#S1) 中介绍的三个医疗用例中的表现。 ##### LLM后训练。 LLM后训练通常结合了监督适应、强化学习、自训练和参数高效更新。监督微调(SFT)将预训练模型适应于任务特定的示范,并且通常用作冷启动阶段,然后再进行更具选择性的数据构建。强化学习(RL)随后根据任务级奖励信号改进策略,然后再进行蒸馏或整合。拒绝采样微调保留模型自身得分最高的生成结果,并对其进行训练 (Yuan et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib33); Touvron et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib29)),而STaR通过对推理过程进行采样、保留那些得到正确答案的推理过程、并对保留的轨迹进行微调来引导推理 (Zelikman et al.,2022 (https://arxiv.org/html/2607.15314#bib.bib35))。自蒸馏微调(SDFT)将模型自身的样本作为学生分布,将教师条件设定在附加上下文上作为目标,使更新更接近基础模型的生成策略 (Shenfeld et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib25))。这些方法通常与保留推理链行为而非用离策略轨迹替换它的推理感知数据格式相结合 (Wei et al.,2022 (https://arxiv.org/html/2607.15314#bib.bib30); DeepSeek-AI,2025 (https://arxiv.org/html/2607.15314#bib.bib6)),并与低秩适配器相结合,后者更新一个小的参数高效模块,同时保持基础权重不变 (Hu et al.,2021 (https://arxiv.org/html/2607.15314#bib.bib9))。 ##### 自我进化和自动研究。 Self-Refine和Reflexion是语言模型自我进化的早期例子。它们使用自然语言批评或任务反馈来改进后续尝试,而OPRO、DSPy和TextGrad将提示、程序或LM管道组件视为针对指标进行优化的对象 (Madaan et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib17); Shinn et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib26); Yang et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib32); Khattab et al.,2023 (https://arxiv.org/html/2607.15314#bib.bib12); Yuksekgonul et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib34))。公共autoresearch仓库将这一框架聚焦于一个编码代理,该代理编辑真实的训练循环、运行固定预算的实验、对验证损失进行评分,并保留或丢弃每个更改 (autoresearch contributors,2026 (https://arxiv.org/html/2607.15314#bib.bib2))。高保真自动研究系统将这种模式扩展到科学工作流和算法发现,包括AI Scientist、AI Scientist-v2和AlphaEvolve,而ResearchGym和近期的调查强调可靠性、来源和可重复性仍然是核心瓶颈 (Lu et al.,2024 (https://arxiv.org/html/2607.15314#bib.bib15); Yamada et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib31); Novikov et al.,2025 (https://arxiv.org/html/2607.15314#bib.bib20); Garikaparthi et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib7); Tie et al.,2026 (https://arxiv.org/html/2607.15314#bib.bib28))。Cura遵循相同的闭环度量规程,但改变了优化对象:循环主要不是搜索提示、代码或超参数;它策划后训练数据组合,然后将其训练到模型中。 ## 3 Cura 1T Cura 1T是在Kimi-K2.6 (Moonshot AI,2026 (https://arxiv.org/html/2607.15314#bib.bib19)) 的基础上为三个医疗用例进行后训练的:*患者护理*、*临床推理*和*医疗代理任务*。发布版本使用256K上下文窗口和原生文本+视觉输入。患者护理涵盖面向临床医生和患者的医疗响应,这些响应必须遵循医生评分标准,同时保持清晰和安全。临床推理涵盖跨文本和图像的专业医学问答,模型必须结合事实回忆、鉴别推理和答案选择。医疗代理任务涵盖多轮临床工作流,模型必须收集证据、使用工具,并在得出最终答案之前完成诊断或EHR任务。为了高效训练一个万亿参数模型,我们围绕轻量级适配器训练栈(见第3.1节 (https://arxiv.org/html/2607.15314#S3.SS1))和由训练代理编排的*自我进化*循环(见第3.2节 (https://arxiv.org/html/2607.15314#S3.SS2))构建训练基础设施。 ### 3.1 训练 训练协议实现为一个轻量级适配器训练栈。我们添加了医疗自我进化所需的训练算法、基准环境适配器和循环编排。 监督微调(SFT)
相似文章
COTCAgent:基于概率链式思维完成的预防性咨询
COTCAgent是一个用于纵向电子健康记录的分层推理框架,采用概率链式思维完成方法,在自建数据集上达到90.47%的Top-1准确率,超越了现有的医疗代理。
用代理式AI重振全球医疗的人性化
医疗保健提供者正转向代理式AI,实现复杂任务自动化,减轻临床医生倦怠,改善患者预后,如HSS利用AI代理处理保险理赔和患者分诊所示。
大型癌症助手(LCA):一种面向肿瘤学可扩展临床决策支持的模型无关编排框架
本文介绍了大型癌症助手(LCA),这是一种模型无关的编排框架,用于肿瘤学中的可扩展临床决策支持。该框架通过七元组架构和算法不可渗透性,将多模态数据摄入与AI推理解耦。
ChikitAI
ChikitAI 是一款面向医疗分诊和护理自动化的智能代理型人工智能产品,旨在简化患者接诊流程和临床工作流程。
启用全新医疗模式:AI 联合临床医生
Google DeepMind 宣布启动 AI 联合临床医生研究计划,旨在通过"三方协同诊疗"改善医疗服务——即 AI 智能体在医生监督下协助患者。该系统在一项初级医疗咨询研究中展现出高准确率且零严重错误,表现优于现有循证综合工具。