医疗模型:Reasoning-Medical-27B (Qwen3.6-27B微调)
摘要
Reasoning-Medical-27B 是一个基于 Qwen3.6-27B 微调的高级医学推理模型,使用 GRPO 和 Unsloth 优化方法,在 37 万个问答示例上通过思维链推理进行训练。
来自描述:“Reasoning-Medical-27B 专为专业医学、医学遗传学、大学生物/医学及临床知识中的通用高级医学推理而设计。该模型在包含 37 万高质量问答示例的大规模数据集上进行了微调,融合了思维链推理以改进医学相关问题的逐步解答。训练使用 GRPO 训练器配合 Unsloth 优化方法以实现高效微调。” 模型:https://huggingface.co/EpistemeAI/Reasoning-Medical-27B 演示:https://huggingface.co/spaces/EpistemeAI/reasoning-medical-27b
相似文章
Reasoning-Medical0.1-27B(Qwen3.5-27B 医疗微调版本,声称超越 MedGemma)
EpistemeAI 发布了 Reasoning-Medical0.1-27B,这是 Qwen3.5-27B 的医疗推理微调版本,声称通过在精心策划的 10 万条记录数据集上引入链式思维推理,在多项医疗基准测试中超越了 MedGemma。
MedGuideX:将可执行指南中的决策逻辑内化至大型语言模型用于临床推理
MedGuideX 将临床实践指南转化为可执行的决策逻辑,以生成事实性和反事实性的问答数据用于训练医学大语言模型,在临床推理基准测试中实现了平均准确率相对提升 10.28%。
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
Qwen 3.8 27B 过度思考:为了击败 Opus 4.6,必须如此
本文讨论了 Qwen 3.8 27B,一个拥有 270 亿参数的模型,它通过使用大量推理令牌来与更大的模型竞争,强调了令牌使用的权衡以及本地部署的好处。
1.7B模型在strict-7形式推理上超越Qwen3-8B和Gemma-4-26B - 专业模型蚕食通用模型领域?
TwIL-LM2,一个专门针对形式逻辑翻译微调的1.7B模型,在严格评分基准上超越了更大的通用模型如Qwen3-8B和Gemma-4-26B,突显了专用AI模型在高效推理方面的潜力。