[易学堂]DeepSeek大语言模型在临床决策中的基准评估

2025年12月2日
返回列表
本次介绍的这篇论文聚焦于开源大语言模型DeepSeek在临床决策中的表现。开源模型支持私有部署,可更好地满足医疗行业对数据安全和患者隐私的要求。研究结果显示,其在诊断和治疗推荐任务中与商业模型GPT-4o相当。开源模型的可定制性和合规性为临床辅助工具带来了新机遇,不过其性能还需通过真实病历数据进一步验证,以拓展到更复杂的医疗场景中。  Sandmann, S., Hegselmann, S., Fujarski, M.  et al.  Benchmark evaluation of DeepSeek large language models in clinical decision-making.  Nat Med 31 , 2546–2549 (2025). https://doi.org/10.1038/s41591-025-03727-2
图片

研究背景

随着大型语言模型(LLMs)在医学领域的迅速发展,其在辅助诊断、治疗推荐、病历分析等方面的应用潜力引起广泛关注。然而,主流模型多为闭源结构,无法在医院本地部署,因而难以满足数据隐私和医疗合规性要求。近年来,开源模型的不断演进为这一困境提供了新的解决路径。DeepSeek系列作为近年来表现突出的开源LLM之一,在多个通用任务中已接近甚至追平商业模型的表现,但在真实临床任务中的效能尚未得到系统验证。     为此,本研究以临床决策支持为核心场景,围绕诊断和治疗推荐两个关键任务,对DeepSeek-V3与DeepSeek-R1两个版本的开源模型进行了系统性评估,并与GPT-4o及Gemini-2.0 Flash Thinking Experimental(Gem2FTE)等专有模型进行了直接比较,探讨其在真实医疗语境中的可行性与适用性。

研究方法

本研究构建了包含125个标准化患者病例的测试集,涵盖内科、神经科、外科、妇科及儿科五个专科,病例来源于教材改写,内容模拟门诊或急诊首诊情境,仅包含医生与患者初诊对话信息。为增强泛化性,病例覆盖常见、较少见和罕见三类疾病。 模型测试围绕两个核心任务展开:一是基于患者主诉信息推测可能诊断,二是在给定诊断的前提下推荐适宜的治疗方案。所有模型的回答均由临床专家进行逐一人工评分,评分标准采用5分制Likert量表,重点考察医学正确性与实际可用性。评分过程由两位医师独立完成并交叉复核,以提高一致性和客观性。为确保结果的统计学可靠性,研究设计中对多重比较进行了严格校正,并进行了功效分析以确认样本量充足。

研究结果

在诊断任务中,DeepSeek-R1与GPT-4o表现相近,无显著差异,均显著优于Gem2FTE。特别是在罕见疾病的诊断上,DeepSeek-R1表现稳定,相较以往研究中GPT-3.5和GPT-4在该类疾病上准确率偏低的结果有所提升。在治疗推荐任务中,两者同样显示出较高水平,且在不同临床专科间表现一致。Gem2FTE则在神经科等专科任务中存在一定劣势,可能与其模型体量及训练策略有关。
图片
图片
就具体评分而言,DeepSeek-R1在诊断任务中的平均分为4.70,在治疗推荐中为4.48,GPT-4o分别为4.76和4.55。尽管二者总体接近,但在诊断满分比例方面,GPT-4o略优。另一方面,推理增强版DeepSeek-R1相较其基础版本DeepSeek-V3并未表现出显著性能提升,推理模块未能有效迁移至医学领域,可能与其训练过程偏向数学与编程任务有关。此外,尽管部分生成文本较长,但冗余信息的增加并未转化为更高的医学判断质量。
图片
图片
研究还发现,多个模型在治疗推荐中能较好地引用最新指南中的药物建议,如抗菌药物的更新用法,这反映出模型在处理最新医学信息方面的能力不断增强。然而,多数模型仍未在所有病例中获得满分,提示当前模型尚不能独立承担决策责任,仍需依赖医师审核与再判断。

研究创新点

本研究首次系统评估了开源LLM在标准化临床场景下的性能,并与最新一代商业模型进行了并行比较,补足了现有研究中对开源模型在医疗实际任务中表现的认知缺口。通过引入由专家评分的文本任务,研究构建了不同于选择题式测试的新型评估框架,更贴近实际临床使用情境,有助于揭示模型的实际决策支持能力。 在模型层面,研究也深入探讨了推理能力、生成长度与医学表现之间的关系,发现通用推理强化策略在未经过医学语料调优时可能带来信息膨胀而非知识增益,提示未来应将模型训练更明确地指向临床任务。同时,研究所使用的病例数据来自非英语教材资源,减少了模型可能在训练过程中提前接触相关数据的偏倚风险,使得评估更为中立可信。

研究局限性

尽管研究设计上力求严谨,病例集仍以标准化模拟为主,缺乏电子病历等真实世界数据的验证,在实际临床部署前仍需补充真实应用场景下的评估。此外,模型任务仍聚焦于诊断与治疗两个子任务,尚未涵盖更复杂的多轮交互、实验解读或决策路径追溯等功能,因此结论的外推性仍需进一步验证。

临床意义与展望

本研究结果显示,开源LLM如DeepSeek-R1在核心临床任务中已具备与商业模型相近的表现,为其在医院本地部署提供了初步依据。在保证隐私合规、提升可解释性及支持定制化训练的背景下,开源模型或将成为部分医疗机构更具可操作性的选择。 未来,若能结合医院内部结构化数据、引入权威医学知识库并增强对医学逻辑链的建模能力,开源LLM将在医疗辅助决策系统中发挥更大潜力。临床研究与前瞻性验证仍是推动其真正应用的关键步骤。