本次介绍的论文提出了一种基于深度学习的可解释模型——BlastScoringNet。该模型通过量化评估囊胚的形态学特征,生成连续的评分,从而更精准地区分囊胚质量,并与活产结果建立了显著相关性。此外,BlastScoringNet在不同机构、不同拍摄设备的数据验证中展现了良好的泛化能力。不过,该模型评分与活产结果的关系仍有待进一步确认,目前主要基于相关性分析,尚未通过预测实验验证其在临床结局预测中的有效性。
Liu H, Chen L, Shan G, Sun C, Lu C, Liao H, Zhang S, Dong S, Xu X, Yan Q, Gong F, Zhang Z, Dai C, Chen W, Song H, Chen L, Wang S, Sun H, Lin G, Sun Y, Gu Y. An interpretable artificial intelligence approach to differentiate between blastocysts with similar or same morphological grades. Hum Reprod. 2025 Jun 1;40(6):1077-1086. doi: 10.1093/humrep/deaf066. PMID: 40258298.
研究背景
不孕症是全球性健康问题,影响着约六分之一的人口,而体外受精(IVF)技术是目前最常用的辅助生殖手段之一。在IVF过程中,胚胎学家需要从多个囊胚中选择“质量最高”的囊胚进行移植,以提高活产率。目前,Gardner分级系统是全球IVF实验室最常用的方法,它通过评估囊胚的扩张程度、内细胞团(ICM)形态和滋养外胚层(TE)形态来进行分级。然而,该系统分级尺度有限,仅分为“好”“中”“差”三个等级,导致在面对多个具有相似或相同ICM和TE等级的囊胚时,胚胎学家难以做出精准选择。此外,人工评估的主观性和不一致性也限制了其对囊胚活产潜力的准确预测。因此,开发一种能够量化评估囊胚并预测其活产潜力的定量方法,对于提高IVF成功率具有重要意义。
研究方法
本研究设计包括三个主要步骤:首先,基于2760个囊胚的Gardner分级数据集开发了一种名为BlastScoringNet的可解释深度学习模型,这些囊胚的分级由多位胚胎学家投票得出,以减少观察者间差异;其次,将该模型应用于包含15228个已知活产结果的囊胚数据集,生成囊胚评分;最后,评估这些评分与活产结果之间的相关性。研究数据来源于2016年至2018年接受IVF治疗的患者,囊胚图像采集自两家IVF机构:中信湘雅生殖与遗传医院(机构A)和南京鼓楼医院(机构B)。BlastScoringNet模型基于卷积神经网络,通过分析囊胚的多焦点图像,预测扩张程度、ICM和TE的每个基础等级的概率,并计算出连续的ICM和TE评分,从而实现对具有相似或相同ICM和TE等级的囊胚进行更细致的区分。此外,为了验证模型的泛化能力,研究团队还收集了2021年至2023年机构B的额外数据集,包括1455个囊胚的分级数据和476个囊胚的活产数据。
研究结果
BlastScoringNet模型在分类扩张程度、ICM和TE方面表现出色,其在测试数据集上的平均接收者操作特征曲线下面积(AUC)分别为0.997、0.903和0.943。基于这些预测概率,模型为15228个已知活产结果的囊胚生成了连续的ICM和TE评分。结果显示,较高的ICM和TE评分及其组合的OR值评分与显著更高的活产率相关(P < 0.0001)。在外部应用研究中,经过微调的BlastScoringNet模型也显示出与活产率的显著相关性(P = 0.00078),表明该模型在不同机构间具有一致的结果。此外,BlastScoringNet计算的囊胚评分在预测活产结果方面比手动分级具有更高的准确性,其AUC值在不同分层中均高于手动分级。
研究创新点
本研究的创新之处在于开发了一种可解释的深度学习模型BlastScoringNet,该模型不仅能够评估囊胚的扩张程度、ICM和TE等级,还能通过计算连续的ICM和TE评分,实现对具有相似或相同等级的囊胚进行更细致的区分。与传统的Gardner分级系统相比,BlastScoringNet的连续评分方法能够更准确地反映囊胚的形态学质量,并与活产结果建立更强的相关性。此外,该模型的设计考虑了多焦点图像的三维形态学信息,能够适应不同数量的多焦点图像输入,从而提高了对囊胚形态学特征的全面捕捉能力。这种可解释性和量化评估的结合,为胚胎学家提供了一个更加客观、准确的囊胚选择工具,有助于提高IVF的成功率。
研究局限性
尽管BlastScoringNet在囊胚评估中表现出色,但本研究仍存在一些局限性。首先,该研究为回顾性研究,可能存在选择偏差和混杂因素的影响。其次,目前BlastScoringNet的外部应用需要约1000个囊胚图像进行微调,这在一定程度上限制了其在新机构的快速部署和应用。未来的研究可以考虑纳入更多参数,如囊胚的自发性塌陷、发育时间点等,以进一步提高预测准确性。此外,模型的泛化能力需要在更多样化的数据集上进行验证,以确保其在不同地区和种族背景下的适用性。
临床意义及展望
BlastScoringNet作为一种可解释的深度学习工具,为IVF领域提供了一种新的囊胚评估方法。其与Gardner分级系统相结合的连续评分方式,不仅提高了囊胚选择的准确性,还增强了模型的临床可解释性,有助于胚胎学家更好地理解和信任模型的预测结果。此外,该模型在不同机构间的泛化能力验证,进一步证明了其在实际应用中的潜力。未来,随着更多数据的积累和模型的持续优化,BlastScoringNet有望在全球范围内推广使用,为提高IVF成功率和改善不孕症患者的治疗效果做出重要贡献。同时,该研究也为人工智能在生殖医学领域的应用提供了新的思路和方法,为未来探索更多基于AI的辅助生殖技术奠定了基础。