[易学堂]用AI提升胚胎评估一致性的一项临床研究

2025年12月2日
返回列表
胚胎评估的一致性问题长期制约着辅助生殖技术的发展。本次介绍的论文尝试将人工神经网络与遗传算法相结合,探索开发胚胎智能评估系统的可能性。结果表明,该方法在保持临床可解释性的前提下,对提升评估一致性具有一定效果。这项研究提示,人工智能不仅能提升评估准确性,更重要的是可以弥补人工评估中难以避免的主观差异。该方法为胚胎评估提供了一个可参考的技术方案,但其临床应用价值仍需更多研究验证。  Toschi M, Bori L, Rocha JC, Hickman C, Gouveia Nogueira MF, Satoshi Ferreira A, Costa Maffeis M, Malmsten J, Zhan Q, Zaninovic N, Meseguer M. A Combination of Artificial Intelligence with Genetic Algorithms on Static Time-Lapse Images Improves Consistency in Blastocyst Assessment, An Interpretable Tool to Automate Human Embryo Evaluation: A Retrospective Cohort Study. Int J Fertil Steril. 2024 Oct 30;18(4):378-383. doi: 10.22074/ijfs.2024.2008339.1510. PMID: 39564830; PMCID: PMC11589968.
图片

研究背景

在辅助生殖技术中,胚胎的形态学评估通常依赖胚胎学家的主观判断。然而,这种评估方式面临显著的评估者间差异问题。研究发现,不同专家对同一胚胎的内细胞团(ICM)和滋养外胚层(TE)的评分一致性较低,Kappa值约为0.3,这直接影响了胚胎选择的准确性。尽管人工智能(AI)技术已经被引入胚胎评估领域,但目前大多数AI模型都存在“黑箱”问题,即其决策过程缺乏可解释性,无法得到临床医生的广泛信任。因此,开发一种既能提高评估准确性,又具有可解释性的AI工具,对于推动胚胎评估的客观化和标准化具有重要临床意义。
Fig 1

研究方法

本研究通过收集223例人类囊胚的静态时差成像数据,采用标准化条件下的EmbryoScope®培养箱采集所有图像。在数据预处理阶段,首先进行了灰度转换和分辨率调整,以统一不同图像的标准;接着运用Hough变换精确识别囊胚的边界,从而提取出囊胚轮廓。为了提取关键的形态学特征,研究团队进一步采用了灰度共生矩阵(GLCM)和分水岭算法,分别用于纹理分析和图像分割,从而提取囊胚的几何和纹理特征。 在模型构建方面,研究结合了遗传算法(GA)和人工神经网络(ANN)。遗传算法用于优化神经网络的结构配置,包括神经元的数量、隐藏层的层数以及其他关键参数,从而提升模型的性能。所有数据集按70%、15%、15%的比例划分为训练集、验证集和测试集,确保了模型具有较好的泛化能力和可靠性。 在训练过程中,采用神经网络对囊胚扩张(BE)、内细胞团(ICM)和滋养外胚层(TE)进行分类。评估指标包括准确率、Kappa值(用于评估一致性)以及ROC曲线下面积(AUC),这些指标可以全面评估模型在不同评估任务中的表现。
图片

研究结果

研究表明,AI模型在测试集上的评估准确率为81.5%(BE)、78.8%(ICM)和78.3%(TE),显示出良好的分类能力。与五名不同胚胎学家的评估结果相比,AI模型在评估一致性方面取得了显著提升。尤其是在BE和ICM的评估中,AI模型的Kappa值从人工评估的0.3-0.4提升至0.7,显示出AI模型在提高评估一致性方面的优势。尽管AI模型在TE的评估中,Kappa值为0.4,仍低于BE和ICM,但这一结果相较于人工评估,仍然表现出显著的改善。 在性能方面,AI模型在BE评估中的AUC值为0.956,ICM为0.854,TE为0.769,说明模型在对囊胚扩张的识别上表现最为优秀。值得注意的是,所有模型输出均严格遵循Gardner评分标准,确保了评估结果与现有临床诊疗体系的高度兼容性。 尽管AI模型在TE的评估上表现仍有限,部分原因可能与TE细胞边界模糊等生物学特性相关,但总体上,模型的表现相较于人类胚胎学家的评估一致性,具有显著提升。
图片

研究创新点

本研究创新性地结合了遗传算法和人工神经网络,通过进化计算优化神经网络的结构,提升了胚胎评估的准确性。研究还采用了可解释性强的特征工程方法,提取了囊胚的纹理和几何特征,使得模型的决策过程更加透明,增加了其可解释性。这种方法不仅提高了评估一致性,还解决了传统评估方法中的主观性问题,具有广泛的临床应用前景。
图片

研究局限性

本研究存在一定局限性。首先,作为回顾性研究,结果可能受数据选择偏倚影响。其次,研究仅使用了静态图像进行分析,未能充分利用时差成像的动态信息,限制了胚胎发育过程的全面评估。此外,尽管样本量为223例,但对模型的泛化能力验证仍显不足,尤其在TE评估方面,模型表现仍有提升空间。

临床意义及展望

本研究为胚胎评估标准化提供了新思路,未来应开展多中心前瞻性研究,验证AI评分与临床妊娠结局的相关性。结合时差成像的动态发育数据,将进一步提升评估的准确性和时空维度。AI评估技术不仅可应用于胚胎评估,还可扩展至胚胎植入前遗传学筛查(PGT)等临床应用,帮助提高不孕不育患者的治疗效果。未来,随着技术的不断进步,AI工具有望成为辅助生殖技术中的重要组成部分,推动胚胎选择和治疗方案的精准化。