[易学堂]融合合成与真实胚胎图像:提升胚胎细胞阶段分类模型训练效果的新策略

2025年12月1日
返回列表
本次介绍的这篇论文,用生成式AI来合成胚胎图像用于开发AI模型,既解决了数据不足的问题,又通过融合多来源数据提升了模型的泛化能力。从伦理角度来看,虽然使用合成数据规避了真实患者隐私问题,但高度逼真的胚胎图像仍可能引发对数据”人造化”的争议,以及当AI生成的胚胎形态被用于临床决策时,其责任归属和算法透明度问题也亟待探讨。 Presacan O, Dorobanţiu A, Thambawita V, Riegler MA, Stensen MH, Iliceto M, Aldea AC, Sharma A. Merging synthetic and real embryo data for advanced AI predictions. Sci Rep. 2025 Mar 21;15(1):9805. doi: 10.1038/s41598-025-94680-0. PMID: 40119109; PMCID: PMC11928674.

研究背景

在辅助生殖技术(ART)中,胚胎的形态评估是选择最可行胚胎的关键步骤。然而,胚胎数据的稀缺性限制了深度学习模型的训练,尤其是在胚胎细胞阶段分类任务中。传统方法依赖于胚胎学家的主观判断,容易受到人为误差的影响。人工智能(AI)技术可以通过图像分析为胚胎评估提供客观支持,但胚胎图像数据的获取受到隐私和伦理问题的限制。为此,本研究提出了一种将合成图像与真实图像结合的训练策略,通过生成高质量的合成胚胎图像来扩展数据集,从而提升模型的分类性能。

研究方法

本研究使用了两个数据源:挪威奥斯陆Volvat Spiren生育诊所提供的胚胎视频帧数据,以及公开的“Human Embryo Time-Lapse Video”数据集。最终构建了一个包含5,500张真实胚胎图像的数据集,涵盖五个发育阶段(2-cell、4-cell、8-cell、morula、blastocyst),每个阶段1,100张图像。     为了生成合成胚胎图像,研究团队选择了两种生成模型:StyleGAN(生成对抗网络)和LDM(潜在扩散模型)。这些模型通过不同的生成机制生成高质量的合成图像,以扩展数据集的多样性和数量。每个模型为每个胚胎阶段生成5,000张合成图像。
图片
分类模型方面,研究者使用了三种深度学习模型(VGG、ResNet和ViT)进行胚胎细胞阶段分类。实验比较了仅使用真实数据、仅使用合成数据以及结合真实和合成数据的分类效果。此外,研究者还通过Turing测试评估了合成图像的逼真度,并使用Fréchet Inception Distance(FID)量化生成图像的质量。    
图片

研究结果

实验结果显示,将合成图像引入训练集显著提高了模型在胚胎细胞阶段分类任务中的表现。仅使用真实数据训练时,模型的准确率为94.5%;而在结合合成数据后,准确率提升至97%。此外,在外部Blastocyst数据集上的测试中,结合合成数据的模型表现显著优于仅使用真实数据的模型,准确率从68.88%提升至84.69%。    
图片
图片
生成模型的比较结果显示,LDM在生成图像的FID评分中表现优于StyleGAN,表明其生成的图像更接近真实数据。Turing测试进一步验证了合成图像的逼真度,胚胎学家在识别合成图像时的准确率仅为54.5%,而LDM生成的图像更难被识别为合成(正确识别率仅为34.4%)。
图片
图中展示的是胚胎学家标注的认为不真实的图像部分,可以看到即便是真实图像,也会有不符合胚胎学家认知的情况。

研究创新点

本研究首次系统性地评估了合成胚胎图像在胚胎细胞阶段分类任务中的价值,并提出了以混合数据训练深度学习模型的新策略。与以往仅依赖真实图像的训练方法相比,合成图像的引入不仅扩展了样本数量,也丰富了胚胎形态特征的表达,有助于提高模型的泛化能力。此外,研究还对合成图像的质量进行了量化验证,证明生成图像不仅可用,而且有效,为后续使用生成图像进行模型训练提供了坚实基础。

研究局限性

尽管研究结果显示合成图像在提升模型性能方面具有明显优势,但仍存在一些局限性。首先,合成图像的质量仍受限于生成模型的能力,部分图像可能出现不真实的细节或纹理,影响训练效果。其次,本研究所使用的真实数据来源于同一诊所,尚未在多中心或不同成像平台上进行验证,因此模型的泛化能力仍需进一步评估。此外,当前数据集未包含中间胚胎阶段(如3-cell和5-cell),也未涵盖高碎片率胚胎,这可能限制了模型在复杂临床情况下的表现。

临床意义与展望

本研究展示了通过生成对抗网络和扩散模型构建高质量合成图像,并与真实数据融合训练的可行路径,显著提升了胚胎细胞阶段分类模型的表现。这一策略不仅可应用于胚胎分类,也可推广至形态评分、发育事件识别等任务,进一步提高胚胎评估过程的标准化与自动化水平。未来,若能结合不同培养平台、多中心数据进行大规模验证,并将该模型与植入结局结合使用,有望助力临床实现更加精准、个性化的胚胎选择策略,推动IVF成功率的提升。