[易学堂]在辅助生殖中用AI来挑选胚胎所面临的挑战

2025年11月27日
返回列表

随着单囊胚移植等技术的不断普及,辅助生殖实验室的胚胎挑选环节对于最终成功率的影响至关重要,传统的人工挑选方式已经被证明带有较大的主观性和不一致性,而基因筛查等方法有严格的适用范围且面临高成本和有创操作等问题。因此利用人工智能技术来挑选最有潜力的胚胎,一直是近年来国内外胚胎学家们特别关注和投入的领域,涌现了大量的论文和研究成果。

Curchoe等人(2020年)回顾了生殖医学中人工智能研究的结果与临床实践的结合(Evaluating predictive models in reproductive medicine – Fertility and Sterility (fertstert.org))他们归纳了这类文献中常见的四种陷阱:小样本量、不平衡的数据集、非通用环境,以及有限的性能评价指标。

除此以外,大部分在胚胎选择中尝试AI技术的工作,都采用了端到端的“黑盒子”模型,这种AI模型的内部推理过程要么过于复杂、无法让人理解;要么是私有不公开的,外人也无从理解。这种神经网络从设计之初就是不可解释的。不透明的“黑盒子”AI模型,将在临床应用中遇到伦理和认知上的双重问题。

伦理风险

  • 缺少随机对照实验结果。目前发表的文章基本都是基于回顾性的临床实验,没有前瞻性RCT随机对照试验结果,无法真正证明方法的有效性和安全性。

  • 降低了医患共同决策的可能性。尽管在目前的临床操作中,胚胎选择并不必须要征询患者的意见,但是良好的医患沟通是成功治疗必不可少的因素。如果由于模型的不透明性,医生对于AI的评估结果无法给出具体的医学解释,潜在降低了患者对于治疗过程的参与程度,增加了医患不信任的风险。

  • 选择倾向性。AI选择的胚胎,对于胎儿性别等结果是否有影响?AI模型的性能是否会受到人种等因素的影响?这些都不是回顾性的实验能够说明的问题。

  • 未来的长期影响。端到端的AI算法往往以妊娠率或者活产率为解决来训练模型,但是基于这种优化目标的胚胎选择结果,对于被选中并成功出生的试管婴儿是否有长期的负面影响,需要进行长期深入的跟踪研究。当然,这也是其他IVF技术同样要面临的问题。

  • 责任的缺失。基于不透明的AI模型所做的胚胎选择,最终由谁来对结果负责任?传统上,如果患者指控该过程中存在疏忽,那么会有一个专家团队来评估医师的决策是否合理,也就势必要求整个评估过程是透明的以及可解释的。

认知风险

  • 信息的不对称。对于一个黑盒子形式的AI模型,系统的开发者与使用者(胚胎学家)之间存在着信息不对称。如果不了解模型内在的推理过程,胚胎学家很难完全评估和信任这些复杂的模型。

  • 混淆变量的破坏性。强化训练得到的黑盒模型有可能是基于一些混淆变量(confounders)而不是真正有价值的指标来做出预测。举一个极端的例子,如果在某个数据集中,类别1的图片左上角都标有字符A,而类别2的图片左上角都标有字符B,那么学习到的分类模型大概率会根据左上角的字符而不是真正的图片内容来进行分类。很显然这种模型虽然在这个数据集中表现非常完美,但是一旦用在其他地方其准确度就会直线下降。由于黑盒模型内在的不可解释性,这种混淆变量可能难以检测,并且导致模型的泛化能力很差。尤其是如果在模型训练过程中,选择了错误的评价指标时,这种混淆变量更加难以被发现。

  • 难以实时纠错。由于内在的推理过程不可知,黑盒模型只能给出一个最后的评分或者预测结果。当系统突然发生变化(比如说摄像头突然产生了某种故障)导致算法出现错误结果的时候,胚胎学家可能无法马上发现问题。

  • 系统的低鲁棒性。黑盒模型的上述缺陷可能带来的一个问题是系统比较脆弱,对于整体环境的变化非常敏感。这意味着促排卵方案、培养箱甚至是培养液的变化都有可能会导致系统的性能劣化,生殖中心不得不按照AI系统的要求购置整套系统,潜在提高了治疗成本。

相比端到端的黑盒模型所带来的上述伦理和认知风险,在胚胎选择中应用更多可解释的机器学习算法显然是更为可行的解决方案。我们也将在后续文章中继续讨论,如何将可解释的人工智能模型用于胚胎选择。 

严格的随机对照试验将是检验AI系统有效性的终极标准。在此之前,前瞻性的队列实验将成为我们迈出的第一步。为了有效避免伦理风险,目前阶段,AI系统在胚胎挑选环节可以承担一个辅助决策的作用,通过输出可解释的中间结果来帮助胚胎学家更加高效且客观的完成自己的工作,而不是完全代替胚胎学家的职能。