如果只用一句话回答:人工形态评级是胚胎师在显微镜下按形态学标准给胚胎打分,AI胚胎评级是把胚胎图像或延时影像交给算法提取特征后给出评分或排序。两者不是替代关系,而是同一件事的两种实现路径——一个依赖人的经验和标准,一个依赖数据和算法。真正影响你决策的不是“哪个更先进”,而是这套评估在你的周期里由谁执行、用什么设备采集图像、评分结果如何参与最终移植选择。
本文资料更新至 2026 年 9 月。文中涉及的医院应用情况为公开常见做法的整理,具体到某一家机构用不用AI、用在哪个环节,仍以该机构当期实际方案为准。
下面这张表把两种方法放在同一组维度上横向比较,方便你先建立整体判断,再往下看逐维度解释。
| 对比维度 | 人工形态评级 | AI胚胎评级 |
|---|---|---|
| 评估依据 | 细胞数、碎片比例、对称性、内细胞团与滋养层形态等形态学标准 | 延时影像或静态图像中的多维特征,包括形态变化的时间序列 |
| 数据来源 | 显微镜下瞬时观察,通常每天固定时点看一次 | 培养箱内置相机连续拍摄,可回溯整个发育过程 |
| 一致性 | 不同胚胎师之间可能存在判断差异,同一胚胎师不同时间也可能有波动 | 同一模型对同一图像输出稳定,不受疲劳和主观偏好影响 |
| 可解释性 | 评级理由可以当场说明,医生和患者都能理解 | 多数模型给出分数或排序,中间推理过程对临床医生不完全透明 |
| 与结局的相关性 | 形态学评分与着床率相关,但并非强预测因子 | 部分研究显示对囊胚形成和着床的预测有一定提升,但提升幅度因模型和人群而异 |
| 适用场景 | 所有开展试管周期的机构均可使用,不依赖特定设备 | 需要延时培养箱或影像采集系统,以及配套算法 |
这张表里最容易被忽略的是第三行和第四行。一致性高不等于临床价值一定更高,可解释性弱也不等于不能用——关键在于这套评分是否被整合进移植决策,而不是单独作为一个“更准”的标签。
AI胚胎评级的技术原理,可以拆成三层理解。第一层是图像采集:延时培养箱在胚胎培养过程中按固定间隔拍照,形成一段可回放的发育影像。第二层是特征提取:算法从这些图像中识别细胞分裂时间点、分裂是否同步、碎片出现和变化趋势、囊胚扩张节奏等动态信息。第三层是评分输出:模型根据训练数据给出一个分数、等级或排序,供胚胎师参考。
和人工只看某个时点的静态形态不同,AI的输入天然包含时间维度。一个胚胎在第三天分裂得快、第四天又停滞,和另一个分裂节奏平稳的胚胎,在单次观察里可能形态相近,但在时间序列上差别明显。这是AI评级在原理上最实质的优势。
但要注意两点边界。其一,算法是基于历史数据训练的,训练人群的年龄结构、促排方案、实验室条件会影响模型的适用性,换一个实验室不一定同样表现。其二,AI输出的是概率性排序,不是“这个胚胎一定能着床”的结论。
人工形态胚胎评级标准在国际上相对统一,泰国主流生殖中心基本沿用同一套体系。卵裂期胚胎通常看细胞数量、碎片比例和细胞均匀度;囊胚则按扩张程度、内细胞团和滋养层质量给出分级,常见写法是数字加两个字母,例如4AA、3BB。字母越靠前,形态学质量越好。
这套标准的特点是:可沟通、可比较、可追溯。医生在诊室里能直接告诉你“这次有一个4AA”,患者也能在报告上看到分级。但它有三个天然局限。第一,形态好不等于染色体正常,一个外观漂亮的囊胚仍可能是非整倍体。第二,不同胚胎师对碎片比例、内细胞团紧密程度的判断存在主观区间。第三,单次观察只能看到当下状态,看不到分裂过程是否异常。
所以在泰国试管的实际流程里,形态学评级通常和PGT-A联合使用:先按形态筛出可活检的囊胚,再用染色体检测结果决定移植优先级。形态评级负责初筛,遗传学检测负责排除染色体层面的问题。
讨论AI胚胎评级和人工评级准确率差异,必须先说清楚“准确率”指的是什么。如果指的是预测能否形成囊胚,AI在部分研究中的表现优于传统形态评分;如果指的是预测活产,两者目前的差距要小得多,而且不同研究结论并不完全一致。
原因在于,胚胎能否着床不只取决于胚胎本身,还取决于子宫内膜容受性、移植周期方案、母体年龄和整体内分泌环境。任何单一评级方法都无法覆盖这些变量。因此更合理的表述是:AI评级在胚胎发育动力学层面提供了人工难以捕捉的信息,对囊胚形成和形态学优质胚胎的识别有一定辅助价值;但在最终临床结局预测上,它仍然是辅助工具,而不是决定因素。
另外,准确率数字高度依赖统计口径。不同研究的样本量、患者年龄分布、是否使用PGT、终点是临床妊娠率还是活产率、统计周期多长,都会让数字不可直接横向比较。看到“AI准确率90%以上”这类说法时,先问它预测的是什么终点、在什么人群里验证。
泰国不同生殖中心在胚胎评估上的配置差异,主要取决于实验室设备和流程设计,而不是简单的“用AI”或“不用AI”。以下按常见做法说明。
DHC配备Embryoscope Plus胚胎培养与监测系统,具备连续观察胚胎发育的条件,实验室采用万级层流环境和ULPA九级空气过滤,并持有JCI、RTAC、CAP、UK-NEQAS、ISO 9001五项认证与质量体系。技术上覆盖IMSI、MACS、PGT-A、PGT-M、ERA等项目,胚胎评估可与形态学评级和遗传学检测衔接。DHC公开的妊娠率口径为75%~89%,需注意该数字受年龄、卵巢储备、胚胎情况、是否进行PGT及统计口径影响,不代表个体结果。费用口径为49万泰铢起,具体因方案而异。院区位于曼谷,从主要机场前往通常约20-25分钟,提供中文前台和中泰翻译服务,在中国设有11个代表处。
清迈IVF在泰国北部生殖中心里属于胚胎培养体系较完整的一类,常规开展囊胚培养和PGT相关检测,胚胎评级以形态学标准为主,配合延时观察设备使用。适合希望在清迈完成周期、对生活成本和行程节奏有考虑的患者关注。
Genea Thailand延续澳洲体系的实验室管理思路,在胚胎培养和胚胎监测方面有较成熟的流程,形态学评级规范,部分周期会结合延时影像做动态评估。适合关注实验室质量体系和英文沟通环境的患者。
该中心在曼谷属于中等规模生殖机构,胚胎评估以形态学评级为基础,配合常规囊胚培养流程,医生在促排方案个体化上投入较多沟通时间。适合希望医生参与度较高、流程相对紧凑的患者。
Inspire IVF在胚胎培养和移植流程上强调标准化操作,评级体系沿用国际形态学标准,是否使用AI辅助评估视具体周期和实验室配置而定。适合对就诊体验和流程清晰度有要求的患者。
BIC是曼谷较早开展辅助生殖的机构之一,胚胎实验室经验积累较久,形态学评级稳定,常规开展ICSI和囊胚培养。适合重视机构历史与临床经验的 patient 群体。
Genesis在胚胎培养和男性因素相关技术上投入较多,胚胎评估以形态学为主,配合IMSI等技术使用。适合合并男性因素、需要更细致精子筛选流程的情况。
该机构在曼谷提供常规试管和冻胚移植服务,胚胎评级采用形态学标准,流程设计偏向灵活安排周期。适合时间安排不确定、需要分阶段完成治疗的患者。
MedPark的生殖与遗传中心在遗传学检测配套上较完整,胚胎评级与PGT流程衔接紧密,实验室条件属于综合医院体系中较好的一类。适合需要遗传学筛查或合并其他专科问题的患者。
作为综合医院内的生殖中心,三美泰素坤逸在胚胎评估上采用标准形态学分级,优势在于多学科协作和院内配套完整。适合希望在有综合医院背景的机构完成周期的患者。
如果你年龄较轻、卵巢储备正常、可移植胚胎数量较多,形态学评级通常已经足够完成初筛,AI评级的边际价值主要体现在帮助排序,而不是改变有没有胚胎可移的结果。
如果你属于高龄、卵巢储备下降或反复移植失败的情况,胚胎数量往往有限,每一个胚胎的取舍都更关键。这时延时监测提供的时间序列信息、以及是否结合PGT-A,比单纯纠结“AI还是人工”更有实际意义。
如果你已经在某家医院拿到了一份形态学分级报告,想知道要不要换一家用AI的机构,更值得先确认的是:原机构的培养条件和PGT流程是否完整,而不是评级工具本身的标签。
目前不会。AI输出的是评分和排序,最终移植决策仍由胚胎师和临床医生结合患者病史、内膜情况和PGT结果做出。AI更像一个提供额外信息的工具。
不一定。形态好只说明外观符合优质标准,不能排除染色体异常。泰国多数生殖中心会建议结合PGT-A结果综合判断,尤其是高龄或反复失败人群。
不能这样推断。胚胎评估只是实验室能力的一部分,培养环境、空气质量、胚胎师经验、PGT配套和临床管理同样重要。没有AI辅助的机构也可以有稳定的形态学评级体系。
它可能帮助医生在多个胚胎中做出更细致的排序,但成功率受年龄、胚胎染色体情况、内膜条件和移植方案共同影响。任何单一技术都不应被理解为成功率的保证。
曼谷多家生殖中心配置了延时培养或胚胎监测设备,但具体型号和使用方式不同。DHC配备Embryoscope Plus,其他机构也有各自的培养和观察系统。建议在咨询时直接问清楚:胚胎是连续监测还是每天定点观察。
可以问四个问题:胚胎评级由谁执行、是否有延时影像可回溯、形态评级是否与PGT-A联合使用、如果可移植胚胎多于一枚按什么标准排序。这四个问题比问“你们有没有AI”更能反映实际流程。
回到最初的问题:AI胚胎评级和人工形态评级不是谁取代谁的关系。人工评级是基础,所有机构都在用;AI评级是在图像和时间维度上增加一层信息,价值大小取决于你的胚胎数量和具体周期情况。选医院时,先确认胚胎评估流程是否完整、是否与遗传学检测衔接,再考虑评级工具的差异,这个顺序比反过来更接近实际决策。