国际前沿速递

SWGDAM 2024线粒体DNA解释指南落地:从异质性判读到NGS数据,美国新规与中国mtDNA检验标准的差距

编译: 0 次浏览

一、从罗曼诺夫家族的公案说起

1991年,叶卡捷琳堡郊外挖出一批遗骸,被怀疑是末代沙皇尼古拉二世一家。英国法庭科学服务部的Gill团队做了线粒体DNA鉴定,1994年公布结果。尼古拉二世在16169位点出现C和T的混合信号,也就是点异质性。按当时朴素的看法,同一个体的mtDNA应该完全一致。这种混合一度让人怀疑检材有问题,连鉴定结论都被打了问号。两年后Ivanov团队测了沙皇弟弟格奥尔基的遗骸。同一个位点检出同样的异质性,身份才最终坐实。

30年过去,异质性判读依然是线粒体DNA检验里最难啃的骨头。2024年9月9日,美国DNA分析方法科学工作组发布新版线粒体DNA解释指南。这份指南取代2019版,同步发布的还有一份常见问题补充说明。这是美国法庭科学mtDNA解释规则的又一次重写。NGS数据、全基因组测序和统计表述,全部纳入了规则框架。

二、几个绕不开的概念

线粒体DNA是细胞核外约16569个碱基的环状DNA,母系遗传。每个细胞有几百到几千个拷贝,降解样本里往往比核DNA更耐打。法医常规测高变区I、II(HVI、HVII),NGS时代可以扩展到整个线粒体基因组。样本序列与修订剑桥参考序列(rCRS)比对后,列出一串差异位点,就构成单倍型。

  • 点异质性:同一个体位点同时存在两种碱基,比如16169位同时看到C和T。
  • 长度异质性:多聚C这类均聚物区域碱基数不稳定,测序图下游出现套峰。
  • 系统发育比对:按进化学上已知的多态模式排列差异位点。规则比对:按一套人为排序的规则排列。同一串序列,两种方法可能给出不一样的单倍型写法。
  • 计数法统计:数一数单倍型在数据库里出现几次,除以库容量,得到频率。

三、SWGDAM 2024改了哪些地方

这份文件的演进脉络清楚:2003年初版,2013年大改,2019年纳入NGS,2024年把线粒体全基因组测序和统计计算正式写进正文。三处变化最值得说。

比对命名:系统发育比对成为唯一推荐路径

指南4.1条明确:在数据库检索实现字符串比对之前,序列一律用系统发育方法比对到rCRS。比对结果再经EMPOP数据库验证。规则法只在EMPOP不可用等特定情形下启用,而且要按五条规则的顺序走:差异最少优先,替换优先于插入缺失,转换优先于颠换,插失连续放置,插失放在轻链3'端。

同聚物C区给了硬性约定:HVI的C-stretch按16189C处理,HVII按310C或311T处理。515到525的AC重复基序保持,3107位不报告。插入记成315.1C这种格式,缺失记成249del。补充说明专门提醒:同一串序列,旧规则法和系统发育法可能差出3到5个差异位点。这种差别直接影响数据库检索,尤其是失踪人员比对。

异质性与混合物:从原则到可操作规则

2024版要求实验室在自己测序系统的操作范围内定义异质性。点异质性要在正反链都检出、高于本底才能报告。混合物解释必须经过验证,验证要能区分混合物、异质性、损伤和噪声。比对上,5.1.1条直接说:不建议把16193、309、573位点后常见长度变异用于比对和检索。CODIS和EMPOP默认忽略这些插入缺失。老版"两个及以上差异即排除"的硬规则,这次改成由实验室依据验证数据自定差异数,同时考虑检测范围、异质性阈值和遗传距离。

统计与NGS指标落地

统计仍用计数法:p等于x除以n,配上Clopper-Pearson 95%置信上限,也可以换算成似然率。全基因组数据允许用缩减范围检索来最大化区分度。短范围命中的单倍型,必须同时满足长范围匹配。NGS数据的判读指标也列全了:读深、Q值、链偏倚,外加变异频率、变异数和变异质量。

四、关键数据:异质性不是边缘现象

  • 控制区点异质性:Sanger时代人群检出率约6%。全基因组范围,点异质性出现在约25%的个体身上。
  • 长度异质性:控制区63.6%的个体都能检出。说实话,这个数字值得反复读:长度异质性不是例外,是常态。
  • 检出限:Sanger对点异质性的检出限约10%到20%。NGS可以压到5%以下,有的研究做到1%甚至0.5%。
  • 热点位点:HVI的16093、16129、16189、16309,HVII的73、152、189、207、215。
  • 家系验证:Connell等2022年用诺福克岛2339对母系亲属做全基因组比较。97.3%完全一致,2.7%单碱基差异判为不确定,假排除0例。把异质性当差异来算,不确定率上升6%,出现0.34%的假排除。
  • 国内数据:程凤等2021年在法医学杂志报告,8名个体中2人的颞部毛干检出异质性。这2人的口腔拭子和血液分型则完全一致。
  • 数据库规模:EMPOP第14版收录质量受控单倍型63434条,里面全基因组10648条。

五、中国标准与新规的差距

国内现行主力标准是司法部的SF/Z JD0105008-2018《法医物证鉴定线粒体DNA检验规范》。这份规范2019年1月1日实施,框架围绕Sanger测序设计,参考文献里引了ISFG 2014版指南,但只取了框架。NGS方面,公安部2022年发布GA/T 1979-2022《法庭科学 线粒体DNA二代测序技术规范》。国家标准GB/T 43636-2024《法庭科学 DNA二代测序检验规范》2024年10月实施。问题在于:后两份管的主要是检验流程和数据分析。结果解释和证据权重的规则,还挂在2018年那份Sanger时代的老规范上。逐项对比:

维度SWGDAM 2024中国现行规范
适用数据Sanger与NGS并重,全基因组单独展开以Sanger测序为主,NGS只提试剂盒要求
比对命名系统发育比对为唯一推荐,EMPOP验证,五条备选规则,C-stretch有硬性约定规则法为主,差异优先顺序为插失、转换、颠换,没有C-stretch命名体系
排除规则差异数由实验室依据验证数据自定,要考虑检测范围、异质性阈值和遗传距离固定规则:两个及以上碱基差异(不含长度异质性)排除,一个差异判不确定
统计表述频率加95%置信上限,可选似然率,可和STR、Y-STR证据合并没有统计条款,鉴定意见只有排除、不排除、不确定三档
群体数据库EMPOP验证比对,CODIS检索,数据库有质量要求鼓励实验室自建参考库,可参考EMPOP,没有全国统一频率库
混合物允许经验证后对NGS混合序列作包含或排除没有规定,只在特别说明里提醒考虑混合
损伤与NUMT补充说明专节讲胞嘧啶脱氨和核线粒体假基因没有涉及

两处差距最要命。第一是统计。美国报告mtDNA匹配必然附频率和置信区间。中国鉴定书只写"不排除来自同一母系",证据价值全靠鉴定人的个人说明。第二是对比规则本身。2018规范处理比对歧义时,把插入缺失排在转换、颠换前面优先考虑。SWGDAM 2024反过来要求替换优先于插失。同一个序列,按两套规则标注,理论上能差出一个比对结论。

六、困境与伦理

NGS把点异质性检出限从10%到20%的水平压到5%以下,新麻烦跟着来了:越灵敏,看到的低频混合位点越多,怎么区分真实异质性、测序噪声、损伤和污染?Connell那篇研究里,20%阈值漏掉了8个真实异质性,降到5%又引入2例假阳性。阈值没有标准答案。

全基因组比较把战场从约1100个碱基的控制区扩大到16569个碱基。母系亲属间差异位点增加了87.5%,旧的两差异排除规则正在逼近边界。一个碱基差异判"不确定",这结论对法庭太软,对家属太冷。科学的谨慎和判决的需要之间,隔着"不确定"三个字,这事搁哪个法院都难办。

伦理层面也不轻松。母系单倍型是家族性信息。测一个人的mtDNA,等于同时拿到了他所有母系亲属的一部分遗传信息。数据库入库、样本复检、跨代比对,知情同意怎么落地,国内还没有成文规则。2022年丰县事件的通报用了线粒体DNA,当时引发一轮科普讨论。mtDNA只能指向同一母系,不能单独认定具体亲缘关系。过度解读会闹出大错。

七、趋势与出路

  • 补解释层标准。GA/T 1979-2022解决了怎么做,还缺一份解决怎么判的NGS mtDNA解释指南。
  • 建全国统一的mtDNA频率数据库,质量受控,支持字符串检索。没有这个,统计表述就是无米之炊。
  • 把统计写进标准:频率、95%置信上限、似然率,逐步替代裸奔的"不排除"。
  • 做中国人群自己的全基因组和家系数据,验证排除规则和异质性阈值,别直接照搬欧美参数。
  • 生物信息学能力建设。NGS下机数据到单倍型之间隔着大量软件环节,软件验证和专家复核缺一不可。

SWGDAM这份文件传递的信号很明确。mtDNA解释的规则中心,已经从测序技术移到了数据判读。中国不缺测序平台,缺的是把判读规则补上。就这样。

参考文献