一、要解决的问题:STR查完人,案子还是冷的
传统法医DNA检测用的是STR。二十几个基因座做个体识别绰绰有余,查近亲也够。问题在于,国家数据库一旦没有直接命中,STR就撞墙了。现场DNA的主人不在库里,案子就只能继续冷下去。
金州杀手案是个典型。1974年到1986年,这个人在加州犯下13起谋杀、50余起强奸。多个现场都拿到了同一个人的DNA分型。CODIS数据库反复比对,没有命中。案子冷了四十多年。
2018年破案,靠的不是新证据,是换了思路:不找凶手本人,先找他的远房亲戚。调查人员把现场DNA做成SNP档案,上传到家谱数据库GEDmatch。系统匹配到三四代表亲级别的远亲。家谱学家建家族树,警方用传统侦查缩小范围。整个过程约四个月。2018年4月24日,前警察德安杰洛在萨克拉门托被捕。2020年6月29日他认下13起谋杀,8月21日被判终身监禁,不得假释。
这个思路在学理上早有支撑。2018年11月,Erlich团队在《科学》上发文。在一个128万人的家谱数据库里,欧洲裔个体约60%能找到三代表亲或更近的匹配。15%能找到二代表亲或更近的匹配。远亲搜索的前提,是几十万个SNP位点撑起的全基因组密度数据。法医实验室要做的,就是把现场微量DNA变成家谱数据库读得懂的数据。Infinium GSA芯片,是眼下最顺的一条路。
二、技术原理:SNP怎么“看见”五代表亲
2.1 芯片的分型化学
Infinium芯片是硅珠阵列。每颗硅珠上固定着特定SNP位点的探针。样本DNA先做全基因组扩增,酶切成小片段,再跟芯片杂交。关键的步骤叫单碱基延伸:延伸哪个碱基,就接上哪种荧光标记。两种等位基因对应两种颜色。iScan激光扫描仪成像,软件按荧光信号判型,输出每个位点的基因型。
标准流程输入量200纳克,三天出结果。GSA芯片的生化原理不算新,它胜在便宜、通量高、数据格式跟消费级家谱数据库兼容。
2.2 为什么STR看不到的亲戚,SNP看得到
亲缘关系靠IBD同源片段判断。两个个体共享的IBD片段总长度越长,血缘越近。三代表亲平均只共享基因组的零头,四代表亲更少。STR只有二十几个点,这种零散的小片段根本捕不到。64万个SNP撒满全基因组,几厘摩级别的共享片段才有机会拼出来。
2.3 完整链条
- 现场DNA先做STR,确认单人来源,确认库里无直接命中;
- 剩余DNA上GSA芯片分型,得到几十万个SNP;
- 格式转换后上传家谱数据库,检索共享片段匹配;
- 对命中的远亲逐个建家族树,找父母两系树杈的交汇点;
- 用年龄、性别、案发地等信息筛出候选名单;
- 取候选人的比对样本,回到常规STR直接比对。这一步定生死。
三、硬件平台与关键指标
这套体系的核心硬件是两件:芯片和扫描仪。
| 项目 | 参数 | 说明 |
|---|---|---|
| 芯片 | Infinium Global Screening Array-24 v3.0 | 654,027个固定标记,另可加10万个定制位点 |
| 样品通量 | 24样本/板,每周最多5760样本 | Illumina官方规格 |
| 扫描仪 | Illumina iScan System | 双色激光成像 |
| 扫描速度 | 自动装载下1.25分钟/样本,整板30分钟 | 周最大处理5670样本 |
| 标准DNA输入 | 200纳克 | Infinium HTS标准流程 |
| 法医低模板下限 | 0.20纳克仍可保持call rate大于95% | Russell 2023验证数据 |
质量阈值要单独说。科研项目的call rate平均在99%以上。Illumina给CGA芯片的出厂数据是99.37%,重现性99.99%,Log R偏差0.11。法医样本做不到这么漂亮。低模板会带来等位基因丢失和假纯合。Russell团队的验证专门设了信号强度和杂合率的解读阈值:先判样本合不合格,再谈数据能不能进数据库。
四、验证数据与多中心研究
美国这边,2023年发表在《Forensic Genomics》上的开发验证,是迄今最完整的一份。Russell团队按SWGDAM指南做了全套:精确性与准确性、灵敏度、污染、降解、物种特异性、模拟案件检材、混合样本、重复性与重现性、稳定性。核心结论是前面那个数字:DNA输入低到0.20纳克,SNP call rate仍超过95%。
欧洲的进展同样有分量。2021年,瑞典团队在FSI Genetics上复盘了林雪平双尸案。2004年,一名8岁男孩和一名56岁女性当街被刺死。警方做过9000多次询问、6000多人份的大规模DNA筛查,一无所获。系谱学介入后,现场DNA先做全基因组测序,再做基因型填充。数据放进GEDmatch和FamilyTreeDNA搜远亲。家族树最后收敛到一对兄弟,其中一个的STR分型与现场完全一致。这是欧洲第一起靠系谱学破获的命案。要说明白:瑞典案走的是测序加填充路线,不是芯片。这正好说明芯片和测序是两条可以互相校验的技术路线。
挪威2024年发表了三个冷案的进展。Qiagen同年完成ForenSeq Kintelligence套件的验证:约一万个家谱相关SNP,配MiSeq FGx测序仪,适合极度微量、降解严重的样本。芯片便宜量大,测序对微量样本更友好,两条路线各有位置。
| 研究 | 机构 | 技术路线 | 关键结果 |
|---|---|---|---|
| Russell 2023 | 美国 Signature Science | GSA芯片+iScan | 0.20纳克输入下call rate大于95%,SWGDAM全套验证 |
| Tillmar 2021 | 瑞典国家法医中心 | 全基因组测序+填充 | 欧洲首例,破获16年前双尸命案 |
| Antunes 2024 | Qiagen/Verogen | ForenSeq Kintelligence,约1万个SNP | 低输入微量样本验证完成 |
| Aanes 2024 | 挪威 | 系谱学流程 | 三起冷案获得突破性线索 |
五、误差控制清单
- 先做STR。确认单人来源,确认库内无直接命中,再启动系谱流程。混合样本上芯片,输出是两个甚至多个人的混合信号,家谱推断全乱。
- 看call rate。低于95%的芯片数据不要上传数据库。低模板下杂合位点容易丢成一个等位基因。假纯合会直接破坏亲缘计算。
- 看信号强度与杂合率。这两项阈值专门用来拦严重降解的样本和非人源DNA。
- 查污染。芯片灵敏度高,环境DNA、实验人员DNA都可能在结果里冒头。分型结果要跟STR结果交叉核对。
- 防家谱错误。收养、非婚生、过继会让家族树断线。公共家谱里的记录本身也常出错。说实话,这条线上最容易翻车的不是实验室,是族谱本身。
- 守合规底线。美国司法部2019年9月发布、11月1日生效的临时政策规定:系谱搜索只用于穷尽常规手段后的严重暴力案件,只能查用户明确同意执法检索的数据库。GEDmatch在2019年5月把默认设置改成用户主动选择开放。系谱结果只是侦查线索,最终必须靠STR直比或常规证据定案。
六、国内落地情况
国内路径跟欧美不完全一样。先看芯片基础设施:2019年12月,微基因与Illumina联合发布中国人群基因分型芯片CGA。这张芯片基于GSA v3框架,总共684,023个标记。约54万个来自GSA和亚洲筛查芯片的骨架位点,约17万个来自中国人群全基因组测序数据。说白了,它就是为中国人群设计的GSA。
应用端的核心力量在公安部鉴定中心,也就是原来的公安部物证鉴定中心,2022年更的名。李彩霞团队在系谱推断上有清晰的推进线:2019年在《刑事技术》发表《法医系谱分析研究进展》;2021年在《法医学杂志》报道用SNP系谱推断破获古汉墓被盗案;2023年完成基于全基因组测序的系谱推断研究;2025年在《刑事技术》发表SNP芯片数据系谱推断用于微量DNA检测的研究;2026年初又发表高密度SNP系谱推断效能研究。山西医科大学、中国人民公安大学先后有学位论文跟进。
民事鉴定方向,中山大学孙宏钰团队也在铺路。李燃、孙宏钰2023年在《法医学杂志》发表综述《法医学亲缘关系鉴定方法和研究热点》,把状态一致性、似然比、矩量、IBD同源片段这些远亲分析方法系统梳理了一遍。国内短板不在技术,在生态。微基因、23魔方这类消费级数据库主打祖源和健康解读,执法用途的数据接口和规则都没成型。技术已经就位,规则还在路上。就这样。




