一、从两桩旧案说起:家系标记的侦查价值早已被验证
2016年8月26日,甘肃白银连环杀人案嫌疑人高承勇落网。新华网2016年8月30日转载的报道还原了关键一步。他的远房堂叔因行贿被监视居住,警方采了血样。Y-DNA检验比对发现,这人与"8·05"案现场嫌犯的遗传数据相符合。锁定高氏家族后逐一筛排,最后确认了高承勇本人。
2020年2月23日,南京医科大学女生被害案嫌疑人麻继钢归案。南京警方借Y-STR家系排查把范围缩到麻姓家族,再结合年龄特征筛出重点人员,麻继钢就在其中。公安部通报,命案积案攻坚行动2020年共破获积案6270起、抓获命案逃犯5381名(央视网2021年8月26日转引公安部新闻发布会),相当一批靠的就是这个男系标记。Y-STR在破案上的战绩没什么可争的。真正悬着的问题是另一个:它能作为法庭证据吗?这正是国际法医遗传学会(ISFG)那份推荐想回答的。
二、先厘清概念:单倍型、家系与"容差"
Y-STR是Y染色体上的短串联重复序列。Y染色体约95%的区域不与X染色体重组,几乎原样从父传子。同一父系的所有男性共享同一个Y-STR单倍型,突变除外。这带来三个后果。第一,位点之间不独立,常染色体的乘积法则用不上,单倍型频率只能靠数据库估计。第二,匹配不等于个体识别,比中的是整个家族。第三,突变会打破"完全一致",同一家系内部出现分型差异,中国实务里叫"容差"。
四川大学与浙江省公安物证鉴定中心2021年发表于《四川大学学报(医学版)》的研究(DOI 10.12182/20210760107)给了一组很实用的数字。12个中国汉族家系269人的35个位点数据里,家系成员之间容差在0到7个位点、0到7个步长,99%落在5个位点6个步长以内。无关个体之间的差异至少是11个位点15个步长。两条分布没有交集。吴微微等人在《中国法医学杂志》2020年35卷390页的调查结论一致。
三、国际关键文件:ISFG的Y-STR结果解释推荐
1. 三个版本的文件沿革
ISFG DNA委员会对Y-STR的文件有三个版本。2001年,Gill等人在International Journal of Legal Medicine(114卷305页,DOI 10.1007/s004140100232)发布首版,解决命名与报告格式。2006年,Gusmão等人在Forensic Science International(157卷187页,DOI 10.1016/j.forsciint.2005.04.002)做了更新。现行有效的是Roewer等人2020年版本,发表在Forensic Science International: Genetics第48卷,102308,DOI 10.1016/j.fsigen.2020.102308,PMID 32622324。
标题里的"2024"先交代一句:截至2024年底,ISFG没有发布新版Y-STR解释推荐,2020版仍是现行有效版本。2024年前后的推进不在官方文件里,而在文献里。推荐五年多没动,实践跑得比文件快。这个时间差本身就说明问题。
2. 2020版的核心要点
- 频率估计:计数法与离散拉普拉斯(Discrete Laplace)法二选一。委员会倾向后者,理由是罕见单倍型在计数法下会被严重高估,离散拉普拉斯能借祖先单倍型簇保住证据力。
- 参考数据库:提出硬性要求,随机个体、完整试剂盒单倍型、元种群与亚种群分层、足够样本量、提交方须参加能力验证。
- 元种群:鼓励用YHRD的元种群(比国家库更大的祖源分层)作为频率背景。
- 似然比表述:推荐标准命题对,H1"X是DNA来源",H2"人群中随机男性Y是来源",并要求附一句提醒:父系亲属与X有很高概率共享同一单倍型,两者的似然比相同。
- 分诊与决策流程:按证据强度、法律要求、数据可得性分级,从定性排除或不排除,走到定量似然比。
- 快速突变Y-STR:用于区分近亲男性。
3. "2024"的推进:命题、谱系与突变模型
Bright等人在Journal of Forensic Sciences(2025年70卷271页,DOI 10.1111/1556-4029.15669,2024年11月在线发表)重写了命题。他们指出,"POI或其近亲留下DNA"这种命题没法用,近亲边界不清,而谱系意义上根本不存在"无关男性"。方案是把"不是POI"操作化成"人群随机男性"。Caliebe等人2025年在Scientific Reports(15卷14651,DOI 10.1038/s41598-025-98644-2)提出按嫌疑人谱系模拟未分型亲属单倍型的数学框架,把近亲问题直接算进匹配概率。论文里附带的还只是一个没正式命名的Python实现。把框架做成可分发软件的,是Zandstra等人2026年在FSI:Genetics(84卷103518,DOI 10.1016/j.fsigen.2026.103518)发布的MatchY。Puch-Solis等人在Science & Justice(2024年64卷180页,DOI 10.1016/j.scijus.2024.01.001)评估了能嵌进解释流程的突变模型。Olsen等人2025年在FSI:Genetics(80卷103320,DOI 10.1016/j.fsigen.2025.103320)用模拟算出了数据库命中的量化概率。数字放在下一节。
四、关键数据
- YHRD库容(本文写作时访问yhrd.org):最小单倍型349,750条,Y17单倍型289,405条,Y23单倍型103,280条,Y27单倍型106,444条,Ymax单倍型46,773条,Y-SNP 31,377条。
- Purps等人2014年全球19,630个样本(DOI 10.1016/j.fsigen.2014.04.008):Y23位点下92.9%的单倍型只出现一次。
- 英国与爱尔兰3,000余样本(Aliferi 2018,经Emerging Topics in Life Sciences 2021年综述转引,DOI 10.1042/ETLS20200339):Y23单倍型97.9%唯一,加上Yfiler Plus五个位点后升到99.5%。
- 13个快速突变Y-STR(RM Y-STR):Ballantyne等2012年首次提出这套位点(DOI 10.1016/j.fsigen.2011.04.017),2014年又在Human Mutation发表全球验证(DOI 10.1002/humu.22599)。验证数据:26.9%的父子对能被区分开,Yfiler只有4.5%;兄弟对56.3%可以区分,Yfiler只有约10%。
- Andersen与Balding 2017(PLoS Genetics,DOI 10.1371/journal.pgen.1007028):相隔20代的父系亲属仍有18%的概率共享Y23单倍型;即使用27个位点,仍有5.5%共享。
- Olsen等人2025年模拟(DOI 10.1016/j.fsigen.2025.103320):50万人口里,数据库覆盖0.5%时,Yfiler Plus命中率约6%、PowerPlex Y23约10%;覆盖5%时升到约41%和54%。一旦命中,匹配者与真实供者在5次减数分裂以内的概率约64%和56%。
五、国内外标准差异:一张表看清分歧
| 体系 | 频率估计方法 | 参考数据库 | 证据定位 |
|---|---|---|---|
| ISFG 2020版推荐 | 计数法或离散拉普拉斯,倾向后者 | YHRD元种群 | 定量似然比加决策分诊 |
| 美国SWGDAM(现行2022版Y染色体STR检验解释指南) | 计数法n/(N+1)加置信区间与θ修正 | YHRD美国亚人群 | 匹配概率 |
| 德国(2018年联合推荐) | 离散拉普拉斯为默认 | YHRD元种群 | 似然比 |
| 英国(法医学监督官指引FSR-GUI-0013) | 增补计数n+1/(N+1),默认 | YHRD元种群,无国家Y库 | 似然比 |
| 波兰(2020年推荐) | Kappa法 | 波兰国家库 | 匹配概率 |
| 中国 | 无公开的法庭统计框架,实务按容差规则比对 | 各地自建Y库 | 侦查线索为主 |
这张表的素材来自Roewer与Willuweit 2021年在The ISHI Report上的综述。各国都认YHRD是主要参考库,却各选各的统计模型。分歧点其实只有一个:证据权重该由数据库大小决定(计数法),还是由单倍型的演化结构决定(离散拉普拉斯)。英国的情形要先说清楚:它没有全国性Y-STR库,法医学监督官的指引把YHRD设为默认参考库,频率估计默认增补计数n+1/N+1,n+2/N+2只是备选项。
六、中国家系排查:规模、成效与衔接难题
郑州是全国最早建Y-STR数据库的城市之一,2013至2014年覆盖全市(新华网2016年报道)。刘亚举等人早在2015年就梳理过家系排查与建库的现实问题。白银案之后,内蒙古赤峰、河南、福建、云南多地跟进。2025年9月,锡林浩特市公安局通告采集辖区男性血样,建设"Y库家系工匠系统"。虽然声明自愿,仍在舆论上掀起了讨论(果壳2025年12月报道)。
中国路径的强项是规模与执行力。家系聚类、容差比对、姓氏关联,一整套实战打法已经成熟。四川大学那项研究的主单倍型聚类,对12个家系269人的分类对应率是100%。短板同样明显:国内规范只解决"怎么检"。司法部2018年发布的《法医物证鉴定Y-STR检验规范》(SF/Z JD0105007-2018)管检验技术,《法庭科学DNA实验室检验规范》(GA/T 383-2014)管实验室操作。两件规范都没有规定单倍型频率怎么算、证据怎么表述。中国有一流的线索机器,却还没有公开的证据语言。这就是与国际标准衔接的第一道坎。
七、困境与伦理问题
先讲一个冤案。2009年台湾陈龙绮案,17个Y-STR位点把现场样本与包括他在内的三名男性"匹配",他因此获刑四年。2013年重检,23位点系统排除了他,他才洗清冤屈(果壳2025年12月梳理)。17个位点的家系级分辨力有多弱,这个案子是最扎眼的注脚。
然后是隐私。Y-STR本身携带的表型信息很少,但一个家族的Y数据可以推出姓氏分布、族群来源,还能把没被采过血的无辜亲属圈进来。德国至今禁止借DNA推断祖源与外观,Y染色体分析本身倒是允许的(Emerging Topics in Life Sciences 2021年综述,DOI 10.1042/ETLS20200339)。YHRD曾收到的维吾尔族、罗姆人单倍型数据,还被质疑未获知情同意。中国还有一层特有的敏感:Y染色体与姓氏平行遗传,家系排查实质接近姓氏排查,在族群混居地区使用要格外克制。
说句主观的话,这事搁在任何一个被采血的普通男性身上,都会问一句:我的基因数据谁在用,用到哪一步为止?荷兰在Vaatstra案之后两次修法,才把家系排查从"做了再补手续"变成"依法行事"。中国的法律依据至今没有画清楚。
八、趋势与出路
国际趋势已经清楚:把Y-STR的统计评估从人群频率升级成谱系概率。MatchY这类工具把未分型的亲属直接纳入模型,快速突变位点、Y-SNP、大规模平行测序在提高家系内部的分辨力。
中国的出路,我看有三条。第一,建立公开的单倍型频率统计框架,把ISFG的似然比表述落成中文证据规范,哪怕是先给一个保守版的计数法标准。第二,统一家系排查的容差判据,0到7个位点这类经验值需要全国性数据背书。第三,立法。建库的授权边界、样本留存期限、删除机制、二次使用限制,都应当有明确依据。中国不缺技术,缺的是把这条线画清楚。没别的。




