Github开源生信云平台 DEMO
这里的 clumping 可以直译成 “聚类 / 成团 / 扎堆”,但在 GWAS / MR 里更准确的理解是:
把处于较强 linkage disequilibrium(LD)的 SNP 归到同一“团”里,然后每一团只保留一个代表性 SNP。
假设你有下面这些 SNP:
SNP1 ───── SNP2 ───── SNP3 ───────── SNP4 │ │ │ └────── 高 LD ─────────┘ SNP4 与它们 LD 很低
比如:
如果设置:
clump-r2 = 0.001
那么 SNP1、SNP2、SNP3 可能被认为属于同一个 LD block,而 SNP4 是另一个独立信号。
于是:
SNP1 ─┐ SNP2 ─┼──> 一个 clump → 保留 SNP1 SNP3 ─┘ SNP4 ─────> 另一个 clump → 保留 SNP4
最终得到:
SNP1 SNP4
而不是:
SNP1 SNP2 SNP3 SNP4
因为 clumping 一般以 index SNP / lead SNP 为中心。
例如:
rs100 P = 1e-20 ← lead/index SNP rs101 P = 1e-15 rs102 P = 1e-10 rs103 P = 1e-8
如果它们彼此高度 LD:
rs100 ─── rs101 ─── rs102 ─── rs103 high LD
那么它们通常代表的是同一个遗传关联信号,而不是 4 个完全独立的 SNP。
所以:
clumping ↓ rs100 ─┐ rs101 ─┤ rs102 ─┼──────────→ rs100 rs103 ─┘
你之前的 MR 参数:
--clump-r2 0.001 --clump-kb 10000
意思大致是:
在 10,000 kb(10 Mb)范围内,如果两个 SNP 的 LD 达到 r² ≥ 0.001,就认为它们不够独立,只保留其中的代表性 SNP。
所以 MR 的流程可以理解成:
GWAS significant SNPs │ ↓ LD clumping │ ↓ 相互尽可能独立的 SNPs │ ↓ MR analysis
clumping 的核心目的就是“去掉由于 LD 而重复代表同一个遗传信号的 SNP”。
另外要注意:clumping ≠ LD pruning,两者非常相似但侧重点不同。如果你正在理解 gwas-mr --clump-r2 0.001 --clump-kb 10000,这个区别很值得弄清楚。
gwas-mr --clump-r2 0.001 --clump-kb 10000