linkage disequilibrium (LD)–based clumping 中 clumping 代表什么意思

最后发布时间 : 2026-08-26 17:25:36 浏览量 :

这里的 clumping 可以直译成 “聚类 / 成团 / 扎堆”,但在 GWAS / MR 里更准确的理解是:

把处于较强 linkage disequilibrium(LD)的 SNP 归到同一“团”里,然后每一团只保留一个代表性 SNP。

为什么要 clumping?

假设你有下面这些 SNP:

SNP1 ───── SNP2 ───── SNP3 ───────── SNP4
  │          │           │
  └────── 高 LD ─────────┘

                              SNP4 与它们 LD 很低

比如:

SNPP 值与 SNP1 的 LD
SNP11e-101.00
SNP21e-80.80
SNP31e-60.70
SNP41e-70.01

如果设置:

clump-r2 = 0.001

那么 SNP1、SNP2、SNP3 可能被认为属于同一个 LD block,而 SNP4 是另一个独立信号。

于是:

SNP1 ─┐
SNP2 ─┼──> 一个 clump → 保留 SNP1
SNP3 ─┘

SNP4 ─────> 另一个 clump → 保留 SNP4

最终得到:

SNP1
SNP4

而不是:

SNP1
SNP2
SNP3
SNP4

为什么通常保留 P 值最小的 SNP?

因为 clumping 一般以 index SNP / lead SNP 为中心。

例如:

rs100   P = 1e-20   ← lead/index SNP
rs101   P = 1e-15
rs102   P = 1e-10
rs103   P = 1e-8

如果它们彼此高度 LD:

rs100 ─── rs101 ─── rs102 ─── rs103
          high LD

那么它们通常代表的是同一个遗传关联信号,而不是 4 个完全独立的 SNP。

所以:

                    clumping
                       ↓
rs100 ─┐
rs101 ─┤
rs102 ─┼──────────→ rs100
rs103 ─┘

在 MR 中为什么特别重要?

你之前的 MR 参数:

--clump-r2 0.001
--clump-kb 10000

意思大致是:

在 10,000 kb(10 Mb)范围内,如果两个 SNP 的 LD 达到 r² ≥ 0.001,就认为它们不够独立,只保留其中的代表性 SNP。

所以 MR 的流程可以理解成:

GWAS significant SNPs
        │
        ↓
   LD clumping
        │
        ↓
相互尽可能独立的 SNPs
        │
        ↓
    MR analysis

clumping 的核心目的就是“去掉由于 LD 而重复代表同一个遗传信号的 SNP”。

另外要注意:clumping ≠ LD pruning,两者非常相似但侧重点不同。如果你正在理解 gwas-mr --clump-r2 0.001 --clump-kb 10000,这个区别很值得弄清楚。