表观基因组与染色质分析

系统讲解表观基因组与染色质分析:从 ChIP-seq 与 ATAC-seq 的实验原理与对照设计、FRiP 与 TSS 富集等质控指标、MACS2 峰值检测与 IDR 可重复性评估、motif 富集与足迹分析、差异结合分析,到 Hi-C 三维基因组概览,给出可复用的命令与阈值。

引言

表观基因组学(epigenomics)研究的是「同一份 DNA 序列在不同细胞里如何被差异化使用」。基因组序列是静态的,但一个肝细胞和一个神经元拥有完全相同的 DNA,却表达截然不同的基因——差异就写在表观修饰与染色质状态上。这类数据回答的是「哪些区域被调控」,而非「序列是什么」,因此分析范式与变异检测完全不同。

数据形态上的核心特征是:信号是连续的、区域性的,而非离散的位点。变异检测输出的是「chr1:100 处 A→G」,而 ChIP-seq 输出的是「chr1:1000-1500 这一段被 H3K27ac 修饰」。这种「区域富集信号」的检测问题,涉及背景建模、峰形拟合、多重复一致性等一整套方法学,是本章的重点。

工程上的难点有三。第一,信噪比高度依赖实验:抗体质量、交联效率、细胞数、酶切效率都会显著影响数据质量,一个失败的实验在分析层面无法挽救——所以质控是第一步也是最重要的一步。第二,对照设计复杂:ChIP-seq 需要 input 或 IgG 对照,ATAC-seq 需要评估线粒体污染与 Tn5 插入偏好,对照缺失会让峰值检测完全失真。第三,可重复性判据严格:ENCODE 标准要求生物学重复之间用 IDR(Irreproducible Discovery Rate)评估一致性,而不是简单取交集。

本文按「研究对象 → ChIP-seq → ATAC-seq → 质控 → 峰值检测 → IDR → motif 与足迹 → 差异结合 → Hi-C」的顺序展开。命令基于 MACS2 2.2.9、bowtie2 2.5.3、deepTools 3.5 与 HOMER 4.11。读完你应该能独立完成一条 ChIP/ATAC 分析流程,并判断一份数据「能不能用」。

目录

  1. 表观基因组学的研究对象与数据层级
  2. ChIP-seq 实验原理与对照设计
  3. ATAC-seq 原理、Tn5 与开放染色质
  4. 质控:FRiP、TSS 富集与片段分布
  5. 峰值检测:MACS2 参数与窄峰宽峰
  6. 可重复性评估:IDR 与重复样本
  7. Motif 富集与足迹分析
  8. 差异结合分析与基因组注释
  9. Hi-C 与三维基因组概览

1. 表观基因组学的研究对象与数据层级

表观组不是一个单一层级,而是多个可独立测量的维度:

维度测量对象主流方法数据形态
DNA 甲基化5mC 修饰WGBS、RRBS、EPIC 芯片单位点比例
组蛋白修饰修饰化组蛋白ChIP-seq、CUT&Tag区域富集信号
转录因子结合TF-DNA 结合ChIP-seq、CUT&RUN区域富集信号
染色质开放性裸露 DNA 区域ATAC-seq、DNase-seq区域富集信号
三维构象空间接触频率Hi-C、Micro-C接触矩阵
染色质状态区域功能状态ChromHMM 整合多组数据区段标注

分析上可分两类。「信号检测型」(ChIP/ATAC/DNase)的目标是从覆盖度信号中找出富集区域,方法学集中在背景建模与峰值检测;「矩阵型」(Hi-C)的目标是分析接触频率矩阵的结构,方法学集中在归一化与拓扑结构识别。本文以前者为主,第 9 节概览后者。

一个贯穿全章的认知是:这些数据都在测「同一份基因组的某种修饰」,所以坐标系统必须与基因组参考严格一致。用 hg38 的抗体数据配 hg19 的注释,峰的位置会整体错位。这与 变异检测与 VCF 处理 里强调的版本一致性是同一条铁律。

表观数据与转录组的关系值得单独说明。表观修饰是「调控的潜在状态」,转录组是「调控的实际结果」,两者经常不一致:一个增强子有 H3K27ac 修饰(潜在活跃)但下游基因不表达(可能缺少必要的转录因子)。因此**「表观变化 + 表达变化」的双重证据远强于任何单一证据**,这也是多组学研究的核心动机。反之,只看到表观变化就断言「基因被激活」,是这类研究最常见的过度解读。

数据的「区域」本质对工程的影响

由于信号是区域性的,表观数据的存储与计算方式与变异数据截然不同。BAM 之外还要维护 BigWig(连续信号轨道,用于可视化与定量)、BED(区间,用于峰与注释)、以及各种矩阵(deepTools 的多区域信号矩阵)。这些文件的坐标系与排序规则必须统一(sort -k1,1 -k2,2n 是标准),否则 bedtools 的操作会静默出错。参见 SAM/BAM 与 samtools 实战 了解底层格式的操作规范。

2. ChIP-seq 实验原理与对照设计

ChIP-seq(Chromatin Immunoprecipitation sequencing)的流程是:交联(甲醛固定蛋白-DNA 复合物)→ 片段化(超声或酶切)→ 用抗体富集目标蛋白 → 逆转交联 → 测序。得到的读段覆盖度在「该蛋白结合的位置」形成峰。

抗体是最大的变量。好的抗体要求高特异性、高亲和力,且经过 ChIP 级别验证(如 ENCODE 的抗体标准)。一个失败的抗体不会报错,只会给出「背景噪声」,且看起来像是「没有结合」——这是最危险的失败模式,因为阴性结果无法与「实验失败」区分。所以阳性对照(如 H3K4me3 或已知结合位点)必须每批都做。

对照设计有三种,用途不同:

  • Input(全基因组 DNA):未经抗体富集的片段化 DNA,反映「可测序性偏差」(GC 偏好、开放区易片段化)。这是最重要的对照,用于校正背景。
  • IgG 对照:用非特异抗体做的 IP,反映抗体的非特异结合。
  • 无抗体对照:反映实验操作的背景。
# 标准 ChIP-seq 比对(bowtie2 对短读,末端参数调优)
bowtie2 -x hg38_index -1 chip_R1.fq.gz -2 chip_R2.fq.gz \
  -p 32 --very-sensitive -X 1000 --no-mixed --no-discordant \
  | samtools sort -@ 8 -o chip.bam -
samtools index chip.bam
picard MarkDuplicates -I chip.bam -O chip.markdup.bam -M dup_metrics.txt

# 用 input 做背景校正与峰值检测
macs2 callpeak -t chip.markdup.bam -c input.markdup.bam \
  -f BAMPE -g hs -n chip_sample --outdir macs_out -q 0.05

-f BAMPE 是关键:对于双端 ChIP-seq,用 BAMPE 模式让 MACS2 直接用真实的片段长度(而非用交叉相关推断),显著提高峰位精度。-X 1000 允许更宽的插入片段,因为 ChIP 片段化后的 DNA 常比常规测序长。

交联与片段化的取舍

ChIP 实验里有两个容易被低估的操作变量:

交联时间。甲醛交联时间过短会漏掉弱结合或间接结合的位点,过长会过度固定、增加背景并让抗原表位被遮蔽导致抗体结合效率下降。经典方案是 10 分钟,但不同蛋白差异很大(组蛋白通常更短、转录因子视情况而定)。这个参数无法从数据反推,只能靠实验摸索并固定下来。

片段化方式。超声打断(sonication)给出较宽的片段分布(200-700 bp),适合常规 ChIP;MNase 酶切给出核小体级精度(CUT&RUN、CUT&Tag 路线),背景更低、细胞用量更少,但要求酶活控制精确。近年 CUT&RUN/CUT&Tag 因「低细胞数 + 低背景」迅速普及,分析流程与 ChIP-seq 基本兼容,但片段长度分布与背景模型不同,MACS2 参数需要相应调整(通常 --nomodel 配合手动 --extsize)。

3. ATAC-seq 原理、Tn5 与开放染色质

ATAC-seq(Assay for Transposase-Accessible Chromatin)用高活性突变型 Tn5 转座酶插入开放染色质区域并同时加上测序接头。开放区被切得多、闭合区被切得少,因此读段密度直接反映染色质开放性。它的优势是细胞用量极少(500-50000 个细胞)、流程快、不需要抗体。

ATAC-seq 特有的技术特征必须理解,否则会误判数据:

  • 片段长度分布呈周期性:Tn5 只能插入核小体之间的裸露 DNA,因此片段长度呈现「无核小体(< 100 bp)→ 单核小体(约 200 bp)→ 双核小体(约 400 bp)」的周期峰。这个周期是数据质量的强指标,看不到周期性说明实验失败。
  • 线粒体污染:线粒体基因组没有核小体结构,极易被 Tn5 切开,导致 20%-80% 的读段来自 chrM。必须过滤,且过滤率本身是质控指标(> 50% 通常说明细胞膜破损严重)。
  • Tn5 插入偏好:Tn5 有轻微的序列偏好,且倾向于在开放区产生 9 bp 的偏移(正负链各偏 4-5 bp),做足迹分析时必须校正。
# ATAC-seq 常用处理链(简化)
bowtie2 -x hg38_index -1 atac_R1.fq.gz -2 atac_R2.fq.gz -p 32 -X 2000 \
  | samtools sort -@ 8 -o atac.bam -
samtools index atac.bam

# 去除线粒体与黑名单区域,再做 Tn5 偏移校正
samtools view -h atac.bam | grep -v chrM | samtools view -b - > atac.noMT.bam
bedtools intersect -v -a atac.noMT.bam -b hg38_blacklist.bed > atac.clean.bam

# deepTools 画片段长度分布与 TSS 富集
bamPEFragmentSize -b atac.clean.bam -hist fragment_size.png \
  --samplesLabel ATAC --maxFragmentLength 1000
plotProfile -m tss_matrix.gz -out tss_profile.png --perGroup

黑名单区域(blacklist) 是 ENCODE 定义的高信号异常区(着丝粒、端粒、卫星序列),这些区域在任何实验里都「信号极高」,纯属比对伪影。不过滤黑名单会让峰值检测产生大量假阳性,是所有表观分析的标准步骤。

4. 质控:FRiP、TSS 富集与片段分布

表观数据的质控指标比常规测序更丰富,且每一个都能直接指向具体的实验问题:

指标含义合格阈值异常指向
FRiP落在峰内的读段比例> 1%(TF)/ > 5%(组蛋白)抗体差或信噪比低
TSS 富集分数TSS 附近读段富集倍数> 5(ATAC)/ > 2(组蛋白)实验失败或片段化过度
片段周期性ATAC 核小体周期有明显周期Tn5 反应或细胞质量差
线粒体比例chrM 读段占比< 20%(ATAC)细胞膜破损
重复率PCR 重复比例< 20%建库循环过多
NSC/RSC(交叉相关)链交叉相关NSC > 1.05信号弱或峰弥散
黑名单比例落在黑名单的读段< 0.5%比对或数据异常

FRiP(Fraction of Reads in Peaks)是最常用的「一句话质控」。它把「有多少信号落在有意义的位置」量化成一个数字。ENCODE 的经验阈值:转录因子 ChIP 的 FRiP 通常 1%-5%(因为 TF 结合位点占基因组比例极小),组蛋白修饰 ChIP 可达 5%-30%(修饰区域更宽),ATAC 通常 > 20%。若 FRiP 低于 1%,基本可以判定实验失败。

但 FRiP 有一个循环依赖问题:它需要先有峰才能计算,而峰的质量又依赖数据质量。因此实践中常用两个补充指标:一是交叉相关(cross-correlation),用正负链信号的偏移估计片段长度与信噪比(工具 phantompeakqualtools 的 NSC/RSC);二是TSS 富集,用 deepTools 的 computeMatrix + plotProfile 看 TSS 附近是否有富集(对 ATAC 与活跃修饰应有明显富集)。

一个容易忽略的点:质控必须在过滤黑名单与线粒体之后做。在原始 BAM 上算 FRiP,黑名单区域的高信号会虚高指标,掩盖真实问题。

把这些指标组织成一条可自动化的质控流水线,是规模化项目的刚需。一个务实的做法是:把 samtools flagstat、picard CollectMultipleMetrics、phantompeakqualtools、deepTools 的输出汇总成一张样本 × 指标的表,然后按阈值自动标记「不合格」样本。这样在几十上百个样本的项目里,你能一眼看出哪些样本需要重做,而不是逐个打开报告。这类批量化指标汇总与分析,用 Python 数据处理 的 pandas 是最高效的选择。

样本FRiPTSS 富集线粒体重复率判定
S10.328.112%8%通过
S20.052.245%31%不合格(信噪比低)
S30.287.48%6%通过

5. 峰值检测:MACS2 参数与窄峰宽峰

MACS2(Model-based Analysis of ChIP-Seq)是峰值检测的事实标准。它的核心思路是「用对照建模背景,找出显著超出背景的富集区域」:先用输入/对照估计局部背景(lambda),再用泊松分布检验每个位置的富集显著性,最后把相邻显著位点连成峰。

# 窄峰(转录因子、H3K4me3、ATAC)
macs2 callpeak -t chip.bam -c input.bam -f BAMPE -g hs \
  -n tf_sample --outdir out -q 0.05 --keep-dup all

# 宽峰(H3K27me3、H3K9me3 等弥散修饰)
macs2 callpeak -t chip.bam -c input.bam -f BAMPE -g hs \
  -n broad_sample --outdir out --broad --broad-cutoff 0.1

# 输出三个文件:_peaks.narrowPeak / _summits.bed / _peaks.xls

关键参数与含义:

参数作用建议
-f BAMPE双端模式,用真实片段长度双端数据必用
-g有效基因组大小hs(人类)/ mm(小鼠)/ 自定义
-qFDR 阈值0.05 常用,严格用 0.01
--broad宽峰模式弥散修饰(H3K27me3)必用
--nomodel不用交叉相关建模ATAC 常用(片段长度特殊)
--shift/-extsize手动设置偏移与延伸ATAC 做足迹分析时用
--keep-dup all保留重复读段高深度或单细胞数据

窄峰 vs 宽峰的判据是生物学而非技术:转录因子与 H3K4me3/H3K27ac 结合区域狭窄(几百 bp),用窄峰;H3K27me3、H3K9me3 等抑制性修饰覆盖整个基因区甚至几十 kb,用宽峰。用窄峰模式分析 H3K27me3 会把大片修饰区切成无数碎峰,完全失真。

ATAC 的特殊处理:ATAC 没有 input 对照(因为 Tn5 本身就是「背景」),所以直接不用 -c;同时因为 ATAC 的片段长度特殊,常用 --nomodel --shift -100 --extsize 200 或 --nomodel --shift 37 --extsize 73(做足迹时)来对齐 Tn5 的插入偏移。参数选错会让峰位整体偏移几十 bp,对足迹分析是致命的。

6. 可重复性评估:IDR 与重复样本

单个样本的峰不可信,生物学重复之间的一致性才是发表级证据。ENCODE 的标准做法是 IDR(Irreproducible Discovery Rate):

# 1. 对每个重复单独做 peak calling,且必须关掉过滤(保留全部峰)
macs2 callpeak -t rep1.bam -c input1.bam -f BAMPE -g hs \
  -n rep1 --outdir idr_out -p 1e-3 --keep-dup all
macs2 callpeak -t rep2.bam -c input2.bam -f BAMPE -g hs \
  -n rep2 --outdir idr_out -p 1e-3 --keep-dup all

# 2. 排序 + 合并 + IDR
sort -k8,8nr idr_out/rep1_peaks.narrowPeak > rep1.sorted.narrowPeak
sort -k8,8nr idr_out/rep2_peaks.narrowPeak > rep2.sorted.narrowPeak
idr --samples rep1.sorted.narrowPeak rep2.sorted.narrowPeak \
  --input-file-type narrowPeak --rank p.value --output-file idr.txt \
  --plot --log-output-file idr.log

# 3. 按 IDR < 0.05 过滤,得到高置信峰
awk '$5 >= 540' idr.txt | cut -f1-10 > final_peaks.bed

IDR 的核心思想:不是「取两个重复的交集」(这会丢掉真峰),而是「用统计模型估计『两个重复都检出的峰中有多少是假的』」。它按信号强度排序,学习「真实峰」与「噪声峰」的分布差异,给出每个峰的 IDR 值。IDR < 0.05 的峰被认为是可重复的高置信峰。

IDR 有三个前提,缺一不可:必须是两个重复(三个重复要用「伪重复」策略,两两做 IDR);peak calling 必须用宽松阈值(-p 1e-3 而非 -q 0.05,否则真峰在早期就被过滤掉,IDR 没有排序空间);peak calling 必须保留全部峰(--keep-dup all,且不要设 -q)。

一个常见替代是「简单重叠法」(两个重复峰的 intersection),它简单但会系统性丢失弱峰——弱峰往往才是最有意思的调控位点。若数据没有重复(如珍稀样本),退而求其次可以用「同一实验室的同类数据」做参照,但必须在论文里明确说明局限性。

7. Motif 富集与足迹分析

找到峰之后,下一个问题是「是什么因子结合在这里」。两条路:

Motif 富集分析:用已知的 motif 数据库(JASPAR、HOCOMOCO、ENCODE motifs)扫描峰序列,看哪些 motif 显著富集:

# HOMER:标准 motif 富集流程
findMotifsGenome.pl peaks.bed hg38 motif_out/ -size 200 -mask \
  -p 32 -preparsedDir homer_cache/

# MEME-ChIP:de novo motif 发现 + 已知 motif 富集
meme-chip -oc meme_out -db JASPAR2024_CORE_vertebrates_non-redundant.meme peaks.fa

判据是「富集倍数 + p 值 + 富集峰的百分比」三者的组合。一个 motif 富集 3 倍但只出现在 5% 的峰里,其生物学意义有限;富集 1.5 倍但出现在 60% 的峰里,反而更可能是主调控因子。ChIP-seq 的 motif 分析还有一个自证陷阱:如果做的是某个 TF 的 ChIP,它的 motif 必然富集(因为抗体拉下来的就是它的结合位点),这不是发现而是验证。真正有信息量的是「共富集的其他 motif」——那才是共调控因子的线索。

足迹分析(footprinting) 更精细:TF 结合会保护 DNA 不被 Tn5/DNase 切割,因此在 ATAC 信号里留下一个「凹陷」。检测这个凹陷可以推断「具体哪个 TF 结合在哪个位点」,甚至区分不同 TF:

# TOBIAS:ATAC 足迹分析的标准工具
TOBIAS ATACorrect --bam atac.clean.bam --genome hg38.fa \
  --peaks peaks.bed --outdir tobias_out --cores 32
TOBIAS FootprintScores --signal tobias_out/atac_corrected.bw \
  --regions peaks.bed --output footprints.bw --cores 32
TOBIAS BINDetect --motifs JASPAR.meme --signals footprints.bw \
  --genome hg38.fa --peaks peaks.bed --outdir bindetect_out

足迹分析的坑在于深度要求高:要可靠检出凹陷,每个位点通常需要数百到上千的覆盖度,普通 ATAC(50-100 M reads)只对最强的高置信位点有效。此外 Tn5 的插入偏移必须精确校正(--shift 参数),否则凹陷会被偏移掩盖。没有做偏移校正的足迹分析结果一律不可信。

一个更稳健的替代思路是用 motif 结合位点的「中心对齐信号」做定性判断:把含某 motif 的位点按 motif 中心对齐,看 ATAC 信号是否在中心出现凹陷。这比逐个位点判断可靠得多,也是 TOBIAS 的核心方法。若某个 motif 的足迹在所有位点上都模糊不清,说明该 TF 在此样本中结合弱或数据深度不足,不应强行解读。

需要强调的是,足迹分析推断的是「某类 motif 的占据状态」,不是「某个具体蛋白」。同一个 motif 可能被多个同家族 TF 结合,仅凭足迹无法区分。要确定具体因子,仍需 ChIP-seq 或 CUT&RUN 的直接证据。

8. 差异结合分析与基因组注释

「处理组与对照组在哪些区域的结合/开放性不同」是这类研究的核心问题。差异结合分析(differential binding / differential accessibility)的流程是:先得到两组的峰 → 合并成统一区间 → 统计每个区间在两组中的读段数 → 用 DESeq2/edgeR 做差异检验:

# 1. 合并两组峰为一个统一区间集
cat ctrl_peaks.bed treat_peaks.bed | sort -k1,1 -k2,2n \
  | bedtools merge -i - > union_peaks.bed

# 2. 统计每个区间在每个样本中的读段数
for bam in ctrl1.bam ctrl2.bam treat1.bam treat2.bam; do
  bedtools multicov -bams $bam -bed union_peaks.bed >> counts.txt
done

# 3. 用 DESeq2 做差异分析(R)
# dds <- DESeqDataSetFromMatrix(counts, colData, ~ condition)
# dds <- DESeq(dds); res <- results(dds, contrast = c("condition","treat","ctrl"))

关键取舍:用「合并区间」而非「各自峰」。因为峰的位置在两组间可能有几个 bp 的偏移,直接取交集会丢掉「位移」这一重要现象。合并区间 + 计数的方式能捕捉「同一区域结合强度变化」与「结合位移」两类变化。

注释与下游解读包括:把峰映射到最近的基因(ChIPseeker、annotatePeaks.pl)、做 GO/KEGG 富集、按基因组区域分类(启动子/增强子/内含子/基因间)。一个实践要点是区分「启动子峰」与「增强子峰」:前者通常紧邻 TSS(±1-2 kb),后者可能在几十到几百 kb 外,需要通过 Hi-C 或 eQTL 才能建立「增强子-基因」的对应关系。简单地「注释到最近基因」在增强子上经常出错——最近的基因未必是它调控的基因。

统计模型的选择

差异结合分析的统计模型需要匹配数据结构。三种常见情形:

情形数据形态推荐方法
两组多重复区间计数矩阵DESeq2 / edgeR(负二项)
两组单重复无重复无法做统计检验,只能描述性比较
连续变量剂量/时间序列limma + voom,或线性模型
单细胞 ATAC稀疏矩阵伪批量后 DESeq2(与 scRNA 同思路)

单重复不能做差异检验是硬约束——没有重复就无法估计组内变异,任何「p 值」都是伪造的。这是表观研究中最常被审稿人质疑的点之一。若确实无法获得重复(珍稀临床样本),应改用「效应量排序 + 独立数据验证」的定性策略,并在论文中明确声明不做统计推断。

9. Hi-C 与三维基因组概览

Hi-C 测量「染色质在三维空间中哪些区域彼此靠近」,输出一个「基因组位置 × 基因组位置」的接触频率矩阵。它的分析范式与前八节完全不同:

归一化是第一步也是最关键的一步。原始接触矩阵受多种偏差影响(GC 含量、比对性、酶切位点密度、片段长度),必须用 ICE/Knight-Ruiz(cooler/cooltools 的 balance)或 HiCNorm 做校正,否则「A 与 B 接触多」可能只是「A 区域酶切位点多」。

结构特征识别:TAD(拓扑关联结构域,cooltools 的 insulation)、染色质环(HiCCUPS)、A/B 区室(cooltools 的 eigs_cis)。这些结构把「哪些调控元件与哪些基因在同一拓扑域内」这个问题变得可回答。

# cooler + cooltools 的典型流程
cooler cload pairs -c1 2 -p1 3 -c2 4 -p2 5 hg38.chrom.sizes:1000 pairs.txt out.cool
cooler balance out.cool                    # ICE 归一化
cooltools insulation out.cool -o insul.tsv --window 100kb   # 找 TAD 边界

一个与表观分析的连接点是:Hi-C 提供的「调控域」约束,能让增强子-基因的对应关系从「猜测」变成「推断」。ATAC 找到的开放区若与某基因处于同一 TAD 且存在接触信号,则该调控关系的可信度大幅提升。把表观数据与 RNA-seq 转录组分析 的表达数据联合,是验证「调控元件确实影响表达」的最直接手段。

Hi-C 的成本与门槛比 ChIP/ATAC 高一个量级(需要大量细胞、专门的建库与深度测序),因此常见做法是「在关键样本上做 Hi-C 建立调控域图谱,在其他样本上只做 ATAC」,用 TAD 边界作为通用约束。Micro-C 与 Hi-C 的区别在于分辨率(Micro-C 用 MNase 消化,可达核小体级),但对绝大多数调控分析,Hi-C 的 5-10 kb 分辨率已足够。

权衡取舍

决策点方案 A方案 B建议
开放性测定ATAC-seqDNase-seq用 ATAC,细胞用量少、流程快
对照InputIgG用 Input 校正背景,IgG 仅作补充
峰模式窄峰宽峰TF/活跃修饰窄峰,抑制修饰宽峰
重复评估简单交集IDR发表级必须 IDR
Motif 工具HOMER(快)MEME-ChIP(全)常规用 HOMER,de novo 用 MEME
足迹分析只看峰TOBIAS 足迹深度足够才做,需校正 Tn5 偏移
差异结合各自峰取交合并区间 + 计数用合并区间,能捕捉位移
注释策略最近基因TAD 内 + 接触增强子必须用三维信息约束

常见坑清单

  1. 不做黑名单过滤:着丝粒等区域产生大量假峰;必须 bedtools intersect -v 剔除。
  2. ATAC 忘去线粒体:chrM 读段占 50% 以上,严重浪费并扭曲质控;先过滤再分析。
  3. peak calling 用 -q 0.05 后做 IDR:真峰已被过滤,IDR 失去排序空间;IDR 前用 -p 1e-3。
  4. H3K27me3 用窄峰模式:弥散修饰被切成碎峰;宽峰必须加 --broad。
  5. ATAC 忘做 Tn5 偏移校正:足迹与峰位整体偏移 4-5 bp;用 --shift 或 TOBIAS 校正。
  6. 只看 FRiP 不看 TSS 富集:FRiP 有循环依赖,可能虚高;两者一起看。
  7. 单样本直接下结论:无重复的结果不可复现;至少 2 个生物学重复 + IDR。
  8. 抗体未做阳性对照:阴性结果无法区分「真无结合」与「实验失败」;每批带阳性对照。
  9. 把增强子注释到最近基因:调控关系可能跨越数百 kb;用 Hi-C 或 eQTL 约束。
  10. 质控指标在黑名单过滤前计算:指标虚高掩盖问题;统一在清洗后的 BAM 上算。

小结

表观基因组分析的核心是「从连续覆盖度信号中识别有意义的区域」。ChIP-seq 与 ATAC-seq 的实验原理不同(抗体富集 vs Tn5 可及性),但分析框架高度相似:比对 → 过滤(黑名单、线粒体)→ 质控(FRiP、TSS 富集)→ 峰值检测(MACS2 窄峰/宽峰)→ 可重复性(IDR)→ 注释与 motif → 差异结合。

工程上最该建立的两个认知:第一,质控先于分析。表观数据的质量差异极大,一个失败的实验无法用参数调优挽救,先用 FRiP 与 TSS 富集筛掉坏数据,比在下游反复调参有效得多。第二,可重复性是判据而非修饰。IDR 不是为了「好看」,而是回答「这些峰是真的吗」这个根本问题的唯一统计手段。

下一步可以看 RNA-seq 转录组分析了解如何把表观数据与表达数据联合验证调控关系,或深入比对算法理解比对参数对信号质量的影响。如果你的 FRiP 很低,先别急着调 MACS2 参数——问题几乎总在实验端(抗体、细胞数、交联),回到第 2 节重新审视实验设计。

常见问题

Q:ATAC-seq 能替代 ChIP-seq 吗?
不能完全替代。ATAC 测的是「开放性」,反映所有结合因子的综合结果;ChIP 测的是「某个特定蛋白」的位置。ATAC 的优势是无需抗体、单次实验即可推断多种因子(通过足迹),但它无法直接告诉你「是哪个蛋白」,也无法检测不改变可及性的结合事件。两者互补。

Q:为什么我的 ATAC 数据没有核小体周期?
通常是三个原因之一:Tn5 反应时间过长(过度切割,只剩小片段)、细胞质量差(核小体结构已破坏)、或建库时片段选择窗口设置不当。检查片段长度分布图,若集中在 100 bp 以下且无 200/400 bp 峰,基本可判定实验失败。这类问题要回到建库环节定位,而非在下游参数上打转。

继续阅读

探索更多技术文章

浏览归档,发现更多关于系统设计、工具链和工程实践的内容。

全部文章 返回首页

「生物信息」更多文章

  1. 多组学整合与批次效应
  2. 蛋白质组学与质谱分析
  3. 变异注释与临床解读