蛋白质组学与质谱分析

系统讲解蛋白质组学与质谱分析:从 LC-MS/MS 原理与 mzML 数据格式、数据库搜索与谱库搜索的肽段鉴定、靶诱饵策略的 FDR 控制、label-free 与 TMT 及 DIA 定量策略、蛋白质推断与缺失值处理,到磷酸化等翻译后修饰分析与差异表达统计,给出可复用的命令与阈值。

引言

蛋白质组学(proteomics)研究的是「一个样本里有哪些蛋白质、各有多少」。它比转录组更接近「表型」——mRNA 丰度与蛋白丰度之间的相关性通常只有 0.4-0.6,因为存在翻译效率、蛋白降解、翻译后调控等多层调节。因此「想知道细胞到底在干什么」,蛋白质组是比转录组更直接的回答。

主流技术路线是液相色谱串联质谱(LC-MS/MS)。它的数据形态与测序完全不同:测序产出的是「读段序列」,而质谱产出的是**「质荷比(m/z)与强度的谱图」**——一维的峰列表,需要用计算方法反推「这是什么肽段」。这个「反推」过程(肽段鉴定)是整条链路的难点所在:它不是直接的序列读出,而是「用理论谱图与实验谱图匹配」的统计推断问题。

工程上的难点有三。第一,搜索空间爆炸:一个肽段的可能序列数量随长度指数增长,必须用「酶切规则 + 母离子质量容差」把搜索空间压到可计算范围,但放宽容差(如允许更多漏切或更多修饰)会让搜索空间再次爆炸,同时抬高假阳性。第二,FDR 控制是核心工程问题:质谱鉴定的「匹配分数」没有绝对阈值,必须用靶-诱饵(target-decoy)策略估计假发现率,且这个估计本身有偏。第三,定量比鉴定更难:蛋白丰度的准确定量受「肽段电离效率差异」「缺失值」「批次效应」三重干扰,同一肽段在不同样本中的信号强度差异可能主要来自技术噪声。

本文按「原理 → 数据格式 → 肽段鉴定 → FDR → 定量 → 蛋白推断 → 修饰 → 差异分析 → 组学衔接」的顺序展开。命令基于 MaxQuant 2.4、MSFragger/FragPipe 20、DIA-NN 1.8 与 limma。读完你应该能独立完成一条蛋白质组分析流程,并判断定量结果是否可信。

目录

  1. 质谱蛋白质组学的数据生成原理
  2. 数据格式:原始文件、mzML 与谱图
  3. 肽段鉴定:数据库搜索与谱库搜索
  4. FDR 控制:靶诱饵策略与 q 值
  5. 定量策略:label-free、TMT 与 DIA
  6. 蛋白质推断与缺失值处理
  7. 翻译后修饰分析:以磷酸化为例
  8. 差异表达分析与统计
  9. 与转录组等其他组学的衔接

1. 质谱蛋白质组学的数据生成原理

典型的「自下而上」(bottom-up / shotgun)流程是:蛋白质被酶(通常胰蛋白酶)切成肽段 → 液相色谱分离 → 电喷雾电离 → 质谱分析。质谱分析分两级:

  • MS1(一级谱):测量所有进入的肽段离子的 m/z 与强度,给出「母离子」信息;
  • MS2(二级谱):挑出强度最高的若干母离子(通常 Top 10-20),碎裂后测量碎片离子的 m/z,给出「肽段序列」信息。

碎裂方式决定了信息量。HCD(高能碰撞解离)产生丰富的 b/y 离子系列,是当前主流;ETD 对磷酸化等修饰更友好(保留修饰基团);CID 较老但仍广泛使用。理解碎裂模式对解读 MS2 谱图至关重要——搜索算法本质上是在「预测给定序列的碎裂谱图」,碎裂模型错了,匹配就错了。

数据采集模式决定了下游分析范式:

模式采集方式特点适用
DDA(数据依赖)按强度挑母离子做 MS2谱图质量高,但随机性强、重复性差蛋白质鉴定、深度覆盖
DIA(数据非依赖)按窗口系统碎裂全部母离子重复性好、缺失值少,但谱图混合大队列定量
PRM/MRM(靶向)只针对预设肽段灵敏度最高、可绝对定量验证特定蛋白
TMT/iTRAQ标记后混合,MS2 定量通量高、批次效应小多样本相对定量

一个关键概念是动态范围:血浆蛋白的丰度跨越 10 个数量级(白蛋白 vs 细胞因子),而质谱的单一实验动态范围约 4-5 个数量级。这就是为什么「深度蛋白质组」需要「去除高丰度蛋白 + 分级分离」——不是灵敏度不够,而是动态范围不够。

2. 数据格式:原始文件、mzML 与谱图

质谱数据格式的碎片化比测序更严重:每个仪器厂商有专有格式(Thermo 的 .raw、Sciex 的 .wiff、Bruker 的 .d),必须通过转换工具统一。

# 转成开放的 mzML 格式(推荐 mzML 1.1,含索引便于随机访问)
msconvert sample.raw --mzML --zlib --filter "peakPicking vendor msLevel=1-2" \
  -o mzml_out/

# 转成搜索工具常用的 MGF(只含 MS2 谱图,无 MS1 信息)
msconvert sample.raw --mgf -o mgf_out/

msconvert(ProteoWizard)是格式转换的事实标准。两个关键参数:peakPicking 把轮廓数据(profile)转成峰列表(centroid),几乎所有搜索工具都要求 centroid 数据;zlib 开启压缩(mzML 未压缩时文件极大,可达原始 .raw 的 2-3 倍)。注意「在哪个层级做 peakPicking」会影响结果——对 MS1 与 MS2 都做是常规,但某些定量方法需要保留 MS1 的轮廓数据。

mzML 的结构值得理解,因为它决定了能做什么分析:

mzML 文件
  ├─ run
  │   ├─ spectrumList        ← 每张谱图(MS1 与 MS2 混合存放)
  │   │   ├─ spectrum (MS1):m/z 数组 + 强度数组
  │   │   └─ spectrum (MS2):母离子 m/z、电荷、保留时间、碎片谱
  │   └─ chromatogramList    ← 色谱图(TIC、XIC)
  └─ indexList               ← 偏移索引(支持随机访问)

一个实践要点:保留时间(retention time)是重要的质量维度,但不同仪器、不同梯度的保留时间不可直接比较。跨样本比较时需要用「保留时间对齐」工具(如 OpenMS 的 MapAligner),或改用基于谱库的保留时间预测(DIA 分析的常规做法)。

3. 肽段鉴定:数据库搜索与谱库搜索

肽段鉴定有两条技术路线,用途不同:

数据库搜索(database search):给定蛋白质序列数据库(如 UniProt),用酶切规则枚举所有理论肽段,对每个实验谱图找最佳匹配。这是最常用的方法,也是发现新肽段的唯一途径:

# FragPipe(MSFragger)的标准流程,配置文件驱动
fragpipe --headless --config fragpipe.workflow \
  --manifest manifest.fp-manifest --workdir fp_out --threads 32

# 传统路线:Comet + Percolator(搜索引擎 + 机器学习后处理)
comet -P params.comet -D db.fasta sample.mgf
percolator -X percolator_input.txt -o percolator_out.txt \
  --decoy-pattern "rev_" --protein-enzyme trypsin

谱库搜索(spectral library search):用「已知的谱图-肽段对应关系」库直接匹配实验谱图。速度极快、灵敏度高、FDR 易控制,但只能鉴定库里已有的肽段,无法发现新肽段或新修饰:

# DIA-NN:谱库搜索 + 定量一体(也可用 in silico 预测库)
diann --f sample.mzML --lib library.tsv --out report.tsv \
  --threads 32 --qvalue 0.01 --matrix-qvalue 0.01 \
  --out-lib diann_speclib.tsv --gen-spec-lib

搜索参数的设置是最大的技术门槛。关键参数与含义:

参数典型值影响
母离子容差10-20 ppm(高分辨)/ 1.5 Da(低分辨)过宽引入假匹配,过窄漏掉真肽段
碎片离子容差0.02 Da(高分辨 HCD)/ 0.5 Da同上
酶切规则胰蛋白酶,允许 2 个漏切漏切数增加会放大搜索空间
固定修饰半胱氨酸氨甲酰甲基化(+57.021)建库时烷基化引入,必须设
可变修饰甲硫氨酸氧化(+15.995)常见 artifact,必须设
母离子电荷2-4排除单电荷(多为噪声)
前体质量容差单位ppm 或 Da高分辨仪器用 ppm

**「可变修饰越多,假阳性越高」**是一条铁律:每增加一个可变修饰,搜索空间大约翻倍(因为每个位点都要考虑「有/无修饰」两种状态)。开放搜索(open search,不预设修饰质量)能发现未知修饰,但会显著降低灵敏度,必须配合更严格的 FDR 策略(如 MSFragger 的 mass calibration + 二次搜索)。

4. FDR 控制:靶诱饵策略与 q 值

质谱鉴定没有「绝对正确」的分数阈值,因此必须用统计方法控制假发现率。标准做法是靶-诱饵策略(target-decoy):把「真实序列库」(靶)与「打乱的假序列库」(诱饵)合并搜索,任何匹配到诱饵的谱图都被认定为假阳性。

靶-诱饵策略的逻辑
  实验谱图 → 同时搜靶库与诱饵库
    · 匹配到靶库且分数高 → 真阳性
    · 匹配到诱饵库(分数任意)→ 假阳性(假序列不该匹配到任何谱图)
    · 匹配到靶库但分数低 → 可能是假阳性(与诱饵同分布)

  估计 FDR = 诱饵匹配数 / 靶匹配数
  (诱饵数需乘以因子校正:库大小比、诱饵是否为反转序列等)

诱饵库的构建方式影响 FDR 估计的准确性:反转序列(reverse) 比 打乱序列(shuffle) 更常用,因为反转保留了氨基酸组成(从而保留理化性质),使诱饵与靶的「假阳性分布」更接近。但反转会产生「与靶序列重叠」的问题,因此一些工具改用「伪反转」(pseudo-reverse,只反转两端)。

FDR 的两个层级必须分清:

  • PSM 层级 FDR:控制「谱图匹配」的错误率,是搜索工具的默认输出;
  • 蛋白层级 FDR:控制「最终报告的蛋白列表」的错误率,通常更严格(如 1%)。

肽段层级与蛋白层级的 FDR 不能互相推导。一个蛋白由多条肽段支持,若只控制 PSM FDR,蛋白列表的错误率会远高于 1%。工具如 Percolator 与 MaxQuant 会分别计算并报告各层级的 FDR,报告里必须写明用的是哪个层级。

# Percolator:用机器学习重新打分并给 q 值
percolator -X search_results.txt --decoy-pattern "rev_" \
  -F 0.01 --protein -Y -r percolator_out -m percolator_models
# -F 0.01:FDR 阈值 1%;--protein:输出蛋白层级结果

q 值(q-value) 是与 p 值对应的多重检验校正量:把所有 PSM 按分数降序排列,q 值表示「以该分数为阈值时,列表整体的 FDR」。用 q 值过滤比用「固定分数阈值」过滤更稳健,因为分数阈值在不同数据集间不可比(仪器、梯度、样本复杂度都会影响分数分布)。

一个常见的错误是「先按分数过滤再做 FDR 校正」——这会让 FDR 估计失效,因为诱饵匹配数在过滤后已经变了。正确顺序是「全部 PSM 一起算 q 值,再按 q 值过滤」。

5. 定量策略:label-free、TMT 与 DIA

鉴定的「有/无」只是起点,定量才是大多数研究的真正目标。三种主流策略的取舍:

Label-free(LFQ,非标记定量):直接比较不同样本中同一肽段的 MS1 信号强度。优点是简单、成本低、无标记数量限制;缺点是样本间的「上样量差异」与「仪器状态漂移」会引入偏差,需要归一化,且缺失值多。

# MaxQuant 的 LFQ 模式(关键参数)
#   LFQ mode: 开启,用 MaxLFQ 算法做跨样本归一化
#   Match between runs: 开启,用保留时间对齐「借」其他样本的鉴定
#   Min ratio count: 2,至少 2 条肽段才定量蛋白

Match between runs(MBR)是 LFQ 的关键增强:它把「某个肽段在样本 A 中鉴定到、在样本 B 中未鉴定但 MS1 有对应信号」的情况补全,大幅减少缺失值。但 MBR 也有风险——保留时间对齐错误会产生「假匹配」,因此通常要求「对齐窗口严格(< 0.5 min)+ 至少两个样本中有鉴定」。

TMT/iTRAQ(等重标记定量):用不同同位素的标签标记不同样本的肽段,混合后一起测序。优点是一次实验可定量 6-18 个样本(TMTpro 18 重),批次效应极小(同一次 MS 运行);缺点是比率压缩(ratio compression)——共分离的其他肽段会污染 MS2 谱图,导致真实差异被压缩,且单次样本数受限。

比率压缩的缓解手段有两个:一是用 SPS-MS3 采集(在 MS3 层级定量,避开共分离干扰),代价是扫描周期变长、鉴定数下降;二是在数据处理阶段做压缩校正(如 Proteome Discoverer 的 TMT 校正、或 R 包的 MSstatsTMT)。判断压缩是否严重,可以看「已知的内参蛋白(spike-in)的实测比值与理论比值差多少」——若理论 10 倍实测只有 3 倍,压缩就相当严重。

TMT 的另一个工程约束是**「一个批次内的所有样本必须同批处理」。18 重的 TMT 一次最多 18 个样本,超过就必须分批,而批次之间必然有差异**(标记效率、混合比例、仪器状态)。因此 TMT 实验的设计原则是「把感兴趣的组间比较放在同一批次内」,批次间只做「桥接样本」的校正。若处理组与对照组被拆到不同批次,结论基本不可靠。

DIA(数据非依赖采集):把 m/z 范围切成窗口,系统地对每个窗口内所有母离子做碎裂。优点是重复性极好、缺失值少、样本通量高,特别适合大队列;缺点是对复杂样本的谱图混合严重,依赖谱库质量。DIA 已成为大队列蛋白质组的首选:

# DIA-NN 典型参数(大队列)
diann --f *.mzML --lib library.tsv --out report.tsv \
  --threads 32 --qvalue 0.01 --matrix-qvalue 0.01 \
  --rt-profiling --mass-acc 10 --mass-acc-ms1 15 \
  --xic 1 --use-quant --smart-profiling

定量策略的选择逻辑:样本数 < 10 且需要深度鉴定用 DDA + LFQ;样本数 6-18 且需要极小批次效应用 TMT;样本数 > 20 的大队列用 DIA。三种策略的定量结果不可直接比较(归一化方式、缺失值模式、动态范围都不同),跨研究整合时必须重新处理原始数据。

6. 蛋白质推断与缺失值处理

蛋白质推断(protein inference) 是蛋白质组特有的难题:质谱测的是肽段,而「肽段 → 蛋白」的映射是多对多的。一条肽段可能属于多个同源蛋白(共享肽段,shared peptide),因此「鉴定到某条肽段」不等于「确定某个蛋白存在」。

处理策略分三种:

  • 只保留唯一肽段(unique peptide):保守但会丢失信息(同源蛋白家族无法区分);
  • 共享肽段分配到所有可能的蛋白(MaxQuant 默认,称「蛋白组」protein group);
  • 用简约原则(parsimony) 找「能解释所有肽段的最小蛋白集」(ProteinProphet、Percolator 的做法)。

报告里必须说明用的是哪种策略,因为这直接决定「能报告多少个蛋白」——简约原则给出的蛋白数最少,共享肽段分配到所有蛋白会给出最多的「候选」。

缺失值(missing value) 是另一个核心问题。蛋白质组数据的缺失有三类成因,处理方式完全不同:

缺失类型成因处理
MNAR(非随机缺失)丰度低于检测限不能用均值填补;用下限填补或专门模型
MAR(随机缺失)随机技术波动可用 kNN / 随机森林填补
完全缺失蛋白真的不存在不填补,如实记录

「低丰度蛋白缺失」是最常见的 MNAR:一个蛋白在对照组检不到、在处理组检出,这本身就是「上调」的信号。若用均值填补这些缺失,会把信号抹平;若用 0 填补,会人为夸大差异。正确做法是用「下限填补」(如用该样本最小值的 1/5)并选择能处理 MNAR 的统计方法(如 MSstats、limma 的 impute 策略,或 Perseus 的「从正态分布左移分布填补」)。

缺失值处理的经验判据
  缺失比例 < 5%  → 影响小,可填补或直接删除该蛋白
  缺失比例 5-30% → 需谨慎,按 MNAR/MAR 分类处理
  缺失比例 > 30% → 该蛋白的定量不可靠,建议不纳入差异分析

MaxQuant 的输出文件 proteinGroups.txt 里有几列必须理解,否则容易误用:

列名含义使用注意
Reverse是否为诱饵蛋白必须过滤掉 +
Potential contaminant是否为污染蛋白(角蛋白、胰蛋白酶等)必须过滤掉 +
Only identified by site只有修饰位点肽段支持通常过滤(可能是假阳性)
Unique peptides唯一肽段数定量可信度判据,建议 ≥ 2
LFQ intensityLFQ 归一化强度用于定量,0 表示缺失
iBAQ强度归一化到理论肽段数用于「蛋白绝对丰度」的近似比较

「先过滤三类标记再分析」是硬性要求:不过滤诱饵与污染蛋白,会让下游的差异分析混入假阳性与角蛋白(实验室常见污染);不过滤 Only identified by site 会让「只有一条修饰肽段支持」的蛋白进入结果,这类蛋白的定量极不可靠。

7. 翻译后修饰分析:以磷酸化为例

翻译后修饰(PTM)分析是蛋白质组学的高价值方向,也是最难的部分。以磷酸化(phosphorylation)为例,流程包含三个特殊环节:

富集(enrichment)。磷酸化肽段在总肽段中占比通常低于 1%,不富集根本测不到。方法有 TiO2、IMAC(Fe-IMAC 最常用)、抗体富集(针对特定基序如 pY)。富集效率直接决定能鉴定多少磷酸化位点:

# MaxQuant 的磷酸化搜索参数(关键设置)
#   Variable modifications: Phospho (STY)
#   Max. variable modifications: 3-5(磷酸化常有多重修饰)
#   Localization probability: 用 PTM 打分算法评估位点定位可信度

位点定位(localization)。这是磷酸化分析的核心难点:一条肽段上有多个 S/T/Y,「哪个位点被磷酸化了」需要从碎片谱图中推断。MaxQuant 的 PTM score 与 ptmRS 等算法给出「定位概率」,通常要求定位概率 > 0.75(甚至 0.9)才认为位点可靠。定位概率低的位点不应报告为「某位点被磷酸化」。

位点层级定量。磷酸化蛋白组要区分「蛋白丰度变化」与「磷酸化比例变化」:一个磷酸化位点信号升高,可能只是因为该蛋白总量升高了。正确做法是用总蛋白组数据归一化磷酸化数据,得到「磷酸化比例」的变化。这一步常被忽略,导致大量「假阳性磷酸化变化」。

# 用 limma 做磷酸化数据的差异分析(R,示意)
#   design 包含「处理」与「批次」
#   contrasts 比较处理组 vs 对照组
library(limma)
fit <- lmFit(ptm_matrix, design)
fit <- eBayes(fit)
topTable(fit, coef = "Treatment", number = Inf, adjust.method = "BH")

修饰分析的一般原则:修饰肽段的数据是「子集」,其 FDR 与定位精度都需要单独评估,不能沿用总蛋白组的阈值。多修饰(一条肽段上多个磷酸化)会进一步放大搜索空间,通常需要限制「每条肽段最多 N 个修饰」来控制假阳性。

8. 差异表达分析与统计

差异表达分析的目标是找「处理组与对照组之间显著变化的蛋白」。统计方法与转录组高度相似(都是「小样本、高维度、多重检验」),但有三点蛋白质组特有的差异:

第一,样本量通常更小。质谱实验成本高,n=3 是常态。小样本下,基于正态假设的 t 检验功效低,必须用「方差收缩」方法(limma 的 eBayes 把方差向全局均值收缩,显著提升小样本功效)。这是 limma 成为蛋白质组差异分析事实标准的原因。

第二,需要处理缺失值。如第 6 节所述,缺失模式会影响统计。用 MSstats(专门为蛋白质组设计的工具)或 limma + 显式填补是常见做法。

第三,归一化方式影响结论。常用方法:中位数归一化(假设「大多数蛋白不变」)、分位数归一化(强制分布相同)、以及基于内参蛋白(spike-in)的归一化。「大多数蛋白不变」这个假设在某些实验中不成立(如全局转录抑制、药物导致大规模蛋白降解),此时中位数归一化会把真实信号抹平——这与 RNA-seq 的归一化陷阱完全相同,可参考 RNA-seq 转录组分析 里的讨论。

差异分析的报告要求
  1. 效应量(log2 fold change)+ 置信区间,而非只有 p 值
  2. 校正后的 q 值(Benjamini-Hochberg),而非原始 p 值
  3. 定量所用的肽段数(min 2 条,最好 3 条以上)
  4. 缺失值处理方式与填补策略
  5. 归一化方法
  6. 统计模型(含纳入的协变量,如批次)

一个务实建议是用火山图 + 效应量阈值双重筛选:p 值显著但 fold change 很小(如 1.2 倍)的变化,生物学意义通常有限;fold change 大但 p 值不显著的,可能是样本量不足。两者结合才能得到可靠的结果。

9. 与转录组等其他组学的衔接

蛋白质组与转录组的联合分析是常见需求(「mRNA 升高了,蛋白也升高了吗」),但直接比较会踩坑:

第一,量纲不同。转录组是「读段计数」(整数、负二项分布),蛋白质组是「谱图强度」(连续、对数正态)。必须各自做差异分析,再比较「变化方向与幅度」的一致性,不能把两者的原始值放在一起算相关。

第二,相关性天然不高。mRNA 与蛋白的相关系数通常在 0.4-0.6,这是生物学事实(翻译效率、蛋白半衰期、降解调控),不是数据质量问题。「相关性低」不应被当作「实验失败」,反而常常是发现「翻译后调控」的线索。

第三,时间尺度不同。mRNA 响应快(分钟级)、蛋白响应慢(小时级),做时间序列实验时采样时间点必须匹配两者的动力学。

一个实用的分析框架是把蛋白分成四类:mRNA 与蛋白同向变化(转录调控为主)、mRNA 变而蛋白不变(翻译或降解调控)、蛋白变而 mRNA 不变(翻译后调控)、都不变。这个分类比「算一个相关系数」提供的信息多得多,也是多组学整合研究的核心思路之一。

若需要蛋白质结构信息来解释功能影响,可结合 蛋白质结构预测与 AlphaFold 应用 分析变异或修饰位点是否落在关键区域。

权衡取舍

决策点方案 A方案 B建议
采集模式DDA(深度鉴定)DIA(大队列定量)探索用 DDA,队列定量用 DIA
鉴定方法数据库搜索(发现新)谱库搜索(快、灵敏)先用库搜提高覆盖,再库搜补充
定量策略Label-freeTMT / DIA小样本 LFQ,中等样本 TMT,大队列 DIA
诱饵库反转序列打乱序列用反转(保留组成),注意重叠问题
FDR 层级PSM 层级蛋白层级报告蛋白时用蛋白层级 FDR
缺失值均值/kNN 填补下限填补低丰度缺失用下限,避免抹平信号
磷酸化定量只看磷酸化信号用总蛋白归一化必须归一化,否则混淆丰度与比例
差异分析t 检验limma + 方差收缩小样本必须用 limma

常见坑清单

  1. 忘设固定修饰(氨甲酰甲基化):所有半胱氨酸肽段匹配失败,鉴定数骤降;建库用烷基化就必须设。
  2. 可变修饰加太多:搜索空间爆炸、假阳性飙升;只加必要的(氧化、乙酰化等)。
  3. 母离子容差设错单位:ppm 与 Da 混用导致全库无匹配;按仪器分辨率选单位。
  4. 先按分数过滤再算 FDR:诱饵计数失真,FDR 估计无效;必须全部 PSM 一起算 q 值。
  5. 混用 PSM 与蛋白层级 FDR:蛋白列表错误率被低估;报告蛋白用蛋白层级 FDR。
  6. 用均值填补低丰度缺失:真实的上调信号被抹平;MNAR 缺失必须用下限填补。
  7. 磷酸化不做总蛋白归一化:蛋白丰度变化被误读为磷酸化比例变化;必须用总蛋白校正。
  8. 忽略定位概率:多位点肽段报告了错误位点;只报告定位概率 > 0.75 的位点。
  9. 样本量太小却用普通 t 检验:功效不足;用 limma 的方差收缩。
  10. 跨研究直接合并定量值:归一化方式不同导致系统性偏差;应回到原始数据重新处理。

小结

蛋白质组学的核心特殊性在于「测的是肽段,推的是蛋白」。从谱图到肽段的鉴定是统计推断(依赖搜索参数与 FDR 控制),从肽段到蛋白的映射是多对多推断(依赖简约原则或共享肽段策略),从信号到丰度的转换受电离效率与缺失值干扰——这三层不确定性叠加,使蛋白质组结果的可信度评估比转录组更复杂。

工程上最该建立的三个认知:第一,FDR 是分层的。PSM、肽段、蛋白三个层级的 FDR 各自独立,报告时必须明确用的是哪一层,且不能互相推导。第二,缺失值不是噪声而是信息。「对照组没有、处理组有」本身就是信号,用均值填补会把它抹掉。第三,定量策略决定分析范式。LFQ、TMT、DIA 的数据特性差异极大(缺失模式、动态范围、批次结构),分析流程必须与采集策略配套,不能通用一套参数。

下一步可以看多组学整合篇了解如何把蛋白质组与转录组、代谢组联合分析,或 蛋白质结构预测与 AlphaFold 应用 了解如何用结构信息解释修饰与变异的功能影响。如果你的鉴定数远低于预期,先检查固定修饰与容差设置;如果定量结果「几乎什么都没变」,先确认是否误用了「大多数蛋白不变」的归一化假设。

常见问题

Q:为什么我的蛋白质组数据和转录组数据对不上?
mRNA 与蛋白的相关系数在 0.4-0.6 是正常范围,不是错误。真正的分析应该关注「哪些蛋白的变化不能用 mRNA 解释」——那才是翻译调控、降解调控的证据。参见 RNA-seq 转录组分析 了解转录组侧的处理。

Q:LFQ 和 TMT 的定量结果能合并吗?
不能直接合并。两者的归一化方式、动态范围、缺失模式完全不同,直接合并会引入系统性偏差。若必须整合,应把两者视为独立数据集,用批次校正方法处理后比较「变化方向的一致性」,而非合并原始强度值。

Q:为什么磷酸化数据里的「变化」大多是假的?
最常见的原因是没做总蛋白归一化。一个磷酸化位点信号升高 2 倍,如果对应的总蛋白也升高了 2 倍,那么磷酸化「比例」其实没变。必须用同批样本的总蛋白组数据(或至少该蛋白的蛋白丰度)做归一化,才能得到真正的磷酸化调控变化。其次是位点定位不可靠——定位概率低的位点本身就是噪声,不应纳入差异分析。

继续阅读

探索更多技术文章

浏览归档,发现更多关于系统设计、工具链和工程实践的内容。

全部文章 返回首页

「生物信息」更多文章

  1. 多组学整合与批次效应
  2. 变异注释与临床解读
  3. 表观基因组与染色质分析