引言
蛋白质组学(proteomics)研究的是「一个样本里有哪些蛋白质、各有多少」。它比转录组更接近「表型」——mRNA 丰度与蛋白丰度之间的相关性通常只有 0.4-0.6,因为存在翻译效率、蛋白降解、翻译后调控等多层调节。因此「想知道细胞到底在干什么」,蛋白质组是比转录组更直接的回答。
主流技术路线是液相色谱串联质谱(LC-MS/MS)。它的数据形态与测序完全不同:测序产出的是「读段序列」,而质谱产出的是**「质荷比(m/z)与强度的谱图」**——一维的峰列表,需要用计算方法反推「这是什么肽段」。这个「反推」过程(肽段鉴定)是整条链路的难点所在:它不是直接的序列读出,而是「用理论谱图与实验谱图匹配」的统计推断问题。
工程上的难点有三。第一,搜索空间爆炸:一个肽段的可能序列数量随长度指数增长,必须用「酶切规则 + 母离子质量容差」把搜索空间压到可计算范围,但放宽容差(如允许更多漏切或更多修饰)会让搜索空间再次爆炸,同时抬高假阳性。第二,FDR 控制是核心工程问题:质谱鉴定的「匹配分数」没有绝对阈值,必须用靶-诱饵(target-decoy)策略估计假发现率,且这个估计本身有偏。第三,定量比鉴定更难:蛋白丰度的准确定量受「肽段电离效率差异」「缺失值」「批次效应」三重干扰,同一肽段在不同样本中的信号强度差异可能主要来自技术噪声。
本文按「原理 → 数据格式 → 肽段鉴定 → FDR → 定量 → 蛋白推断 → 修饰 → 差异分析 → 组学衔接」的顺序展开。命令基于 MaxQuant 2.4、MSFragger/FragPipe 20、DIA-NN 1.8 与 limma。读完你应该能独立完成一条蛋白质组分析流程,并判断定量结果是否可信。
目录
- 质谱蛋白质组学的数据生成原理
- 数据格式:原始文件、mzML 与谱图
- 肽段鉴定:数据库搜索与谱库搜索
- FDR 控制:靶诱饵策略与 q 值
- 定量策略:label-free、TMT 与 DIA
- 蛋白质推断与缺失值处理
- 翻译后修饰分析:以磷酸化为例
- 差异表达分析与统计
- 与转录组等其他组学的衔接
1. 质谱蛋白质组学的数据生成原理
典型的「自下而上」(bottom-up / shotgun)流程是:蛋白质被酶(通常胰蛋白酶)切成肽段 → 液相色谱分离 → 电喷雾电离 → 质谱分析。质谱分析分两级:
- MS1(一级谱):测量所有进入的肽段离子的 m/z 与强度,给出「母离子」信息;
- MS2(二级谱):挑出强度最高的若干母离子(通常 Top 10-20),碎裂后测量碎片离子的 m/z,给出「肽段序列」信息。
碎裂方式决定了信息量。HCD(高能碰撞解离)产生丰富的 b/y 离子系列,是当前主流;ETD 对磷酸化等修饰更友好(保留修饰基团);CID 较老但仍广泛使用。理解碎裂模式对解读 MS2 谱图至关重要——搜索算法本质上是在「预测给定序列的碎裂谱图」,碎裂模型错了,匹配就错了。
数据采集模式决定了下游分析范式:
| 模式 | 采集方式 | 特点 | 适用 |
|---|---|---|---|
| DDA(数据依赖) | 按强度挑母离子做 MS2 | 谱图质量高,但随机性强、重复性差 | 蛋白质鉴定、深度覆盖 |
| DIA(数据非依赖) | 按窗口系统碎裂全部母离子 | 重复性好、缺失值少,但谱图混合 | 大队列定量 |
| PRM/MRM(靶向) | 只针对预设肽段 | 灵敏度最高、可绝对定量 | 验证特定蛋白 |
| TMT/iTRAQ | 标记后混合,MS2 定量 | 通量高、批次效应小 | 多样本相对定量 |
一个关键概念是动态范围:血浆蛋白的丰度跨越 10 个数量级(白蛋白 vs 细胞因子),而质谱的单一实验动态范围约 4-5 个数量级。这就是为什么「深度蛋白质组」需要「去除高丰度蛋白 + 分级分离」——不是灵敏度不够,而是动态范围不够。
2. 数据格式:原始文件、mzML 与谱图
质谱数据格式的碎片化比测序更严重:每个仪器厂商有专有格式(Thermo 的 .raw、Sciex 的 .wiff、Bruker 的 .d),必须通过转换工具统一。
# 转成开放的 mzML 格式(推荐 mzML 1.1,含索引便于随机访问)
msconvert sample.raw --mzML --zlib --filter "peakPicking vendor msLevel=1-2" \
-o mzml_out/
# 转成搜索工具常用的 MGF(只含 MS2 谱图,无 MS1 信息)
msconvert sample.raw --mgf -o mgf_out/
msconvert(ProteoWizard)是格式转换的事实标准。两个关键参数:peakPicking 把轮廓数据(profile)转成峰列表(centroid),几乎所有搜索工具都要求 centroid 数据;zlib 开启压缩(mzML 未压缩时文件极大,可达原始 .raw 的 2-3 倍)。注意「在哪个层级做 peakPicking」会影响结果——对 MS1 与 MS2 都做是常规,但某些定量方法需要保留 MS1 的轮廓数据。
mzML 的结构值得理解,因为它决定了能做什么分析:
mzML 文件
├─ run
│ ├─ spectrumList ← 每张谱图(MS1 与 MS2 混合存放)
│ │ ├─ spectrum (MS1):m/z 数组 + 强度数组
│ │ └─ spectrum (MS2):母离子 m/z、电荷、保留时间、碎片谱
│ └─ chromatogramList ← 色谱图(TIC、XIC)
└─ indexList ← 偏移索引(支持随机访问)
一个实践要点:保留时间(retention time)是重要的质量维度,但不同仪器、不同梯度的保留时间不可直接比较。跨样本比较时需要用「保留时间对齐」工具(如 OpenMS 的 MapAligner),或改用基于谱库的保留时间预测(DIA 分析的常规做法)。
3. 肽段鉴定:数据库搜索与谱库搜索
肽段鉴定有两条技术路线,用途不同:
数据库搜索(database search):给定蛋白质序列数据库(如 UniProt),用酶切规则枚举所有理论肽段,对每个实验谱图找最佳匹配。这是最常用的方法,也是发现新肽段的唯一途径:
# FragPipe(MSFragger)的标准流程,配置文件驱动
fragpipe --headless --config fragpipe.workflow \
--manifest manifest.fp-manifest --workdir fp_out --threads 32
# 传统路线:Comet + Percolator(搜索引擎 + 机器学习后处理)
comet -P params.comet -D db.fasta sample.mgf
percolator -X percolator_input.txt -o percolator_out.txt \
--decoy-pattern "rev_" --protein-enzyme trypsin
谱库搜索(spectral library search):用「已知的谱图-肽段对应关系」库直接匹配实验谱图。速度极快、灵敏度高、FDR 易控制,但只能鉴定库里已有的肽段,无法发现新肽段或新修饰:
# DIA-NN:谱库搜索 + 定量一体(也可用 in silico 预测库)
diann --f sample.mzML --lib library.tsv --out report.tsv \
--threads 32 --qvalue 0.01 --matrix-qvalue 0.01 \
--out-lib diann_speclib.tsv --gen-spec-lib
搜索参数的设置是最大的技术门槛。关键参数与含义:
| 参数 | 典型值 | 影响 |
|---|---|---|
| 母离子容差 | 10-20 ppm(高分辨)/ 1.5 Da(低分辨) | 过宽引入假匹配,过窄漏掉真肽段 |
| 碎片离子容差 | 0.02 Da(高分辨 HCD)/ 0.5 Da | 同上 |
| 酶切规则 | 胰蛋白酶,允许 2 个漏切 | 漏切数增加会放大搜索空间 |
| 固定修饰 | 半胱氨酸氨甲酰甲基化(+57.021) | 建库时烷基化引入,必须设 |
| 可变修饰 | 甲硫氨酸氧化(+15.995) | 常见 artifact,必须设 |
| 母离子电荷 | 2-4 | 排除单电荷(多为噪声) |
| 前体质量容差单位 | ppm 或 Da | 高分辨仪器用 ppm |
**「可变修饰越多,假阳性越高」**是一条铁律:每增加一个可变修饰,搜索空间大约翻倍(因为每个位点都要考虑「有/无修饰」两种状态)。开放搜索(open search,不预设修饰质量)能发现未知修饰,但会显著降低灵敏度,必须配合更严格的 FDR 策略(如 MSFragger 的 mass calibration + 二次搜索)。
4. FDR 控制:靶诱饵策略与 q 值
质谱鉴定没有「绝对正确」的分数阈值,因此必须用统计方法控制假发现率。标准做法是靶-诱饵策略(target-decoy):把「真实序列库」(靶)与「打乱的假序列库」(诱饵)合并搜索,任何匹配到诱饵的谱图都被认定为假阳性。
靶-诱饵策略的逻辑
实验谱图 → 同时搜靶库与诱饵库
· 匹配到靶库且分数高 → 真阳性
· 匹配到诱饵库(分数任意)→ 假阳性(假序列不该匹配到任何谱图)
· 匹配到靶库但分数低 → 可能是假阳性(与诱饵同分布)
估计 FDR = 诱饵匹配数 / 靶匹配数
(诱饵数需乘以因子校正:库大小比、诱饵是否为反转序列等)
诱饵库的构建方式影响 FDR 估计的准确性:反转序列(reverse) 比 打乱序列(shuffle) 更常用,因为反转保留了氨基酸组成(从而保留理化性质),使诱饵与靶的「假阳性分布」更接近。但反转会产生「与靶序列重叠」的问题,因此一些工具改用「伪反转」(pseudo-reverse,只反转两端)。
FDR 的两个层级必须分清:
- PSM 层级 FDR:控制「谱图匹配」的错误率,是搜索工具的默认输出;
- 蛋白层级 FDR:控制「最终报告的蛋白列表」的错误率,通常更严格(如 1%)。
肽段层级与蛋白层级的 FDR 不能互相推导。一个蛋白由多条肽段支持,若只控制 PSM FDR,蛋白列表的错误率会远高于 1%。工具如 Percolator 与 MaxQuant 会分别计算并报告各层级的 FDR,报告里必须写明用的是哪个层级。
# Percolator:用机器学习重新打分并给 q 值
percolator -X search_results.txt --decoy-pattern "rev_" \
-F 0.01 --protein -Y -r percolator_out -m percolator_models
# -F 0.01:FDR 阈值 1%;--protein:输出蛋白层级结果
q 值(q-value) 是与 p 值对应的多重检验校正量:把所有 PSM 按分数降序排列,q 值表示「以该分数为阈值时,列表整体的 FDR」。用 q 值过滤比用「固定分数阈值」过滤更稳健,因为分数阈值在不同数据集间不可比(仪器、梯度、样本复杂度都会影响分数分布)。
一个常见的错误是「先按分数过滤再做 FDR 校正」——这会让 FDR 估计失效,因为诱饵匹配数在过滤后已经变了。正确顺序是「全部 PSM 一起算 q 值,再按 q 值过滤」。
5. 定量策略:label-free、TMT 与 DIA
鉴定的「有/无」只是起点,定量才是大多数研究的真正目标。三种主流策略的取舍:
Label-free(LFQ,非标记定量):直接比较不同样本中同一肽段的 MS1 信号强度。优点是简单、成本低、无标记数量限制;缺点是样本间的「上样量差异」与「仪器状态漂移」会引入偏差,需要归一化,且缺失值多。
# MaxQuant 的 LFQ 模式(关键参数)
# LFQ mode: 开启,用 MaxLFQ 算法做跨样本归一化
# Match between runs: 开启,用保留时间对齐「借」其他样本的鉴定
# Min ratio count: 2,至少 2 条肽段才定量蛋白
Match between runs(MBR)是 LFQ 的关键增强:它把「某个肽段在样本 A 中鉴定到、在样本 B 中未鉴定但 MS1 有对应信号」的情况补全,大幅减少缺失值。但 MBR 也有风险——保留时间对齐错误会产生「假匹配」,因此通常要求「对齐窗口严格(< 0.5 min)+ 至少两个样本中有鉴定」。
TMT/iTRAQ(等重标记定量):用不同同位素的标签标记不同样本的肽段,混合后一起测序。优点是一次实验可定量 6-18 个样本(TMTpro 18 重),批次效应极小(同一次 MS 运行);缺点是比率压缩(ratio compression)——共分离的其他肽段会污染 MS2 谱图,导致真实差异被压缩,且单次样本数受限。
比率压缩的缓解手段有两个:一是用 SPS-MS3 采集(在 MS3 层级定量,避开共分离干扰),代价是扫描周期变长、鉴定数下降;二是在数据处理阶段做压缩校正(如 Proteome Discoverer 的 TMT 校正、或 R 包的 MSstatsTMT)。判断压缩是否严重,可以看「已知的内参蛋白(spike-in)的实测比值与理论比值差多少」——若理论 10 倍实测只有 3 倍,压缩就相当严重。
TMT 的另一个工程约束是**「一个批次内的所有样本必须同批处理」。18 重的 TMT 一次最多 18 个样本,超过就必须分批,而批次之间必然有差异**(标记效率、混合比例、仪器状态)。因此 TMT 实验的设计原则是「把感兴趣的组间比较放在同一批次内」,批次间只做「桥接样本」的校正。若处理组与对照组被拆到不同批次,结论基本不可靠。
DIA(数据非依赖采集):把 m/z 范围切成窗口,系统地对每个窗口内所有母离子做碎裂。优点是重复性极好、缺失值少、样本通量高,特别适合大队列;缺点是对复杂样本的谱图混合严重,依赖谱库质量。DIA 已成为大队列蛋白质组的首选:
# DIA-NN 典型参数(大队列)
diann --f *.mzML --lib library.tsv --out report.tsv \
--threads 32 --qvalue 0.01 --matrix-qvalue 0.01 \
--rt-profiling --mass-acc 10 --mass-acc-ms1 15 \
--xic 1 --use-quant --smart-profiling
定量策略的选择逻辑:样本数 < 10 且需要深度鉴定用 DDA + LFQ;样本数 6-18 且需要极小批次效应用 TMT;样本数 > 20 的大队列用 DIA。三种策略的定量结果不可直接比较(归一化方式、缺失值模式、动态范围都不同),跨研究整合时必须重新处理原始数据。
6. 蛋白质推断与缺失值处理
蛋白质推断(protein inference) 是蛋白质组特有的难题:质谱测的是肽段,而「肽段 → 蛋白」的映射是多对多的。一条肽段可能属于多个同源蛋白(共享肽段,shared peptide),因此「鉴定到某条肽段」不等于「确定某个蛋白存在」。
处理策略分三种:
- 只保留唯一肽段(unique peptide):保守但会丢失信息(同源蛋白家族无法区分);
- 共享肽段分配到所有可能的蛋白(MaxQuant 默认,称「蛋白组」protein group);
- 用简约原则(parsimony) 找「能解释所有肽段的最小蛋白集」(ProteinProphet、Percolator 的做法)。
报告里必须说明用的是哪种策略,因为这直接决定「能报告多少个蛋白」——简约原则给出的蛋白数最少,共享肽段分配到所有蛋白会给出最多的「候选」。
缺失值(missing value) 是另一个核心问题。蛋白质组数据的缺失有三类成因,处理方式完全不同:
| 缺失类型 | 成因 | 处理 |
|---|---|---|
| MNAR(非随机缺失) | 丰度低于检测限 | 不能用均值填补;用下限填补或专门模型 |
| MAR(随机缺失) | 随机技术波动 | 可用 kNN / 随机森林填补 |
| 完全缺失 | 蛋白真的不存在 | 不填补,如实记录 |
「低丰度蛋白缺失」是最常见的 MNAR:一个蛋白在对照组检不到、在处理组检出,这本身就是「上调」的信号。若用均值填补这些缺失,会把信号抹平;若用 0 填补,会人为夸大差异。正确做法是用「下限填补」(如用该样本最小值的 1/5)并选择能处理 MNAR 的统计方法(如 MSstats、limma 的 impute 策略,或 Perseus 的「从正态分布左移分布填补」)。
缺失值处理的经验判据
缺失比例 < 5% → 影响小,可填补或直接删除该蛋白
缺失比例 5-30% → 需谨慎,按 MNAR/MAR 分类处理
缺失比例 > 30% → 该蛋白的定量不可靠,建议不纳入差异分析
MaxQuant 的输出文件 proteinGroups.txt 里有几列必须理解,否则容易误用:
| 列名 | 含义 | 使用注意 |
|---|---|---|
Reverse | 是否为诱饵蛋白 | 必须过滤掉 + |
Potential contaminant | 是否为污染蛋白(角蛋白、胰蛋白酶等) | 必须过滤掉 + |
Only identified by site | 只有修饰位点肽段支持 | 通常过滤(可能是假阳性) |
Unique peptides | 唯一肽段数 | 定量可信度判据,建议 ≥ 2 |
LFQ intensity | LFQ 归一化强度 | 用于定量,0 表示缺失 |
iBAQ | 强度归一化到理论肽段数 | 用于「蛋白绝对丰度」的近似比较 |
「先过滤三类标记再分析」是硬性要求:不过滤诱饵与污染蛋白,会让下游的差异分析混入假阳性与角蛋白(实验室常见污染);不过滤 Only identified by site 会让「只有一条修饰肽段支持」的蛋白进入结果,这类蛋白的定量极不可靠。
7. 翻译后修饰分析:以磷酸化为例
翻译后修饰(PTM)分析是蛋白质组学的高价值方向,也是最难的部分。以磷酸化(phosphorylation)为例,流程包含三个特殊环节:
富集(enrichment)。磷酸化肽段在总肽段中占比通常低于 1%,不富集根本测不到。方法有 TiO2、IMAC(Fe-IMAC 最常用)、抗体富集(针对特定基序如 pY)。富集效率直接决定能鉴定多少磷酸化位点:
# MaxQuant 的磷酸化搜索参数(关键设置)
# Variable modifications: Phospho (STY)
# Max. variable modifications: 3-5(磷酸化常有多重修饰)
# Localization probability: 用 PTM 打分算法评估位点定位可信度
位点定位(localization)。这是磷酸化分析的核心难点:一条肽段上有多个 S/T/Y,「哪个位点被磷酸化了」需要从碎片谱图中推断。MaxQuant 的 PTM score 与 ptmRS 等算法给出「定位概率」,通常要求定位概率 > 0.75(甚至 0.9)才认为位点可靠。定位概率低的位点不应报告为「某位点被磷酸化」。
位点层级定量。磷酸化蛋白组要区分「蛋白丰度变化」与「磷酸化比例变化」:一个磷酸化位点信号升高,可能只是因为该蛋白总量升高了。正确做法是用总蛋白组数据归一化磷酸化数据,得到「磷酸化比例」的变化。这一步常被忽略,导致大量「假阳性磷酸化变化」。
# 用 limma 做磷酸化数据的差异分析(R,示意)
# design 包含「处理」与「批次」
# contrasts 比较处理组 vs 对照组
library(limma)
fit <- lmFit(ptm_matrix, design)
fit <- eBayes(fit)
topTable(fit, coef = "Treatment", number = Inf, adjust.method = "BH")
修饰分析的一般原则:修饰肽段的数据是「子集」,其 FDR 与定位精度都需要单独评估,不能沿用总蛋白组的阈值。多修饰(一条肽段上多个磷酸化)会进一步放大搜索空间,通常需要限制「每条肽段最多 N 个修饰」来控制假阳性。
8. 差异表达分析与统计
差异表达分析的目标是找「处理组与对照组之间显著变化的蛋白」。统计方法与转录组高度相似(都是「小样本、高维度、多重检验」),但有三点蛋白质组特有的差异:
第一,样本量通常更小。质谱实验成本高,n=3 是常态。小样本下,基于正态假设的 t 检验功效低,必须用「方差收缩」方法(limma 的 eBayes 把方差向全局均值收缩,显著提升小样本功效)。这是 limma 成为蛋白质组差异分析事实标准的原因。
第二,需要处理缺失值。如第 6 节所述,缺失模式会影响统计。用 MSstats(专门为蛋白质组设计的工具)或 limma + 显式填补是常见做法。
第三,归一化方式影响结论。常用方法:中位数归一化(假设「大多数蛋白不变」)、分位数归一化(强制分布相同)、以及基于内参蛋白(spike-in)的归一化。「大多数蛋白不变」这个假设在某些实验中不成立(如全局转录抑制、药物导致大规模蛋白降解),此时中位数归一化会把真实信号抹平——这与 RNA-seq 的归一化陷阱完全相同,可参考 RNA-seq 转录组分析 里的讨论。
差异分析的报告要求
1. 效应量(log2 fold change)+ 置信区间,而非只有 p 值
2. 校正后的 q 值(Benjamini-Hochberg),而非原始 p 值
3. 定量所用的肽段数(min 2 条,最好 3 条以上)
4. 缺失值处理方式与填补策略
5. 归一化方法
6. 统计模型(含纳入的协变量,如批次)
一个务实建议是用火山图 + 效应量阈值双重筛选:p 值显著但 fold change 很小(如 1.2 倍)的变化,生物学意义通常有限;fold change 大但 p 值不显著的,可能是样本量不足。两者结合才能得到可靠的结果。
9. 与转录组等其他组学的衔接
蛋白质组与转录组的联合分析是常见需求(「mRNA 升高了,蛋白也升高了吗」),但直接比较会踩坑:
第一,量纲不同。转录组是「读段计数」(整数、负二项分布),蛋白质组是「谱图强度」(连续、对数正态)。必须各自做差异分析,再比较「变化方向与幅度」的一致性,不能把两者的原始值放在一起算相关。
第二,相关性天然不高。mRNA 与蛋白的相关系数通常在 0.4-0.6,这是生物学事实(翻译效率、蛋白半衰期、降解调控),不是数据质量问题。「相关性低」不应被当作「实验失败」,反而常常是发现「翻译后调控」的线索。
第三,时间尺度不同。mRNA 响应快(分钟级)、蛋白响应慢(小时级),做时间序列实验时采样时间点必须匹配两者的动力学。
一个实用的分析框架是把蛋白分成四类:mRNA 与蛋白同向变化(转录调控为主)、mRNA 变而蛋白不变(翻译或降解调控)、蛋白变而 mRNA 不变(翻译后调控)、都不变。这个分类比「算一个相关系数」提供的信息多得多,也是多组学整合研究的核心思路之一。
若需要蛋白质结构信息来解释功能影响,可结合 蛋白质结构预测与 AlphaFold 应用 分析变异或修饰位点是否落在关键区域。
权衡取舍
| 决策点 | 方案 A | 方案 B | 建议 |
|---|---|---|---|
| 采集模式 | DDA(深度鉴定) | DIA(大队列定量) | 探索用 DDA,队列定量用 DIA |
| 鉴定方法 | 数据库搜索(发现新) | 谱库搜索(快、灵敏) | 先用库搜提高覆盖,再库搜补充 |
| 定量策略 | Label-free | TMT / DIA | 小样本 LFQ,中等样本 TMT,大队列 DIA |
| 诱饵库 | 反转序列 | 打乱序列 | 用反转(保留组成),注意重叠问题 |
| FDR 层级 | PSM 层级 | 蛋白层级 | 报告蛋白时用蛋白层级 FDR |
| 缺失值 | 均值/kNN 填补 | 下限填补 | 低丰度缺失用下限,避免抹平信号 |
| 磷酸化定量 | 只看磷酸化信号 | 用总蛋白归一化 | 必须归一化,否则混淆丰度与比例 |
| 差异分析 | t 检验 | limma + 方差收缩 | 小样本必须用 limma |
常见坑清单
- 忘设固定修饰(氨甲酰甲基化):所有半胱氨酸肽段匹配失败,鉴定数骤降;建库用烷基化就必须设。
- 可变修饰加太多:搜索空间爆炸、假阳性飙升;只加必要的(氧化、乙酰化等)。
- 母离子容差设错单位:ppm 与 Da 混用导致全库无匹配;按仪器分辨率选单位。
- 先按分数过滤再算 FDR:诱饵计数失真,FDR 估计无效;必须全部 PSM 一起算 q 值。
- 混用 PSM 与蛋白层级 FDR:蛋白列表错误率被低估;报告蛋白用蛋白层级 FDR。
- 用均值填补低丰度缺失:真实的上调信号被抹平;MNAR 缺失必须用下限填补。
- 磷酸化不做总蛋白归一化:蛋白丰度变化被误读为磷酸化比例变化;必须用总蛋白校正。
- 忽略定位概率:多位点肽段报告了错误位点;只报告定位概率 > 0.75 的位点。
- 样本量太小却用普通 t 检验:功效不足;用 limma 的方差收缩。
- 跨研究直接合并定量值:归一化方式不同导致系统性偏差;应回到原始数据重新处理。
小结
蛋白质组学的核心特殊性在于「测的是肽段,推的是蛋白」。从谱图到肽段的鉴定是统计推断(依赖搜索参数与 FDR 控制),从肽段到蛋白的映射是多对多推断(依赖简约原则或共享肽段策略),从信号到丰度的转换受电离效率与缺失值干扰——这三层不确定性叠加,使蛋白质组结果的可信度评估比转录组更复杂。
工程上最该建立的三个认知:第一,FDR 是分层的。PSM、肽段、蛋白三个层级的 FDR 各自独立,报告时必须明确用的是哪一层,且不能互相推导。第二,缺失值不是噪声而是信息。「对照组没有、处理组有」本身就是信号,用均值填补会把它抹掉。第三,定量策略决定分析范式。LFQ、TMT、DIA 的数据特性差异极大(缺失模式、动态范围、批次结构),分析流程必须与采集策略配套,不能通用一套参数。
下一步可以看多组学整合篇了解如何把蛋白质组与转录组、代谢组联合分析,或 蛋白质结构预测与 AlphaFold 应用 了解如何用结构信息解释修饰与变异的功能影响。如果你的鉴定数远低于预期,先检查固定修饰与容差设置;如果定量结果「几乎什么都没变」,先确认是否误用了「大多数蛋白不变」的归一化假设。
常见问题
Q:为什么我的蛋白质组数据和转录组数据对不上?
mRNA 与蛋白的相关系数在 0.4-0.6 是正常范围,不是错误。真正的分析应该关注「哪些蛋白的变化不能用 mRNA 解释」——那才是翻译调控、降解调控的证据。参见 RNA-seq 转录组分析
了解转录组侧的处理。
Q:LFQ 和 TMT 的定量结果能合并吗?
不能直接合并。两者的归一化方式、动态范围、缺失模式完全不同,直接合并会引入系统性偏差。若必须整合,应把两者视为独立数据集,用批次校正方法处理后比较「变化方向的一致性」,而非合并原始强度值。
Q:为什么磷酸化数据里的「变化」大多是假的?
最常见的原因是没做总蛋白归一化。一个磷酸化位点信号升高 2 倍,如果对应的总蛋白也升高了 2 倍,那么磷酸化「比例」其实没变。必须用同批样本的总蛋白组数据(或至少该蛋白的蛋白丰度)做归一化,才能得到真正的磷酸化调控变化。其次是位点定位不可靠——定位概率低的位点本身就是噪声,不应纳入差异分析。
继续阅读
探索更多技术文章
浏览归档,发现更多关于系统设计、工具链和工程实践的内容。