引言
量子硬件的宣传材料上总是写着一串数字:99.9% 的两比特门保真度、127 个量子比特、量子体积 2^9、CLOPS 数千。这些数字看起来可比,但实际上常常不可比——它们测量的是不同的东西,用了不同的假设,甚至在不同时刻的硬件上测的。
这带来一个实际问题:当你要给一个算法选平台,或者要判断「我的电路能不能跑」,你需要的不是单个数字,而是理解每个指标在测什么、假设是什么、什么时候会骗你。比如 T1 长不代表门保真度高;量子体积高不代表你的电路能跑;两比特门保真度 99.9% 在孤立测量下成立,但同时在 50 个比特上做门时可能降到 99%。
本文系统讲解量子基准测试:先讲为什么难,再拆保真度指标、随机化基准测试家族、量子体积、电路层指标(CLOPS、算法量子比特)、应用导向基准与量子优势判据,最后给出常见陷阱与最佳实践。目标:让你能读懂一份基准报告,并知道哪些数字对你的场景有意义。
为什么量子基准这么难
经典计算机的基准测试(benchmark)相对直接:跑一个固定程序,量时间和吞吐。量子基准难在几件事上。
难在「无法读出全部状态」
经典程序可以打印任意中间变量。量子程序不能:一次测量只能得到一个比特、且测量会破坏状态。要估计一个量子态的任意性质,你得反复制备、测量、统计——这就是层析(tomography),成本随量子比特数指数增长。所以所有量子基准都是间接推断,依赖模型假设。
难在「错误有多种」
不同指标测的是不同错误:
| 错误类型 | 含义 | 典型测量 |
|---|---|---|
| 相干错误 | 相位/幅度系统性偏离 | Ramsey、RB 对比 |
| 非相干错误 | 随机衰减(T1、T2) | T1/T2 测量 |
| 门错误 | 门操作引入的错误 | RB、XEB |
| SPAM 错误 | 制备与测量错误 | 态层析、RB 截距 |
| 串扰 | 相邻比特相互影响 | 并行 RB、串扰谱 |
| 泄漏 | 跑出计算子空间 | 泄漏 RB |
一个「保真度 99.9%」的数字,可能只包含其中一两类错误。所以在比较平台前,必须先问:这个数字测的是哪类错误、在什么条件下测的?
这一点和经典高性能计算里选基准的思路相通:HPL 测的是稠密线性方程求解的峰值,STREAM 测的是内存带宽,HPC 基准与 HPL 里同样强调「没有单一数字能概括整机」。量子基准的处境更极端,因为连「读出一个中间值」都做不到。
难在「成本与规模」
经典基准可以跑几小时,量子基准不行:每次采样都要重新制备与测量,统计误差随采样数 $1/\sqrt{N}$ 收敛。要区分 99.9% 与 99.95% 的保真度差异,采样量可能相差一个数量级。而大规模电路的单次执行又慢,导致高精度测量与大规模测量不可兼得。
| 测量目标 | 采样需求 | 现实约束 |
|---|---|---|
| 单门保真度 ±0.01% | 10^5~10^6 shots | 可接受(秒级) |
| 多比特串扰矩阵 | 随比特数平方增长 | 需专用协议(循环基准) |
| 全态层析 (n 比特) | 3^n 次测量 | n > 10 不可行 |
| XEB 保真度 (50 比特) | 10^6~10^7 shots | 小时级 |
难在「指标之间不可直接换算」
常见误解:T2 = 100 µs,所以能跑深度 100 的电路。这不对——T2 只告诉你退相干时间,不含门错误。一个深度 100 的电路,即使每层门保真度 99.9%,累计保真度也只有 $0.999^{100} \approx 90%$,而且相干错误会随电路结构放大。指标之间没有简单换算公式,必须实测。
保真度基础指标:T1、T2 与 SPAM
相干时间
T1(能量弛豫):|1> 衰减到 |0> 的时间常数
测量:制备 |1>,延迟 t,测 P(|1>),拟合指数衰减
典型:超导 100~300 µs,离子阱可达秒级
T2*(自由感应衰减):由低频噪声导致的相位扩散
测量:Ramsey 干涉,扫延迟时间,拟合振荡包络
典型:常远小于 T2
T2(Hahn 回波):用 π 脉冲翻转,抵消低频噪声
测量:Hahn echo 序列
典型:超导 100~200 µs,通常 T2 <= 2*T1
一个关键细节:$T_2 \le 2T_1$ 是硬约束。如果你看到某平台报 $T_2 = 500$ µs 而 $T_1 = 100$ µs,那一定有问题(除非测量方式特殊)。这个不等式是判断数据可信度的第一个筛子。
SPAM 错误
SPAM(State Preparation And Measurement,态制备与测量)错误是每次实验都会摊到的固定成本:
| 分量 | 含义 | 典型值 |
|---|---|---|
| 制备错误 | 初始化到 |0> 的残留激发 | 超导 0.1~1% |
| 测量错误 | 把 |0> 判成 |1> 或反之 | 超导 1~3%,离子阱 0.1% |
| 串扰 | 读一个比特影响邻居 | 取决于布线 |
SPAM 错误在 RB 里表现为衰减曲线的截距($A$ 与 $B$),而不是斜率。所以 RB 能在不知道 SPAM 错误的情况下估出门错误——这是 RB 最巧妙的地方。但反过来,如果你要的是端到端保真度,SPAM 错误必须单独算进去。
RB 衰减模型:
P_success(m) = A * α^m + B
其中:
m = Clifford 门数量
α = 每 Clifford 的衰减因子(与门错误相关)
A, B = 吸收 SPAM 错误的常数(截距)
→ 门错误率与斜率有关,与截距无关
随机化基准测试(RB)家族
RB(Randomized Benchmarking)是量子基准的主力工具,核心思路是用随机化把相干错误「洗成」非相干错误,然后用指数衰减提取每门平均错误。
标准 RB 的流程
# 标准 RB 的算法骨架(伪代码)
# 1. 对每个序列长度 m:
# 随机生成 m 个 Clifford 门,末尾加一个逆门使总操作 = 恒等
# 制备 |0...0>,执行序列,测量
# 重复 N 次取成功概率
# 2. 对 m 做指数拟合 P(m) = A * α^m + B
# 3. 由 α 换算每 Clifford 错误率
def error_per_clifford(alpha, d):
# d = 2^n 为 Hilbert 空间维度
return (1 - alpha) * (d - 1) / d
RB 家族的变体
| 变体 | 测什么 | 用途 |
|---|---|---|
| 标准 RB | 单/两比特门平均错误 | 基础指标 |
| 交织 RB (Interleaved RB) | 特定门在上下文中的错误 | 估某个具体门的错误 |
| 同时 RB (Simultaneous RB) | 并行门的串扰 | 评估真实并行场景 |
| 循环基准 (Cycle Benchmarking) | 每层门的错误(含串扰) | 大规模系统的可扩展测量 |
| 泄漏 RB | 跑出计算子空间的概率 | 评估泄漏错误 |
| 门集层析 (GST) | 门的具体错误类型 | 诊断性,成本高 |
循环基准(Cycle Benchmarking) 值得单独说:标准 RB 的序列长度随比特数增长会让状态空间爆炸($d = 2^n$ 的 Clifford 群太大),无法扩展到几十个比特。循环基准改用随机 Pauli 层,每层由随机单比特 Pauli 门加固定两比特门层组成,测量 Pauli 期望值的衰减。它能在 10~100 个比特规模上工作,且直接给出「每层(per cycle)」的错误率——这正是评估大规模系统需要的指标。
循环基准(Cycle Benchmarking)要点:
- 每个 cycle = 随机单比特 Pauli 层 + 固定的并行两比特门层
- 在 Pauli 框架下追踪,状态空间不随比特数指数增长
- 输出:每 cycle 的 Pauli 错误率 EPLG(Error Per Layered Gate)
- 优势:可测串扰、可扩展到多比特
RB 的假设与失效
RB 有几个强假设,违反了结果就不可信:
- 门无关噪声:假设每个门的错误率相同。实际上不同的门错误率差好几倍,RB 给的是「平均」。
- 马尔可夫噪声:假设噪声无记忆。如果存在 $1/f$ 噪声或漂移,衰减不是纯指数。
- 错误不泄漏:假设错误留在计算子空间内。泄漏会让拟合偏差。
- 序列充分随机:随机化必须把相干错误洗成非相干。序列太短或随机性不足,会低估错误。
所以 RB 报出的「99.9%」在孤立测量下成立,但不代表你的电路能跑到 99.9%。并行场景下的串扰往往是 RB 漏掉的最大项。
泄漏与串扰怎么测
泄漏(leakage) 是超导平台特有的麻烦:量子比特是谐振子,操作可能把布居打到 $|2\rangle$ 而不是留在 ${|0\rangle, |1\rangle}$ 子空间。泄漏的害处是它不在 RB 的模型里(RB 假设错误留在子空间内),会让拟合结果偏乐观。
泄漏测量思路:
1. 标准 RB 序列 + 末尾加一个"泄漏探测"操作
(把 |2> 映射回计算子空间)
2. 对比有无探测操作时的衰减曲线
3. 差异反映泄漏量
典型:超导单比特泄漏 < 0.1%/门,两比特可达 0.5%/门
串扰(crosstalk) 的测量靠并行 RB:把同一组门同时在多个比特上执行,对比孤立执行时的错误率。差值就是串扰。对超导平台,相邻比特之间的 ZZ 耦合(静态串扰)是主要来源,表现为「邻居在操作时我的频率被推移」。
| 串扰类型 | 来源 | 测量方法 |
|---|---|---|
| ZZ 静态耦合 | 固定耦合器、频率碰撞 | 谱测量、并行 Ramsey |
| 驱动串扰 | 微波泄漏到邻近比特 | 并行 RB |
| 读出串扰 | 读出谐振腔耦合 | 同时读出的混淆矩阵 |
| 热串扰 | 加热导致邻居退相干 | 温度/弛豫对比 |
量子体积(Quantum Volume)
量子体积(Quantum Volume, QV)是 IBM 提出的单一数字指标,试图用一个数概括「整机能力」。它的定义很有意思:能成功运行的最大方阵随机电路尺寸。
判据
量子体积的测试协议:
1. 生成 n 个量子比特的随机方阵电路,深度 = n
(每层:随机两比特门 + 随机单比特门,拓扑允许的话全连接)
2. 理想情况下,输出分布的重输出概率(heavy output probability)> 2/3
"重输出" = 概率高于中位数的那些输出
3. 实测重输出概率 h
4. 若 h > 2/3 且统计置信度达 97.5%(约 2 sigma),则 QV >= 2^n
5. 找满足条件的最大 n,QV = 2^n
关键在于「深度 = 宽度」——这强制电路既有一定宽度又有一定深度,不能靠「很多量子比特但只能跑浅电路」蒙混过关。QV 同时考验了量子比特数、门保真度、连通性、编译质量、读出质量。
QV 的价值与局限
价值:它是一个端到端指标,包含了编译与串扰。两个平台的 QV 可以直接比。
局限:
| 局限 | 说明 |
|---|---|
| 依赖编译器质量 | 同一个硬件换编译器,QV 可能变 |
| 只测方阵电路 | 不代表你的电路结构 |
| 指数增长的门槛 | QV 翻倍需要保真度显著提升 |
| 全连接假设 | 对稀疏拓扑平台不公平(编译开销计入) |
| 不测特定结构 | 化学模拟、优化问题的表现可能完全不同 |
所以 QV 是「下限指标」——QV 高说明基础能力不差,但 QV 高不代表你的算法跑得好。
电路层指标:CLOPS 与算法量子比特
QV 描述「能力」,但用户关心的是「吞吐」。这催生了电路层指标。
CLOPS
CLOPS(Circuit Layer Operations Per Second,每秒电路层操作)衡量单位时间能执行多少个电路层:
CLOPS = (层数 × 每次运行重复次数 × 运行次数) / 总时间
一次运行流程:
1. 编译电路(可能占大头)
2. 加载到硬件
3. 执行 N_shots 次
4. 读出与后处理
注意:CLOPS 把编译时间也算进去(holistic 版本 CLOPS_h)
一个反直觉的事实:CLOPS 常常被编译和经典控制流主导,而不是量子门速度。如果一次作业要编译 10 秒、执行 0.1 秒,CLOPS 会低得可怜。这解释了为什么量子云服务在「小电路高频调用」场景下体验很差。
| 指标 | 含义 | 何时用 |
|---|---|---|
| CLOPS | 每秒电路层操作 | 评估吞吐 |
| CLOPS_h | 含编译时间的 holistic 版本 | 真实作业吞吐 |
| 门速度 | 单门时间 | 评估相干时间预算 |
| 作业延迟 | 提交到拿到结果 | 评估云服务体验 |
算法量子比特
IonQ 提出的「算法量子比特数(#AQ)」是另一个单一数字:对 n 个量子比特,用随机方阵电路测试,看能否在特定保真度阈值下通过。它与 QV 思路类似,但更强调「可用的算法规模」。
这类指标的共同问题是把多维能力压成一维,必然丢信息。用的时候要知道它丢了什么。
应用导向基准与量子优势判据
既然单一数字不够,社区转向应用导向的基准套件。
| 基准套件 | 内容 | 特点 |
|---|---|---|
| SupermarQ | 面向量子计算的 8 类应用特征 | 强调应用相关性 |
| QED-C | 应用导向的基准集 | 覆盖化学、优化、机器学习 |
| QASMBench | 真实量子程序集合 | 小到中规模 |
| QScore | 汇总多个应用指标 | 加权综合 |
| 交叉熵基准 (XEB) | 随机电路保真度估计 | 量子优势验证 |
交叉熵基准(XEB)
XEB(Cross-Entropy Benchmarking)是验证「量子优势」的核心工具。它用随机电路,比较实测输出分布与理想模拟分布的交叉熵。核心量是线性交叉熵保真度:
XEB 保真度估计:
F = (cross_entropy_measured - cross_entropy_uniform)
/ (cross_entropy_ideal - cross_entropy_uniform)
其中 cross_entropy = Σ p_ideal(s) * p_measured(s)
uniform 基准 = 1/2^n
F ≈ 1 → 输出与理想高度一致
F ≈ 0 → 输出随机(无量子优势)
XEB 的优势是不依赖层析:它只用测量到的比特串频率与经典可计算的理想分布(对浅电路可算)比较,能扩展到 50~70 个比特。Google 2019 年的「量子优势」声明就是用 XEB 论证的:53 个比特、深度 20 的随机电路,实测保真度与经典模拟时间对比。
但 XEB 也有争议:「经典无法快速模拟」不等于「有实用价值」。一个只能跑随机电路的系统,和能跑 Shor 算法的系统,是完全不同的东西。这就是量子优势的「工程判据」问题——理论上的优势声明和实际可用性之间隔着一条鸿沟。
基准测试的陷阱与最佳实践
常见陷阱
| 陷阱 | 表现 | 后果 |
|---|---|---|
| 挑最好的比特 | 只报全系统里最好的几个比特 | 高估整机能力 |
| 孤立测门 | 单比特测,不上并行 | 漏掉串扰 |
| 忽略 SPAM | 只报门保真度 | 端到端保真度被高估 |
| 不报分布 | 只报平均值 | 掩盖比特间差异 |
| 换编译器刷分 | 为基准专门调编译器 | 与真实场景不符 |
| 选择性报告 | 只报好的指标 | 无法横向比较 |
| 测点漂移 | 测量时刻与使用时刻差很远 | 校准已变 |
「挑比特」是最普遍的问题。一个 127 比特的系统,可能只有 20 个比特的保真度达标,但宣传里用的是这 20 个的最好成绩。你用的时候如果电路需要全部 127 个比特,实际体验会差很多。
最佳实践
读基准报告时问:
[ ] 测的是哪些比特?全部还是子集?
[ ] 是孤立测还是并行测?有没有串扰数据?
[ ] SPAM 错误单独报了吗?
[ ] 有分布信息吗(最好/中位/最差)?
[ ] 编译设置公开了吗(优化等级、seed)?
[ ] 测量时间与现在差多久?校准更新了吗?
[ ] 有没有你关心的应用类基准(化学/优化/ML)?
做基准测试时:
[ ] 用同时 RB 或循环基准,覆盖并行场景
[ ] 报分布而非单一数字(至少报中位数与四分位)
[ ] 固定编译设置,公开 seed 与优化等级
[ ] 测多个时间点,评估漂移
[ ] 用应用导向基准补充门级指标
[ ] 明确标注每个数字测的是哪类错误
从指标到决策:一个实际例子
假设你要跑一个变分量子本征求解(VQE)的原型,需要 12 个量子比特、每层 12 个两比特门、约 30 层(约 360 个两比特门),每轮迭代要测几十个可观测量的期望值。现在有两个平台候选:
| 平台 | 两比特门保真度 | 门时间 | 读出时间 | 连通性 | QV |
|---|---|---|---|---|---|
| A(超导) | 99.8% | 200 ns | 1 µs | 近邻 | 2^7 |
| B(离子阱) | 99.5% | 60 µs | 120 µs | 全连接 | 2^9 |
粗略估算两边的两比特门开销:
平台 A(近邻拓扑):
逻辑两比特门 360 个,路由后假设 ×3 → 1080 个物理两比特门
累计保真度 ≈ 0.998^1080 ≈ 11% ← 基本不可用
平台 B(全连接):
逻辑两比特门 360 个,无路由开销 → 360 个物理两比特门
累计保真度 ≈ 0.995^360 ≈ 16% ← 也低,但好一些
加上 SPAM(每轮读出 12 比特 × 几十个可观测量):
A:读出 1 µs × ...,SPAM 错误 1~3%/比特
B:读出 120 µs × ...,SPAM 错误 0.1%/比特
结论:两边都需要误差缓解,甚至纠错,才能得到有意义的结果。 但决策依据很清楚:
- 平台的连通性在这里比门保真度更重要——全连接省下的路由开销(3 倍)远超保真度差距(0.3%)。
- 读出时间决定了墙钟时间。B 的读出慢 120 倍,如果每轮要读几十个可观测量,总时间会非常长。
- 误差缓解是必需品。可以用零噪声外推或概率误差抵消,把有效保真度提上去。
这个例子说明:选平台要按你的电路特征算账,不能只看单一指标。 如果你的电路连接稀疏(比如只在一维链上通信),平台 A 的路由开销就没那么大,超导的速度优势会凸显。反之,连接稠密的电路强烈偏向全连接平台。
类似的「按工作负载特征选硬件」的思路,在推理加速领域也很常见——AI 推理基准 里同样是先明确负载特征(批量大小、序列长度、精度),再对照硬件的实测吞吐,而不是只看峰值算力。
小结
量子基准测试的核心困难是:无法直接观测、错误类型多样、指标不可换算。
- T1/T2 描述退相干,但 $T_2 \le 2T_1$ 是硬约束,也是判断数据可信度的第一道筛子。
- SPAM 错误表现为 RB 衰减的截距而非斜率,所以 RB 能在不知 SPAM 的情况下估门错误。
- RB 家族(标准、交织、同时、循环)各有用途;循环基准是唯一能扩展到几十比特并捕捉串扰的方案。
- 量子体积把多维能力压成一维,作为下限指标有价值,但不能替代应用测试。
- CLOPS 常被编译时间主导,holistic 版本才反映真实作业吞吐。
- XEB 是量子优势验证的主力工具,但「经典难模拟」不等于「有实用价值」。
- 最常见的陷阱是挑最好的比特、孤立测门、不报分布;读报告时要逐条追问假设。
实践上,选平台前先明确你的电路特征(宽度、深度、两比特门数、连接需求),然后找与你电路结构最接近的应用基准数据,而不是看单一的门保真度或 QV。如果找不到,就用目标平台跑一个你自己的小规模原型电路,实测端到端保真度——这是最可靠的办法。最后,永远把测量时间记下来:量子硬件每天都在漂,一个三个月前的基准数字,参考价值有限。
继续阅读
探索更多技术文章
浏览归档,发现更多关于系统设计、工具链和工程实践的内容。