duplex 用于 MRD

2026-08-12 · 7 agent 调研+对抗核查 · 32 处被推翻 · 27 处无独立支撑

duplex 对 MRD
到底值不值

duplex 不增加 unique molecules,它减少 4–5.3 倍,换来的是对现代 simplex 仅 2.7–2.8 倍的错误率优势(同一批样本实测)。

在 16–50 个追踪位点的分子限区,这是净亏 1.6–2.8 倍。交叉点在约 1,000 个位点——而文献自己把它框在 30 与 1,500 之间。

÷4.5duplex 的分子损失倍数(杂交捕获 cfDNA 口径)
2.75×同批实测的错误率优势,不是宣传的 30–50 倍
N*≈1,032duplex 开始反超 simplex 的追踪位点数
6.15×位点数 16→200 的 LoD 改善,比 duplex 理论上限还高一倍
P=0.258损伤修复对 duplex 产出无显著影响,却把 ε 降 2.5–4 倍
0.39无配对肿瘤时 simplex 的突变谱余弦相似度(duplex 0.94)

一、先纠正提问方向:duplex 是减少分子,不是增加

1.1 两个概念先分开

概念 英文 是什么 与本问题的关系
双链共识纠错 duplex consensus / DCS 同一原始 DNA 分子的正反两条链都被独立测到,只有两条链一致的碱基才算数 这是你要问的
单链共识 single-strand consensus / SSCS,simplex 同一条链的 PCR 拷贝做共识,正反链各自独立计数 对照组
dsDNA / ssDNA 建库化学 double-/single-stranded library prep 前者以双链片段为底物连接接头;后者变性后对单链连接(SRSLY、Accel-NGS 类) 与 duplex 正交,且方向相反

需要一并澄清的是:ssDNA 建库和 duplex consensus 在工程上互斥。ssDNA 建库提高的是转化率 C(把损伤链、短片段、缺口片段也救回来),但它把一个原始双链分子拆成两条独立入库的链,两条链的配对关系在建库时就丢了,除非专门设计链条码。所以"上单链建库"和"上双链纠错"是两条相反的路。(此段为推断,本轮未做专门文献核查。)

1.2 方向判定

duplex 的定义就要求两条链都活到测序并各自形成家族。任何一条链在末端修复、A-tailing、四次接头连接、杂交捕获、PCR、测序任一环节丢失,这个分子在 duplex 口径下就归零,但在 simplex 口径下仍然可用。

所以:

"duplex 能增加多少 unique molecules" 这个提法方向是错的。正确的问法是:"duplex 会减少多少 unique molecules,减少的这部分值不值得换来的错误率下降。"

唯一能说"增加"的语境,是 duplex 内部的横向比较——CODEC、ppmSeq、SaferSeqS 相对常规杂交捕获 duplex 能在同样测序量下多拿到 duplex 分子。那是 duplex 之间的比较,不是 duplex 对 simplex。


二、分子账:duplex 到底损失多少(含分母定义表)

这是全部争议的来源。文献里"duplex recovery / yield / efficiency"至少有五个互不通约的分母,数值相差 45 倍以上。任何不带分母的百分比都不能用。

表 2-1|duplex 产出率的五个分母(数字全部有出处)

分母口径 分母定义 duplex 实测值 对应的 simplex 值 分子损失倍数 r_M 来源
① 唯一分子口径(cfDNA 场景最有商业意义) 该样本全部 unique cfDNA fragments 19% ~100%(simplex 只要 family≥1–2 即可用) 5.3× Kurtz 2021,12 例健康人 cfDNA,杂交捕获
① 变体 all recovered molecules(已回收分子) 20–25% 4–5× Kurtz 2021 引文
② 共识读口径 consensus reads 46–56% 100% ~2×(论文写"读深 −50%") GeneBits 2025,同一文库三模式
③ 输入模板口径 original template molecules 69%(48-plex)/ 89%(单扩增子) 1.1–1.4× SaferSeqS 2021,多重 PCR,杂交捕获达不到
④ 投入基因组当量(分母 A) 投入 GE(1 ng ≈ 303 单倍体基因组;CRISPR-DS 用 330) ~1%(标准 DS)/ 6–12%(CRISPR-DS,中位 7.4%) 未在同口径给出 Nachmanson 2018
⑤ reads/碱基口径(分母 C) 测序 reads 或碱基 1–10%(Kennedy);NanoSeq 5%、CODEC 11%、ppmSeq 44% 这是测序成本,不是分子损失 多篇

必须记住的一条:同一个 NanoSeq,在分母 ② 下是 50–60%,在分母 ⑤ 下是 5%,差 10 倍。Ultima 宣传的 "ppmSeq 44% vs 常规 5–11%" 是分母 ⑤ 内部的比较,成立;但把 44% 读成"分子利用率是常规 duplex 的 9 倍"是错的。

2.2 结论:你该用哪个数

你们的技术路线是 cfDNA + 杂交捕获 + UMI。这条路线对应分母 ①:

duplex 使可判读分子数减少 4–5.3 倍(分母=该样本全部 unique cfDNA 片段)。 若换成 CODEC/ppmSeq/链条码这类物理连锁化学,可压到 ~2 倍。 若换成多重 PCR amplicon(SaferSeqS 路线),可压到 1.1–1.4 倍,但该路线不可扩展到大 panel。

2.3 损失发生在哪一步(逐步骤存活率)

步骤 存活率 分母 性质
① 接头连接(需 4 次独立连接事件) 理论 0.7⁴≈24%(专利假设值);实测文库中完整 duplex 约 50–68% 进入连接的 dsDNA 分子 GRAIL 专利,非同行评议实测
② 杂交捕获(靶区 <50 kb) 单轮 5–10% on-target,需两轮;CRISPR-DS 单轮 >90% on-target reads / 总 reads 同行评议
两条链都进测序且各自成家族 15–47%(Wang 2019 实测);Povysil 实测 11%/17%/23%/32% 已测到的唯一分子 duplex 独有的损失,主因
④ 生信质控丢弃 约 1/3 reads 为 singleton 被排除;5–12% 的 DCS 因家族仅 1–2 reads 被丢 总 reads / 可形成 DCS 数 同行评议
隐性损失:体外链再合成 健康 cfDNA 7–9%、癌症 cfDNA 15–17%、FFPE 32–57% 的内部碱基对是体外重新合成的 距片段两端 >12 bp 的碱基对 不减少计数,但摧毁双链独立性——duplex 唯一的系统性失效模式

第 ③ 步是 duplex 相对 simplex 的净损失,且 Kennedy 明确指出:一旦发生在建库端,加测序无法补救(SSCS:DCS 比 >14–15 时只能重做文库)。


三、错误账:duplex 的背景优势有多大(simplex 必须算上生信打磨)

你的追问是对的:不能用裸 SSCS 的 1×10⁻⁴ 去比。现代 simplex 流程是"UMI 共识 + 位点特异背景打磨 + 位点黑名单 + CH 过滤",实测地板是 1.5–3.3×10⁻⁵,不是 10⁻⁴。

表 3-1|背景错误率阶梯(每条都标分母、是否损伤修复、是否位点黑名单)

层级 错误率 /碱基 UMI/duplex 损伤修复 位点黑名单 来源
Illumina raw ~1×10⁻³ 公知
未折叠读段 2.8×10⁻⁴ 未说明 Wang 2019
裸 SSCS 1.0×10⁻⁴ SSCS 未说明 Wang 2019
仅条形码去重 9×10⁻⁵ 双端 UID Newman 2016
仅位点打磨(不去重) 1.0×10⁻⁴ Newman 2016
SSCS + 位点打磨(iDES 完整) 1.5×10⁻⁵ 双端 UID Newman 2016
iDES 增强型 CAPP-Seq(复测) 3.3×10⁻⁵ 双端 UID 未说明 Kurtz 2021
GeneBits mixed consensus 1.3–2.1×10⁻⁵ SC+DC 未说明 GeneBits 2025
duplex,同批 cfDNA 1.2×10⁻⁵ DCS 未说明 未说明 Kurtz 2021(与上面 3.3×10⁻⁵ 同批)
GeneBits duplex-only ≥4× 5.9×10⁻⁶ DCS 未说明 GeneBits 2025
duplex(靶向面板) 5×10⁻⁶ DCS 未说明 Wang 2019
duplex(MAESTRO 基线) ~1×10⁻⁶ DCS 未说明 MAESTRO 2022
duplex + 常规 ER/AT,健康 cfDNA 5.8×10⁻⁷ DCS Duplex-Repair 2022
duplex + 损伤修复,健康 cfDNA 3.0×10⁻⁷ DCS 6 酶组合 Duplex-Repair 2022
CODEC 2.9×10⁻⁷ 物理连锁双链 未说明 CODEC 2023
CODEC + ddBTP(精子 gDNA) 2.72×10⁻⁸ 同上 未说明 CODEC 2023

表 3-2|duplex vs simplex 的错误率增益 r_ε:同批 vs 跨研究拼接

比较 同批程度 simplex 基线 duplex r_ε 可用性
Kurtz 2021 同一批 12 例健康人 cfDNA iDES-CAPP-Seq 3.3×10⁻⁵ 1.2×10⁻⁵ 2.75× 最贴近你的场景,可直接用
GeneBits 2025 同一文库跑三模式 mixed consensus 1.3–2.1×10⁻⁵ DC ≥4× 5.9×10⁻⁶ 2.7× 同库自比,最干净
SaferSeqS 2021 同一文库两种计分 6.03×10⁻⁶(同库单链) <2.80×10⁻⁷ >21× 多重 PCR,杂交捕获不适用
mtDNA 三法 同一批数据两级共识 SSCS 1.3×10⁻⁴ DCS 1.0×10⁻⁵ 13× 非 cfDNA;DCS 侧被真实生物学信号顶住,13× 是下界
CODEC 2023 同一批 reads 裸 SSC CODEC 234× 分母是裸单链共识,不是打磨后的 simplex;且 CODEC 不是常规 duplex
跨研究拼接 不同论文/样本/化学 iDES 1.5×10⁻⁵ Duplex-Repair 3.0×10⁻⁷ 50× 只能作为理论上限,不是实测

结论: - 对裸 SSCS:duplex 优势 13–234 倍。这个数字被厂商反复引用,但它比的是没人再用的老流程。 - 对现代 simplex(UMI + 位点打磨):同批实测只有 2.7–2.8 倍。 - 理论上限 30–50 倍要同时满足:simplex 端不做打磨、duplex 端做完整损伤修复、剔除 CH 和体细胞位点。跨研究拼接得来,不可作为采购依据。

另一条硬约束(Kurtz 的核心论证):duplex 只能压制技术性背景,压不住生物学背景。克隆性造血(CHIP,约 20% 个体存在,随年龄升高)产生的真实体细胞突变,单次体内突变事件即可造成,duplex 条码完全无法抑制。所以 duplex 理论错误率 <10⁻⁹,生物样本实测卡在 10⁻⁵–10⁻⁶。


四、决策模型:两个区制与交叉点(含公式与算例表)

4.1 模型

符号与假设(全部显式列出,可替换):

符号 含义 本文取值 依据
M_ng cfDNA 投入 30 ng 主流 tumor-informed MRD 区间 10–80 ng
GE 基因组当量 = M_ng × 303 9,090 3.3 pg/单倍体基因组(CRISPR-DS 用 330,差 9%)
C 建库+捕获后分子回收率 0.60 Newman 2016 实测捕获后回收约 60%
f_SSCS simplex 可判读分子产出率(分母=已回收唯一分子) 0.90 simplex 只要 family≥1–2
f_DCS duplex 可判读分子产出率(同分母) 0.20 Kurtz 19%、引文 20–25%
r_M = f_SSCS/f_DCS 分子损失倍数 4.5 上表
m 每位点可用分子数 = GE×C×f simplex 4,900;duplex 1,090 计算
N 追踪位点数 变量
M = N×m 分子-位点观测总数(informative molecules) 变量 INVAR 的 IR = hGA × loci(该文献本轮未能直接核实全文)
ε 每分子-位点背景错误率 变量 表 3-1
k 泊松检出地板(突变分子数) 3 Chabon 2020 的二项式 LoD 定义
z 背景涨落的显著性系数 2.33(P<0.01) TRACERx 单尾 Poisson α=0.01

统一 LoD 公式(本报告推导,非文献原文)

背景假阳性期望       B = M × ε
LoD(VAF) = [ k + z·√(M·ε) ] / M

区制交界:令两式相等 → M* = k²/(z²·ε) = 1.658/ε

ε M*(informative molecules) 对应 30 ng 下的位点数 N
3×10⁻⁵ 5.5×10⁴ 11
1×10⁻⁵ 1.66×10⁵ 34
1×10⁻⁶ 1.66×10⁶ 339
1.95×10⁻⁸(PhasED-Seq 商用) 8.5×10⁷ 17,300(现实血量下永远到不了)

duplex 的净收益判据(本报告推导):

分子限区: LoD 恶化 r_M 倍            (纯亏)
错误限区: LoD 改善 √(r_ε / r_M) 倍
交叉存在的必要条件: r_ε > r_M

用 Kurtz 的同批实测代入:r_ε = 2.75,r_M = 5.3 → √(2.75/5.3) = 0.72,即反而变差 1.4 倍。这就是同一批 cfDNA 上 duplex 的真实成绩单。

4.2 交叉点解析解

令 a = m_simplex,b = m_duplex:

√N* = 3(a − b) / { 2.33 · [ b·√(a·ε_s) − a·√(b·ε_d) ] }

表 4-1|LoD 算例(30 ng cfDNA,r_M = 4.5,ε_s = 1×10⁻⁵,ε_d = 3×10⁻⁷)

N M_simplex 假阳性期望 M·ε 区制 LoD_simplex M_duplex LoD_duplex duplex 相对表现
16 78,400 0.78 分子限边缘 64.6 ppm 17,440 182 ppm 差 2.8 倍
48 235,200 2.35 过渡 28.0 ppm 52,320 62.9 ppm 差 2.25 倍
200 9.80×10⁵ 9.8 误差限 10.5 ppm 218,000 16.5 ppm 差 1.57 倍
1,000 4.90×10⁶ 49 误差限 3.94 ppm 1.09×10⁶ 3.97 ppm 持平(交叉点 N*=1,032)
5,000 2.45×10⁷ 245 误差限 1.61 ppm 5.45×10⁶ 1.10 ppm 好 1.47 倍
20,000 9.80×10⁷ 980 误差限 0.775 ppm 2.18×10⁷ 0.411 ppm 好 1.89 倍
N→∞ 上限 √(33.3/4.5) = 2.72 倍

模型自检:N=16、50–66 ng 投入下模型给出约 40–65 ppm VAF,Signatera 宣称 0.01% VAF = 100 ppm;N=48 给出 28 ppm,RaDaR 宣称 LOD95 = 11 ppm(20 mL 血,投入更高)。量级吻合。

独立文献锚点(强证据):Newman 2016 在同一体系里报告,iDES-CAPP-Seq 用 30 个突变达到 0.0025%;仅取 duplex 分子可达 0.00025%,但原文明确写"只有在个体化 selector 覆盖 >1,500 个突变时才能实现,原因是双链分子回收率的技术限制"。即:文献自己把交叉点框在 30 与 1,500 之间。我的解析解 N* ≈ 1,032 正落在其中。

表 4-2|交叉点敏感性分析(N* = duplex 开始反超 simplex 的追踪位点数)

A. 常规杂交捕获 duplex(r_M = 4.5,你们目前的化学)

ε_simplex ↓ / ε_duplex → 1.2×10⁻⁵(Kurtz 实测) 1×10⁻⁶(MAESTRO 基线) 3×10⁻⁷(+损伤修复)
3×10⁻⁵(未充分打磨) 无交叉(r_ε=2.5<4.5) 367 222
1×10⁻⁵(iDES 级打磨) 无交叉 3,807 1,032
1×10⁻⁶(深度打磨/INVAR 级) 无交叉 无交叉 无交叉(r_ε=3.3<4.5)

B. 高回收 duplex 化学(r_M = 2,CODEC/链条码/GeneBits 级)

ε_simplex ↓ / ε_duplex → 1.2×10⁻⁵ 1×10⁻⁶ 3×10⁻⁷
3×10⁻⁵ 1,011 15
1×10⁻⁵ 无交叉 111 59
1×10⁻⁶ 无交叉 无交叉 6,640

4.3 从敏感性表读出的三条结论

  1. ε_simplex 是最强的杠杆。你的生信打磨每把 ε_simplex 压低一档,交叉点就往右移一个数量级——从 1×10⁻⁵ 打磨到 1×10⁻⁶,常规 duplex 在任何位点数下都不再有优势(因为 r_ε 跌破 r_M)。换句话说:与其上 duplex,不如先把打磨做到位。
  2. r_M(建库化学)决定交叉点的量级。同样 ε 组合下,r_M 从 4.5 降到 2,交叉点从 1,032 掉到 59,差 17 倍。duplex 值不值,八成取决于你用什么化学做 duplex,而不是要不要做 duplex。
  3. duplex 的收益有硬上限 √(r_ε/r_M)。在最乐观的常规组合下是 2.72 倍,而且要 N > 20,000 才逼近 1.9 倍。这不是一个能改变产品定位的量级。

五、按位点数逐档判断:你的 MRD 该不该上 duplex

位点数档位 30 ng 下 M = N×m 假阳性期望 区制 判断 理由(一句话)
N ≤ 20(Signatera 16、吉因加 ≤20、世和术宁 Ultra 平均 >16) ~10⁵ 0.5–1 分子限 绝不上 duplex LoD 直接恶化 2.5–2.8 倍;Natera 白皮书明写测试后判定 UMI"牺牲灵敏度而不改善特异性",连 UMI 都弃用
N = 21–100(RaDaR 48、Haystack ≤50、Signatera Genome 64、PROPHET 50) 10⁵–5×10⁵ 1–5 过渡 不上(除非用 r_M≤2 的化学) 恶化 1.6–2.3 倍;Haystack 是唯一在此档做 duplex 的,代价是最多 3 管血(竞品 1–2 管),即用血量补分子数
N = 100–1,000 5×10⁵–5×10⁶ 5–50 误差限 临界,先做打磨再谈 duplex 交叉点就在此区间上沿;此档投资回报最高的是把 ε_simplex 从 3×10⁻⁵ 打到 1×10⁻⁵ 以下
N = 1,000–10,000(AccuScan 中位 5,820、MAESTRO ≤10,000) 5×10⁶–5×10⁷ 50–500 误差限 duplex 或等效纠错必需 但注意 AccuScan 用 RCA 串联体单读校正(非 duplex)在此档做到 4.2×10⁻⁷,证明有非 duplex 路径
N > 10,000 / WGS 类(MAESTRO-Pool 22,333、MRD-EDGE、MRDetect) >5×10⁷ >500 深度误差限 必须降噪,但未必是 duplex MRD-EDGE 用深度学习读级降噪(信噪富集 118–301 倍)、MRDetect 用 SVM(21 倍),都不做 duplex 就到了 10⁻⁵–10⁻⁶ TF
de novo / tumor-naive 突变发现(无配对肿瘤,突变签名法) duplex 必需,没有替代 ppmSeq 同批实测:与真实肿瘤三核苷酸谱的余弦相似度,duplex 0.94±0.04 vs strand-agnostic simplex 0.39±0.08,simplex 完全失效

对你们产品线的直接结论:世和术宁 Ultra 走的是"固定 2,365 基因大 panel + 30,000× 深度 + 平均监测 >16 个突变"的路线。监测的是 >16 个突变,不是 2,365 个基因位点——决定区制的是前者。这落在第一档,分子限区,上 duplex 会让 LoD 恶化约 2.5 倍。真正能改善 LoD 的是把"平均监测突变数"从 16 提到 100–200(见第七节路径一)。


六、主流 MRD 产品实际怎么选的(对照表)

产品 追踪位点 N cfDNA 投入 每位点深度 duplex? 声称 LoD LoD 分母口径 判读规则 证据等级
Signatera 16 15,000–20,000 hGE(≈50–66 ng,ng 数为换算) ~100,000× raw 否,且明确弃用 UMI 0.01% VAF 突变分子÷总基因组拷贝 ≥2/16 位点 vendor-doc(滴定表完整,但样本级灵敏度是二项外推的建模值)
Signatera Genome 64 未公开 未公开 未公开(仍 mPCR-NGS) 1 ppm 未定义 未公开 vendor-doc + ASCO 摘要。注:64×20,000 hGE = 1.28×10⁶ 分子-位点,1 ppm 只对应 1.28 个突变分子,低于 3 分子泊松地板——该宣称在分子数上不自洽,须索取其聚合公式
RaDaR / RaDaR ST ≤48(中位 41) 20 mL 血;ng 未公开 未公开 LOD95 = 11 ppm 未定义(未说明输入条件) 未公开 vendor-doc("data on file",无独立分析验证论文
Haystack MRD(Duo) ≤50 最多 3 管血 "每分子读取最多 100 万次" 0.0006% tumor fraction 写 TF 但未给公式 未公开 vendor-doc。此档唯一上 duplex 者,代价是采血量
TwinStrand AML MRD 36 基因/80 kb,非肿瘤知情 2,000 ng gDNA(骨髓/外周血,非 cfDNA) duplex 深度 >54,000× 0.0068–0.0098% VAF;LoB=0 duplex 家族层 VAF 会议海报。2,000 ng 投入正是 duplex 分子损失的代价,不可外推到 20–60 ng cfDNA
MAESTRO / MAESTRO-Pool ≤10,000 / 混池 22,333 20 ng 10,000×/位点(常规 duplex 需 1,000,000×) + 突变富集探针 0.78 ppm 突变 duplex ÷ 总测得分子 动态 caller peer-reviewed
AccuScan(AccuraGen) 中位 5,820(CRC) 10 ng(部分 <5 ng) (单链环化+RCA 串联体单读校正) 10 ppm cVAF @10K markers cVAF(明确) peer-reviewed
MRD-EDGE / MRDetect 全基因组数千–数万 1 mL 血浆,WGS 30–35× 30–35× (深度学习/SVM 读级降噪) TF 1×10⁻⁶ 时 AUC 0.84 / 0.001% TF TF 分类器分数 peer-reviewed
Foresight CLARITY(PhasED-Seq) 相位变异 1–1,816/例 5–120 ng 4,012–21,965× (用 in-cis 相位替代 in-trans 双链) 0.7 ppm = 3.11 个突变分子 @120 ng PVAF = 突变分子÷信息分子(写得最清楚) FPR 0.24% peer-reviewed
NeXT Personal ≤~1,800 2–30 ng(最优 ~15) 未公开 未明示 LoD95 3.45 ppm;LoB 0.719 ppm ppm = 含肿瘤变异共识分子÷覆盖靶点共识分子(本轮唯一写清楚的商业产品) Poisson 检验 peer-reviewed
吉因加体系 ≤20(CRC 中位 10、乳腺 6、肺 7) 30–80 ng ≥80,000× raw 否(UID 正反链分别纠错) 样本级 0.005% ctDNA 分数 / 位点级 0.05% VAF 两级都给了,差 10 倍 ≥2 位点;LoB 0% peer-reviewed(国内唯一有完整分析验证的)
世和 术宁 Ultra 固定 2,365 基因,平均监测 >16 个突变 未公开 30,000× 未公开 "稳定达 0.01%" 未定义 未公开 vendor-doc
燃石 朗微 / 泛生子 洞微 未公开 未公开 未公开 未公开 未公开 未定义 未公开 vendor-doc(无参数)

读表的一条规律上 duplex 的产品全部落在两端——要么位点数上千(MAESTRO),要么投入量极大(TwinStrand 2,000 ng gDNA、Haystack 3 管血)。没有任何一个 50 位点以下、20–60 ng cfDNA 的产品选择 duplex,除了 Haystack,而 Haystack 用采血量补回了分子数。这与第四节的模型完全一致。

同时必须指出:中国厂商(世和、燃石、泛生子)的公开技术参数密度显著低于美国厂商——cfDNA 投入量、分子回收率、是否 duplex、LoD 的分母定义均未公开。国内唯一有同行评议完整分析验证的是吉因加体系。这本身是竞争维度上的一个信息差。


七、比 duplex 更划算的三条路

把所有降噪路径放在同一把尺子上:每条路径对 (r_M, r_ε, reads) 的作用,以及在两个典型工作点的 LoD 改善倍数。

表 7-1|同一把尺子(基线:30 ng,r_M=1,ε=1×10⁻⁵)

路径 对分子产出 f 的影响 对 ε 的影响 对 reads 的影响 N=16 时 LoD 改善 N=1,000 时 LoD 改善 边际成本 证据等级
基线 simplex(UMI+打磨) 1×10⁻⁵ 1.00×(64.6 ppm) 1.00×(3.94 ppm)
① 位点数扩张 N 不变 不变 ∝ N 6.15×(16→200 位点,10.5 ppm) 2.45×(1,000→5,000) reads ×12.5;需 WES/WGS 建基线 TRACERx、AlphaLiquid、INVAR 下采样实测
② 损伤修复(Duplex-Repair/MEDUSA 式) 1.02×(无变化,P=0.258) ÷2.5–4.0 不变 1.23× 1.62× 几个酶,测序量零增加 peer-reviewed,产出持平已定量证明
③ 相位变异(PhasED-Seq) ~1×(PV<20bp 深度≈样本总深度) →8.0×10⁻⁷(doublet)/3.4×10⁻⁸(triplet) 不变 1.41× 2.54× 需 30× WGS 建基线 + 115 kb 专用捕获区 + 专利 peer-reviewed
④ 生信读级降噪(MRD-EDGE/MRDetect 式) 不变 信噪富集 118–301×(MRD-EDGE)/误差降 21×(MRDetect) 不变 纯算法,零试剂成本 peer-reviewed
⑤ MAESTRO 突变富集 捕获效率 35%(常规 57%,略降) 不变 ÷100(1,000,000×→10,000×/位点) 探针重设计 peer-reviewed。它是路径①的成本使能器,不是降噪路径
⑥ duplex(常规杂交捕获) ÷4.5 ÷2.75–33 ×2–40(需 family size≥4;CODEC 实测常规 duplex 需 600 read pairs/靶点才起步) 0.36×(恶化 2.8 倍) 0.99×(持平) 试剂 + 测序量 见第二、三节

7.1 路径一:位点数扩张——最便宜、最确定

从 16 提到 200 个追踪位点,LoD 改善 6.15 倍(64.6→10.5 ppm),比 duplex 在任何位点数下的理论上限(2.72 倍)都高一倍多。而且这是分子限区的线性收益(LoD ∝ 1/N),不需要改任何化学。

7.2 路径二:损伤修复——性价比第一,且不必配 duplex

7.3 路径三:相位变异(PhasED-Seq)——绕开 duplex 的分子税

7.4 如果一定要上 duplex:唯一正确的做法

不要上常规杂交捕获 duplex(r_M=4.5)。要上就上 r_M ≤ 2 的化学——物理连锁型(CODEC 的四联体接头、ppmSeq 的同 bead 双链、链条码型 CompDuplex-seq/VISTA-seq)。理由见表 4-2B:r_M 从 4.5 降到 2,交叉点从 1,032 掉到 59,等于把 duplex 的适用位点数下探了 17 倍。

同时要清楚各自的硬限制:ppmSeq 因依赖氢键把两链带入同一乳滴,不兼容杂交捕获,只能做 WGS;NanoSeq 的瓶颈化(稀释最多 10,000 倍)是用分子总数换 reads 效率,对 LoD 是净负;CODEC 在 cfDNA 上的 on-target 只有 28.8%(一轮)/71.2%(两轮),显著低于常规 duplex 的 89.0%/99.2%。


八、证据强度:哪些是实测、哪些是我推的、哪些没查到

8.1 实测(同行评议,已核实到原文)

数字 来源 备注
duplex 回收 19% unique cfDNA fragments Kurtz 2021,12 例健康人 cfDNA 本报告 r_M 的主依据
iDES 3.3×10⁻⁵ vs duplex 1.2×10⁻⁵,同批 Kurtz 2021 分母(per base? per molecule?)正文未写明——这是本报告最重要的一处"未定义"
GeneBits 同一文库 DC 相对 MC 错误率 ÷2.7,读深 −50% Broche 2025 唯一的严格同库三模式对照
duplex 分子配对率 15–47% Wang 2019 分母=期望 DCS(=cov_SSCS/2)
iDES 完整 1.5×10⁻⁵,改善 15 倍 Newman 2016 是位点黑名单剔除后的条件均值
Newman:duplex 达 0.00025% 需 >1,500 位点 selector Newman 2016 交叉点的独立文献锚点
MEDUSA duplex 产出 1.02 倍(0.33–1.46,P=0.258) Clin Chem 2026 损伤修复不减产出的正式证明
Duplex-Repair ε 降 2.5/4.0/4.0 倍 NAR 2022 三类样本
ppmSeq de novo:duplex 0.94 vs simplex 0.39 余弦相似度 Cheng 2025(preprint),n=4 duplex 不可替代的唯一硬场景
MAESTRO 少 100 倍 reads(10⁶×→10⁴×/位点) Nat Biomed Eng 2022 分母是每位点 raw 深度,非分子产出
Foresight LoD95 = 3.11 分子 = 0.7 ppm @120 ng,4×10⁶ informative molecules Oncotarget 2025 分子限区的教科书锚点;PVAF=0 那一档 N=4 不是 10
Signatera 白皮书明写弃用 UMI Natera vendor-doc 原文:"sacrifice sensitivity without improving specificity"

8.2 本报告的推导(未在任何检索到的文献中以此形式出现,使用前请独立复核)

  1. 统一 LoD 公式 LoD = [k + z√(Mε)]/M,以及两区制的极限形式。
  2. 交叉点解析解 M* = k²/(z²ε)√N* = 3(a−b)/{2.33[b√(aε_s) − a√(bε_d)]}
  3. duplex 净收益判据 √(r_ε/r_M),以及"交叉存在的必要条件 r_ε > r_M"。
  4. 表 4-1 与 4-2 的全部数值(基于 C=0.60、f_SSCS=0.90、f_DCS=0.20、k=3、z=2.33、303 GE/ng 的假设)。
  5. "N ≤ 20 时 duplex 恶化 2.5–2.8 倍"这一结论。
  6. ssDNA 建库与 duplex consensus 互斥(第一节)——机制推断,本轮未做专门文献核查。

参数敏感性提示:k 从 3 改到 2 或 5、z 从 2.33 改到 1.64(P<0.05),交叉点会移动 2–3 倍,但区制的定性划分和"N≤50 时 duplex 净亏"的结论不变,因为那由 r_M 单独决定。GE 常数 303 与 330 之间还有 9% 的不一致(不同论文取值不同)。

8.3 被核查推翻、已在本文更正的流行数字

流行说法 实际情况
"CODEC 证明 duplex 比 simplex 好 234 倍" 234 倍的分母是裸 SSC(同批 reads 的单链共识),且 CODEC 不是常规 duplex;常规 duplex 对 SSC 约 158 倍。不能用来论证 duplex 对现代打磨 simplex 的优势
"SaferSeqS 同库 duplex 比 simplex 好 >100 倍" >100 倍是跨方法(对 SafeSeqS 旧法)比较。真正的同库对照是 6.03×10⁻⁶ vs <2.80×10⁻⁷,约 >21 倍,且路线是多重 PCR
"GeneBits duplex 比 simplex 错误率低 5–10 倍" 那组 SC 数字来自 IDT/Twist 竞品流程,非同工具。同工具比较只有 2.7 倍(DC vs MC)
"CODEC 成本比 duplex 低 87 倍" 对照组的 duplex WGS 在标准阈值(每链 ≥2 reads)下回收不到任何 duplex,作者被迫放宽到每链 1 read 才做出这个比较
"常规 duplex 需 600 read pairs/靶点才起步,所以 duplex 成本高" 原文紧接着写"测序量充足时常规 duplex 反而回收到更多独特 duplex"。600 倍描述的是起步门槛,不是渐近产出
"ppmSeq 分子利用率 44%,是常规 duplex 的 9 倍" 44% 的分母是 total bases sequenced(分母 C),是测序效率不是分子利用率。同口径下常规 5–11%
"Signatera 分析验证实测 0.01% 处样本级灵敏度 98.5–100%" 是从位点级数据按二项概率外推的建模值,假设 panel 含 10–16 个克隆变异;表中 n 是数据点数不是独立样本数

8.4 没查到 / 没能核实(诚实披露)

  1. 【最大缺口】没有任何一项在同一批临床 MRD 血浆样本上、以 MRD 阳性检出率或复发预测为终点,直接比较 duplex 与 simplex 的研究。全部 6 项头对头证据都停留在体外稀释系列与错误率代理指标。duplex 的临床增益从未被同批直接证明过。这本身应作为结论向决策层陈述。
  2. 【第二大缺口】没有任何正式的 duplex vs simplex 成本-效果学论文。可用的只有 CODEC 的"87 倍"(分母未定义、对照组被放宽阈值)、ppmSeq 的"需 100 倍超测序"、以及一份 Revvity 厂商博客声称的"duplex 成本 +2–4 倍"(该页返回 HTTP 403,未能核对原文)。
  3. INVAR(Sci Transl Med 2020)全文三条获取路径全部失败(science.org 403、bioRxiv Cloudflare 限流、Europe PMC 无 OA 版本)。"IR = hGA × loci"与"LOD = 1/IR"这一整条标度理论主干,本轮未能直接核实,本文仅将其作为与 Chabon 2020 二项式定义相互印证的旁证使用,模型本身不依赖它。
  4. Kurtz 2021 的 3.3×10⁻⁵ / 1.2×10⁻⁵ 的分母正文未写明。这是本报告最重要的一处"未定义"——它直接决定了 r_ε=2.75 这个核心数字能否与 per-base 的错误率并列。需查 Fig 4b 轴标或 Supplementary Methods。
  5. SEQC2 的 ctDNA 多平台横评数据未取到——那可能是唯一能提供"同批参考品、多平台、含 duplex 与非 duplex"对照的公开资源。
  6. SMaHT Network 2025-12 的六种 duplex 方法同批横评预印本被 Cloudflare 限流,具体 recovery/error/cost 数值未取到(该文不含 cfDNA,也不含 simplex 对照)。
  7. SinoDuplex(国内唯一公开的 cfDNA duplex 方法)未报告任何 DCS vs SSCS 同库错误率对照,也未报告分母化的 duplex 回收率。中国本土 duplex 实施的真实回收率数据完全缺失。
  8. 世和术宁 Ultra 的"稳定达 0.01%"未标明单位口径(丰度/VAF/tumor fraction),未公开 cfDNA 投入量、是否 duplex、ATG-seq 三重降噪的具体机制。燃石朗微、泛生子洞微无任何公开技术参数。
  9. cfDNA 场景下几乎所有方法(PhasED-Seq、INVAR、GeneBits、SinoDuplex、ppmSeq-cfDNA 模式)都未使用 UDG/Fpg 损伤修复,因此其错误率数字均包含未修复的氧化与脱氨损伤成分。跨研究比较错误率时这是一个未对齐的变量。

8.5 全文口径纪律


一句话回答

duplex 使可判读分子减少 4–5.3 倍(杂交捕获 cfDNA 口径),换来对现代打磨 simplex 仅 2.7–2.8 倍的错误率优势(同批实测)。在 16–50 个追踪位点的分子限区,这是净亏 1.6–2.8 倍;交叉点在约 1,000 个位点(ε_simplex=10⁻⁵、r_M=4.5),若把 simplex 打磨做到 10⁻⁶,常规 duplex 在任何位点数下都不再有优势。你们该投的三件事按性价比排序是:损伤修复酶(ε÷2.5–4,产出零损失,测序量零增加)、把平均监测突变数从 16 提到 100–200(LoD 改善 6 倍)、生信位点特异打磨;duplex 排在这三件之后,且要上就必须上 r_M≤2 的高回收化学。唯一没有替代的 duplex 场景是无配对肿瘤的 de novo 突变发现——那里 simplex 的突变谱余弦相似度只有 0.39,完全失效。


用时约 4 分钟 | 本轮约 68,000 tokens(含调研与核查上下文)