摘要:"AI预测cfDNA得率与片段完整性"目前处于论文验证为主、早期商用萌芽、规模化产品缺位的阶段。片段完整性一侧已形成可复用的AI方法学:公开研究中,整合cfDNA甲基化与片段大小谱的深度学习模型在肺癌诊断中达到AUC 0.87(142例肺癌+56例健康对照验证)[2];南京医科大学团队的多癌早检(MCED)模型在1,465人独立验证集上实现敏感性87.4%、特异性97.8%(覆盖13癌种,2025年5月《Nature Medicine》)[3];开源侧已有PEdictor等MIT协议的片段组学机器学习全流程(片段长度分布、末端基序、K-mer特征+堆叠分类器)可直接复用[4]。得率预测一侧则明显薄弱:公开证据表明cfDNA得率主要由采血管类型、采样至血浆分离时间等临床前因素决定(23名个体649份血浆样本的系统评估)[1],业界解法以流程标准化与规则化质控为主,尚未见可商用的得率预测AI产品(本期公开信息不足)。商用形态方面,国内世和基因2026年6月发布"序语Fragmentia-AI"液体活检DNA大语言模型(自媒体与厂商宣称口径,未获同行评议公开数据佐证)[6],海外CD Genomics等提供含DELFI评分、ichorCNA等机器学习输出的cfDNA片段组学外包分析服务(6–10周交付,科研用)[5]。对分子实验室的现实启示:短期可落地的是把片段完整性QC指标(众数片段大小~167 bp、ΔS150、末端基序多样性)嵌入自建LIMS流程,得率管理应优先投资流程标准化而非AI。
| 场景 | 预测目标 | 成熟度 | 代表证据 |
|---|---|---|---|
| 片段完整性/片段组学判读(肿瘤检测、组织溯源) | 从片段大小分布、末端基序、核小体足迹等特征判别疾病信号与组织来源 | 论文验证充分,早期商用 | 肺癌诊断深度学习模型AUC 0.87[2];MCED模型独立验证敏感性87.4%/特异性97.8%[3];CD Genomics外包服务已商用[5] |
| cfDNA得率预测(提取前预判) | 由样本信息(采血管、放置时间、溶血等)预判提取得率 | 未规模化,公开信息不足 | 系统研究证实得率由临床前因素决定[1];未见商业化预测产品(本报告检索范围内未确认) |
| 质控阈值自动判读(投入量、片段众数、比对率) | 文库是否可进入下游的自动化QC判定 | 早期商用(嵌入分析服务/LIMS) | 商用报告含投入量≥5 ng、众数片段~167 bp等QC阈值与ML整合评分[5] |
| 大模型驱动的液体活检平台 | 突变+片段组学双维度信号、肿瘤负荷评估 | 宣称阶段(国内厂商) | 世和基因"序语Fragmentia-AI"(2026-06发布,厂商宣称/自媒体转引,同行评议公开数据未确认)[6] |
当前公开文献中的cfDNA AI模型可归纳为三条技术路线:(1)特征工程+集成学习路线——以片段长度分布(100–500 bp)、短/长片段比、全基因组CNV、4-bp末端基序频率、3–9 bp K-mer频谱为特征,经LASSO与TURF特征选择后送入SVM/随机森林/XGBoost/MLP堆叠分类器,并以SHAP做可解释性(PEdictor开源实现,子痫前期风险预测场景)[4];(2)多组学深度学习融合路线——甲基化谱(366个标志物靶向EM-seq panel)与片段大小谱联合输入深度网络,肺癌判别AUC 0.87、准确率81.5%,1%肿瘤占比下特异性98%[2];(3)低覆盖WGS多维特征MCED路线——无PCR低覆盖全基因组测序提取基因组+片段组学多维特征,DOC(检测)与TOO(溯源)双分类器架构,1,465人独立验证敏感性87.4%/特异性97.8%,I期敏感性79.3%,组织溯源TOP1准确率83.5%[3]。值得注意,片段"完整性"在该体系中不是被预测的对象,而是作为输入特征参与预测——这是对该选题的一个关键认知修正。
得率预测一侧的公开方法学基础是临床前因素的系统量化:瑞典团队对23名健康个体、649份血浆样本、四种采血管(含K2EDTA与Streck保护管)的评估表明,cfDNA产量同时取决于采血管类型与采样至血浆分离的时间间隔(K2EDTA需立即分离,Streck管一周内均可保持高得率),污染性细胞DNA难以常规检出[1]。这类结论结构化后即构成"得率风险预测"的规则基础,但将其升级为机器学习产品的公开案例未确认。
| 类别 | 名称 / 厂商 | 形态与要点 | 来源可靠性 |
|---|---|---|---|
| 开源 | PEdictor(GitHub,MIT协议) | cfDNA片段组学全流程Python代码(特征提取01–04、特征选择05–06、堆叠分类器07),输入WGS BAM,2025-12发布;面向子痫前期预测,方法可迁移 | ★高[4] |
| 商用(外包服务) | CD Genomics cfDNA Fragmentomics (Low-Pass WGS) Service | 科研用途外包:DELFI评分、EXCEL N-index、ichorCNA肿瘤分数(≥3%可信)等机器学习输出+QC阈值体系,50–100样本5–6×深度6–10周交付 | ★中[5] |
| 商用(国内厂商宣称) | 世和基因"序语大模型 Fragmentia-AI™" | 宣称全球首款液体活检DNA大语言模型(2026-06发布),与ATG-seq突变检测互补,支撑鹰眼CanScan多癌早筛(宣称获欧盟CE与FDA突破性设备认定);以上均为厂商/自媒体宣称,同行评议公开数据未确认 | ★低(媒体转引)[6] |
| 自研参考(机构) | 南京医科大学MCED模型 | 研究型自研,未见独立商品化定价;配套金陵研究前瞻队列(计划15,000人) | ★高[3] |
| 相邻数字化产品(渠道在售) | Azenta Limfinity® 生物样本库LIMS、FreezerPro® 冰箱库存管理、Limfinity® 细胞系LIMS(ebaiao.cn渠道) | 样本库数字化基础设施,可承载cfDNA样本元数据与QC记录,但不含cfDNA预测AI功能;均询价制 | ★高[7] |
本期检索的ebaiao.cn商城352个SKU快照(2026-08-27)中,实验软件类仅5个SKU(均为Azenta样本库/存储类),未命中任何cfDNA预测AI类软件。
该细分场景的定价公开信息严重不足:PEdictor类开源工具免费(本地部署,自付算力与人力)[4];CD Genomics外包服务按项目报价,公开页面未给出单价,仅可确认交付周期6–10周[5];世和基因Fragmentia-AI为嵌入自身检测产品线的底层平台,不独立销售,定价未确认[6];渠道在售LIMS类产品均为询价制[7]。整体判断:当前不存在可"按license采购"的cfDNA得率/完整性预测软件商品,获取路径只有三条——开源代码自建、外包服务打包、或与检测厂商共建,采购部门短期内无法将其纳入标准比价流程。
三点风险需要提示:(1)训练数据偏差。公开模型多用病例对照设计(如142+56例[2]),在无症状人群中的表现会显著衰减——MCED模型在无症状队列(金陵研究中期分析3,724人)敏感性降至53.5%、PPV仅25.0%[3],直接外推到体检筛查场景会高估能力。(2)QC阈值的黑箱化。商用报告以95–98%特异性参考人群设定ML评分阈值,阈值人群构成不透明,跨实验室复用需重新校准[5]。(3)宣称与证据的落差。国内大模型类发布多以自媒体与厂商口径传播(如Fragmentia-AI),缺同行评议公开数据,采购或合作决策前应要求提供验证集构成、预设阈值与失败案例[6]。此外cfDNA数据的基因组隐私属性使其在跨境云部署上受数据出境合规约束,本地化部署应为国内机构默认选项。
现实影响集中在质控岗而非操作岗:片段完整性判读(电泳图/片段分布人工读图)是分子实验室技术员每天重复的判断工作,ML评分(DELFI分、N-index、众数片段大小)可替代其中约一半的"读图+判定"工时(经验估计,非实证数据);而cfDNA提取操作本身(上样、上机)的自动化替代来自磁棒式提取仪等硬件(见同日期栏目B报告),不来自AI。得率预测若落地,价值形态是"拒收预警"(对预计低得率样本提前提示复采),减少的是重提取与重测序的返工成本,而非人力。结论:该AI方向是质控增强器,不是人力替代器。
对以NGS建库、克隆、qPCR为主业的分子实验室,最直接的可执行动作是把片段完整性QC数字化:以开源PEdictor的特征提取脚本(片段长度分布、末端基序、K-mer)改造为本地QC管道,配合Azenta Limfinity类样本库LIMS(渠道在售)沉淀每个样本的元数据(采血管类型、分离时间、得率、片段众数),半年即可积累出本单位自己的"得率影响因素"数据集——这是未来任何商用预测模型落地前唯一可自建的数据资产。对蛋白组学实验室,cfDNA片段组学与蛋白组联合的多组学早筛(cfDNA信号+血浆蛋白标志物)是当前液体活检的明确融合方向,提早布局样本层面的双组学留存(同一血浆样本分轨提取cfDNA与蛋白)具有前瞻价值。预算角度:现阶段不必为"AI预测"专项采购,开源工具+LIMS的组合即可覆盖80%现实需求。
说明:本期公开信息不足以支撑"AI预测cfDNA得率"的商用化结论,相关判断已按规范缩小为"未见规模化产品";世和基因Fragmentia-AI相关能力表述均标注厂商宣称/自媒体转引。未能确认的数据点:Fragmentia-AI的同行评议性能数据、CD Genomics服务单价、国内厂商cfDNA预测类软件的注册/备案情况、ebaiao渠道软件类SKU的实际成交价。注:来源[8]为综述性补充材料,未用于支撑定量结论。