生命科学产品调研 · 栏目 C|AI 应用与数字化
栏目C|大模型辅助RNA实验设计助手
主题:大语言模型/生成式AI辅助分子生物学与蛋白质学实验室的 RNA 相关实验设计——qPCR 引物与探针设计、siRNA/shRNA 设计、sgRNA 设计(限 RNA 底物编辑如 Cas13)、体外转录(IVT)与 UTR 序列设计、RNA 二级结构预测(传统算法 vs RNA 语言模型)、Ribo-seq/单细胞 RNA 数据分析对话助手、对话式实验方案生成助手|调研日期:2026-09-20|范围:严格限定"拿到序列/靶点之前怎么设计实验"这一前端环节;不写 mRNA 疫苗商业化生产、不写临床诊断、不写通用办公 AI|作者:中生柏奥。错位声明:2026-09-14 栏目 C 已做完无纸化记录与 AI 辅助审计追踪、09-16 已做微量检测数据自动判读、09-17 已做多批次 QC 趋势分析、09-18 已做无酶合规监测、09-19 已做运输条件预测与稳定性建模——上述五篇的落点均在"数据后端/监测/合规/预测";本篇写的是"实验设计前端",即实验还没有开始、序列还没有定稿之前的 AI 辅助,与已发主题方向相反、无内容重叠。核心区别:本篇主语是"从靶点到实验方案的设计生成"。
摘要
大模型辅助 RNA 实验设计的主轴,是回答"从靶点序列到可执行的实验方案,AI 到底落地了没有"。分层结论:传统算法层(Primer3/Primer-BLAST、ViennaRNA、Cas13design 打分模型)已规模化成熟且免费;深度学习与 RNA 语言模型层(RiNALMo 650M 参数、RhoFold+、BEACON 基准等)论文密集、开源可得,但需自担算力与验证;LLM 多智能体助手层落地最快的样本是华大系 PrimeGen(GPT-4o 调度四智能体做扩增子引物面板,131 重 SARS-CoV-2 面板覆盖度 98.7% 对传统 91.2%,GPLv3 开源,Nature Biomedical Engineering 2025),单细胞侧 CellAgent(任务完成率 92%)与 CellWhisperer(NBT 2025 对话式解读)处于论文验证向早期商用过渡。国内商用侧衍因智研云宣称 AI 引物/CRISPR 设计嵌入 ELN(学术版免费、专业版按需报价,厂商宣称)。通用大模型独立设计引物已被综述证伪——GPT-3.5/4 可算 Tm/GC 但准确性不足、不适合独立用于引物设计,幻觉序列是头号风险。
传统算法:规模化Primer-BLAST(NIH 官方免费,Primer3+BLAST)
[6]、Cas13design(NYGC Sanjana 实验室,tiling 筛选数据训练打分,免费开源)
[4]、ViennaRNA/RNAfold 类热力学算法仍是基线
[2]
RNA 语言模型:论文密集RiNALMo 650M 参数、3600 万条 ncRNA 预训练、Apache 2.0 开源(GitHub 175 stars)
[3];BEACON 基准评估 13 种工具,RNA-FM 等基础模型显著优于热力学基线
[5]
LLM 多智能体:落地最快样本PrimeGen(华大系 MGI,NBE 2025):GPT-4o+检索/引物/协议/实验四智能体闭环,GPLv3 开源
[7];CellAgent 单细胞分析任务完成率 92%(GPT-4 直用两倍以上)
[8]
商用软件带价格SnapGene 中国区学术 ¥3,176/年起、商业 ¥16,742/年起、永久 ¥104,350
[9];Geneious Prime 中国区个人商业 ¥19,509/年、学术 ¥5,625/年
[10]
渠道现实ebaiao.cn 渠道内该品类无直接在售型号;实验软件类仅 5 个 SKU(均为 Azenta 数字化基础层)+莫纳定制开发,全部询价制
[16]
一、应用场景与成熟度分级
本场景的技术结构是一条"设计漏斗":① 输入靶点(基因、转录本、蛋白);② 序列层面的计算设计(引物/探针/siRNA/sgRNA/UTR);③ 结构与特异性校验(二级结构、脱靶、二聚体);④ 实验方案组装(体系、步骤、仪器脚本)。四个环节的 AI 成熟度差异极大:第②环的传统算法已规模化二十年,深度学习在该环是"增量改进";第④环的 LLM 多智能体是 2024–2025 年论文爆发的方向,但"对话式方案生成助手"作为独立商用产品仍凤毛麟角。按栏目主轴如实分级如下。
| 场景 | 成熟度 | 证据与代表 |
| qPCR 引物与探针设计(传统算法) |
规模化 |
NIH 官方 Primer-BLAST(Primer3 引物设计+BLAST 特异性检验)是免费公共在线工具,二十余年事实标准[6];综述盘点该环的工具生态还包括 QuantPrime(qPCR 专用,SYBR Green/TaqMan)、Primer3、OligoAnalyzer(二聚体/结构校验)等,均为免费或学术工具[1]。AI 在此环的增量是树模型(LGBM 等)优选参数,BioInnovate AI 平台宣称 LGBM 达 AUC 0.97、设计时间缩短约 90%(厂商/论文口径)[1]。 |
| qPCR 引物设计(机器学习/LLM 增量) |
论文验证为主 |
一篇发表于 Biomedical Instrumentation 的综述系统评估后给出明确负面结论:LLM(GPT-3.5/GPT-4)可计算 Tm/GC 但预测准确性不佳,不适合独立用于引物设计;Tm 预测的可靠路线是用 157 个合格探针数据训练的专用模型、或蛋白质语言模型嵌入+ANN 回归(预测与实测 Tm 相关系数 0.89)[1]。另一路是 LLM 做"调度器"而非"设计器"——见下文 PrimeGen,其引物智能体把 LLM 用在候选优化与协调上,设计规则仍由经典损失函数(二聚体率+BLAST 评分)约束[7]。 |
| siRNA/shRNA 设计 |
论文/专用算法,商用前沿在药企 |
经典工具(siDirect 等)基于经验规则规模化多年(二手综述转述)[13]。生成式 AI 前沿在药企合作层面:2026 年 6 月 Alnylam 与 Inceptive(Transformer 论文共同作者 Jakob Uszkoreit 联合创办,累计融资约 1.2 亿美元)签署总价值高达 20 亿美元(含里程碑)的战略合作、首付款 3,000 万美元(现金+股权),用生成式 AI 做 siRNA 靶 mRNA 建模与序列空间探索——注意这是 RNAi 药物发现层,离常规实验室"选一条 siRNA 做敲低"仍有距离,且关键量化指标均为公司口径、未公开细节[12]。 |
| sgRNA 设计(限 RNA 底物编辑:Cas13 系) |
打分工具规模化 生成式前沿论文 |
纽约基因组中心 Sanjana 实验室的 Cas13design 是代表性免费工具:gRNA 打分与四分位基于大规模并行 Cas13 tiling 筛选数据训练(v0.3 起用 4 套 tiling 数据集),覆盖人/小鼠/斑马鱼/果蝇/线虫/拟南芥及 SARS-CoV-2 等病毒基因组,源码开源于 GitLab[4]。生成式前沿:Nature Biotechnology 2024 年发表"模型指导生成人工 Cas13a gRNA 文库"(以搜索摘要为准,间接来源)[15];arXiv 综述系统梳理了 AI 预测 gRNA 活性与脱靶安全的可解释模型路线[14]。 |
| 体外转录(IVT)与 UTR 序列设计 |
论文验证 |
深度学习优化 5′UTR 以提升 mRNA 递送基因编辑效率的研究已发表于同行评审渠道(PMC 收录)[17];UTR-Insight(BMC Genomics 2025)将深度学习整合进 5′UTR 发现与设计流程[18]。IVT 反应体系本身的 AI 优化多为高通量算法实验设计(DoE)层面的方法学论文,尚未见独立商用"IVT 体系设计助手"产品(未确认)。按本篇范围口径:只覆盖实验设计层的序列/体系设计,不涉 mRNA 疫苗商业化生产。 |
| RNA 结构与二级结构预测 |
深度学习超越传统、但工程落地需自建 |
传统基线:RNAfold(Zuker 动态规划)、ViennaRNA/RNAstructure 热力学算法、CONTRAfold 学习类模型(EternaBench 显示 CONTRAfold2 等学习类已优于纯热力学)[2]。语言模型一代:RNA-FM(23.7 亿条 ncRNA 预训练)、RiNALMo(650M 参数、3600 万条序列预训练、Nature Communications 2025 期刊版,Apache 2.0)[3]、RhoFold+(RNA-FM 嵌入+几何学习,RNA-Puzzles/CASP15 居前)、RibonanzaNet、StructRFM(2025)等(综述盘点)[2]。BEACON 基准评估 13 种工具,RNA-FM 等基础模型显著占优;但 CASP16 提示长程相互作用仍是短板,且 PDB 中 RNA 结构数据仅约为序列数据的 1/25——数据稀缺是硬约束[5][2]。对实验室的意义:设计 snoRNA/核酶/IVT 模板时可用其排除易折叠出错的区段,但全部是本地开源模型、无 SaaS 产品化(未确认存在)。 |
| Ribo-seq/单细胞 RNA 数据分析对话助手 |
论文验证→早期商用 |
CellAgent(arXiv 2024):GPT-4 多智能体(Planner/Executor/Evaluator)全自动执行 scRNA-seq 预处理、批次校正、注释与轨迹推断,50 余个数据集基准上任务完成率 92%、约为直接用 GPT-4 的两倍以上[8]。CellWhisperer(Nature Biotechnology 2025,维也纳医科大学):CLIP 式多模态对比学习(Geneformer+BioBERT)联结转录组与文本、开放权重 LLM 答题,零样本细胞类型预测 AUROC 约 0.94,已集成进 CELLxGENE;作者自评"概念验证、补充而非替代可视化与编程分析"(二手转述)[11]。国内 LLM 智能体(如 CompBioAgent)亦有论文级探索(媒体转引,未逐条核验)[19]。 |
| 对话式实验方案生成助手(通用层) |
评测基准+论文,商用未规模化 |
BioPlanner(EMNLP 2023):把自然语言实验协议转成伪代码并自动评测 LLM 方案规划能力,是该方向的标志性评测工作——它本身就是对"LLM 能不能生成靠谱方案"的审慎检验而非产品宣传[9]。PrimeGen 的协议智能体用 RAG 把实验步骤转成液体处理机器人脚本,首次打通"靶标检索→引物设计→协议生成→机器人执行"闭环[7]。国内商用侧衍因智研云(上海衍因科技)宣称"1+3+N"平台内嵌 AI 智能体(灵研),覆盖 CRISPR 设计、文献翻译、实验总结等与样品/实验数据联动的工作流(厂商宣称)[13]。作为独立SKU、可公开核价的"对话式 RNA 实验设计助手"产品,本期未检索到(未确认)。 |
一句话回答主轴(AI 到底落地了没有):"设计"这一前端环节里,确定性计算(Primer3/BLAST、tiling 数据打分、热力学折叠)是规模化落地层;深度学习在 RNA 结构与 UTR/gRNA 活性预测上已有同行评审证据、但以开源模型形态存在,需自建算力与验证流程;LLM 的正确位置被最新证据钉死在"编排者+协议转换器"——PrimeGen 证明 LLM 调度四智能体能产生可测量的增益(131 重面板覆盖度 98.7% vs 传统 ARTIC v5.3.2 的 91.2%)[7],而让通用聊天模型独立给出引物序列已被综述证伪[1]。"对话式 RNA 实验设计助手"作为独立商用产品的规模化落地,本期公开证据不足。
二、模型与算法路线
- 启发式+热力学算法(现状基线,二十年打磨):引物侧 Primer3 参数化设计+BLAST 特异性回检(Primer-BLAST 打包为 NIH 免费公共服务)[6];结构侧 RNAfold/ViennaRNA、NUPACK 类最小自由能热力学模型;RNAi 侧 Tm/二聚体经验规则。优点是确定性、可解释、可写进 SOP;局限是对复杂折叠(假结、长程作用)与活性预测乏力,需要人工排除易折叠区段[2]。采购与选型的默认起点仍应是这一层。
- 数据驱动打分模型(高通量筛选数据+ML):Cas13design 的路线是代表——先做大规模并行 tiling 筛选拿到 gRNA 活性真值,再用监督学习训练打分器、随数据积累升级模型(v0.3 用 4 套 tiling 数据集)[4]。这一路线的本质是"用实验数据换预测能力",对 RNA 活性这类没有清晰热力学解析式的问题特别有效,也是实验室自建 siRNA/gRNA 打分时可复制的范式。
- RNA 语言模型(基础模型一代,2022–2025):RNA-FM(RNAcentral 23.7 亿条预训练、12 层双向 Transformer)→ RhoFold+(语言模型嵌入+几何深度学习做 3D 结构,RNA-Puzzles/CASP15 居前)→ RiNALMo(650M 参数、3600 万条 ncRNA、Apache 2.0,期刊版 Nature Communications 2025)→ RibonanzaNet、StructRFM(约 2100 万对结构-序列配对)与生成式扩散模型(RNADiffFold、DynaRNA)[2][3]。BEACON(2024)对 13 种工具的系统评估显示基础模型显著优于热力学基线,但跨分布泛化(未见 RNA 家族)仍易失效、CASP16 提示长程作用短板,RNA 结构数据仅约序列数据的 1/25 是根本瓶颈[5]。部署形态清一色开源权重+本地 GPU,无公开核价的 SaaS。
- 通用 LLM+RAG/多智能体(编排层,2024–2025 主流增量):PrimeGen 用 GPT-4o 做核心控制器,调度检索智能体(OMIM/NCBI 找靶序列)、引物智能体(40bp 滑窗"候选滚雪球"生成+二聚体率/BLAST 评分损失函数,LLM 当优化器)、协议智能体(RAG 把步骤转成液体处理机器人 Python 脚本)、实验智能体(Qwen2-VL+三摄像头实时查错)[7]。CellAgent 用 Planner/Executor/Evaluator 三角色+GPT-4V 自动评图迭代[8]。路线共识正在形成:LLM 不直接产序列,而是负责检索、调度、协议转换与多轮优化——这与"LLM 独立设计引物不可靠"的综述结论互为印证[1]。BioPlanner 的评测框架(自然语言→伪代码协议、自动打分)可作为实验室验收任何"AI 方案生成"能力的现成考卷[9]。
- 生成式序列设计(前沿,距离常规实验室最远):Inceptive 的端到端基础模型(序列+功能+结构异构数据训练、宣称零样本/少样本适应新靶点)已获 Alnylam 20 亿美元级合作背书,但公开量化指标缺失、全部为公司口径[12];学术侧华中农业大学 PlantGFM(Hyena 长序列算子、12 种植物 108 亿碱基预训练)从头生成 3,000 条候选基因序列、7 条进本氏烟草瞬时表达、全部被转录为 RNA、2 条实现稳定蛋白表达(Advanced Science),是国内"AI 生成序列→湿实验全链条验证"的代表案例(注意:其对象是基因序列设计,含 RNA-seq/RT-qPCR 验证环节,作为方法学参照引用)[20]。
三、产品与厂商清单(开源 / 商用 / 自研 / 渠道)
| 类别 | 产品与厂商 | 说明 |
| 开源·学术工具(序列设计层) |
Primer-BLAST(NIH/NLM 官方);Primer3、QuantPrime、OligoAnalyzer 类(综述盘点)[1];Cas13design(纽约基因组中心 Sanjana Lab,GitLab 开源)[4] |
免费网页工具+开源代码,是绝大多数分子实验室今天实际在用的"设计助手"。零授权费,但无商用支持、无实验记录联动;特异性与结构校验靠多个工具人工串联[6]。 |
| 开源·RNA 语言模型 |
RiNALMo(代码 Apache 2.0、权重 CC BY 4.0,giga 650M/mega 150M/micro 35M,GitHub 175 stars)[3];RNA-FM、RhoFold+、RibonanzaNet 等(综述与 BEACON 基准盘点)[2][5] |
研究用基础模型:推理需本地 GPU,验证由用户负责。适合做序列先验(排除易错误折叠区段、嵌入特征给下游打分器),不是拿来即用的设计软件。 |
| 开源·LLM 多智能体(闭环自动化) |
PrimeGen(华大系 MGI Tech+中国科学院大学等 20 余位作者,Nature Biomedical Engineering 2025,代码 GPLv3 开源:GitHub melobio/primegen)[7];CellAgent(arXiv 2024,GPT-4 驱动,项目站 agent4science.cn)[8];BioPlanner(EMNLP 2023 评测框架)[9] |
PrimeGen 是目前"LLM 辅助引物面板设计"证据等级最高的开源系统(附 5,495 种细菌基因组参考库);CellAgent 是 scRNA-seq 分析自动化代表;BioPlanner 提供方案生成的现成评测方法。 |
| 商用·国际序列设计软件(带公开价格) |
SnapGene(中国区官网直供简体中文界面);Geneious Prime(Dotmatics 旗下,中国区授权:上海卡贝信息) |
分子克隆/引物设计/序列比对的桌面标杆,属"传统设计软件+数字化"层而非 LLM 产品;价格见第四节(中国区公开价目)[9][10]。 |
| 商用·国内 AI 科研协作平台 |
衍因智研云(上海衍因科技):"1+3+N"架构——智研分子(智能分子克隆、AI 自动引物设计)、智研笔记(ELN)、实验室管理(ELN+LIMS+设备管理)、AI 智能体"灵研"(宣称覆盖 CRISPR 设计、文献翻译、实验总结等) |
宣称学术版免费开放、专业版/企业版按需报价;宣称已服务超 80 家企业、385 所高校、215 家科研院所;卖点为数据境内存储合规与 AI 与科研数据联动(以上均为厂商宣称,出自厂商自有内容平台,建议独立验证)[13]。 |
| 商用·前沿(药企级,非实验室级) |
Inceptive Nucleics(生成式 RNA 设计基础模型;2026-06 与 Alnylam 达成总价值高达 20 亿美元战略合作、首付 3,000 万美元现金+股权) |
定位 RNAi/mRNA/ASO 序列药物的发现层 AI 平台,非面向科研实验室的设计助手;量化性能未公开(公司口径)[12]。 |
| 渠道一手(ebaiao.cn,数字化基础层) |
Azenta(渠道代理/合作品牌):DP5 解码软件 878、ARCON™ 存储系统控制软件 929、FreezerPro® 冰箱库存管理(SKU:FreezerPro)724、Limfinity® 生物样本库 LIMS(SKU:Limfinity-Biobanking)725、Limfinity® 细胞系 LIMS(SKU:Limfinity-CellLine)726;莫纳生物 Monad(渠道代理/合作品牌) 自动化定制开发服务(SKU:MONAD-CUSTOM-DEV)1047 |
本栏目渠道内无"大模型 RNA 实验设计助手"直接在售型号(如实说明)。"实验软件"类在售仅上述 5 个 SKU,均为管架识读、存储控制、冰箱库存与 LIMS 等数字化基础层,不是 AI 设计工具;莫纳定制开发服务是"有算法需求时走项目制开发"的生态参照。价格均未确认(渠道询价制,2026-08-27 快照)[16]。 |
品牌身份说明:Azenta、莫纳生物为 ebaiao.cn 渠道代理/合作品牌,非中生柏奥自产;东宸柏奥(DCBAIAO)为自产品牌,产品线以分子实验耗材为主,无 AI 设计软件,不在本清单之列。
四、定价与部署形态(本地 / 云 / SaaS)
| 对象 | 价格(币种 / 规格 / 市场 / 报价时间) | 部署形态 |
| SnapGene(分子克隆/引物设计桌面软件) |
中国区官网公开价目(人民币,含税,2026-09 查询):年度订阅学术单席位 ¥3,176/年、学术 10 席位 ¥29,500/年;商业单席位 ¥16,742/年、商业 10 席位 ¥167,420/年;永久授权学术 ¥27,222/用户、商业 ¥104,350/用户;支持简体中文界面,订阅税率 6%、永久 13%[9]。 |
本地桌面(Win/Mac/Linux,明确禁止虚拟机/服务器安装) |
| Geneious Prime(分子生物学+NGS 分析套件) |
中国区授权商公开价目(人民币/年,含税,2026-09 查询):个人订阅商业版 ¥19,509/年、学术版 ¥5,625/年;团队 2 席位商业 ¥40,834/年、学术 ¥11,616/年;10 席位商业 ¥204,170/年、学术 ¥58,080/年;仅年度订阅、无永久授权,税率 6%[10]。 |
本地桌面(Win/Mac/Linux,订阅制) |
| 衍因智研云(国内 AI 科研协作 SaaS) |
学术版免费;专业版/企业版未确认(按需报价,厂商未公开价目)(厂商宣称)[13]。 |
云 SaaS(宣称数据境内存储,服务合规审计需求) |
| Benchling 等国际云研发平台(AI 助手能力) |
未确认——公开渠道未见 RNA 设计场景订阅价目;本期不做比价(不引用第三方博客示意价)。 |
云 SaaS |
| 开源工具(Primer-BLAST/Cas13design/RiNALMo/PrimeGen) |
免费开源(NIH 免费公共服务;GitLab 开源;Apache 2.0/GPLv3;软件零授权费,算力与验证成本自担)[6][4][3][7]。RNA 语言模型推理通常需本地 GPU(RiNALMo giga 版 650M 参数,显存要求未在公开页明确给出,未确认)[3]。 |
网页免费(Primer-BLAST/Cas13design)+本地(RiNALMo/PrimeGen) |
| Inceptive(生成式 RNA 设计平台) |
未确认——无产品定价;合作层面为 2026-06 Alnylam 交易:总价值高达 20 亿美元(含里程碑)、首付款 3,000 万美元(现金+股权,海外市场,美元)[12]。 |
公司内部平台+湿实验闭环,不对实验室单独售卖(未确认) |
| 渠道数字化基础层(ebaiao.cn 6 个 SKU) |
未确认(渠道询价制)——Azenta DP5/ARCON/FreezerPro/Limfinity×2 与莫纳定制开发,price 均为 null(2026-08-27 快照)[16]。 |
本地/托管混合(渠道页未明示,未确认);莫纳为项目制定制 |
形态判断:本主题呈现罕见的"两极结构"——一极是免费开源(从 Primer-BLAST 到 PrimeGen,能力最前沿的东西反而不收钱,成本转移到 GPU 与验证人力);另一极是桌面订阅软件(SnapGene/Geneious,中国区价格透明、学术价约为商业价 19%–29%,是这个赛道里唯一可公开核价的成熟商品)。中间地带(国内 AI SaaS、国际云平台)全部"按需报价",询价前无法预算。实验室采购的组合通常是:桌面软件付年费买易用与记录联动,开源模型付算力买先验,二者并不互斥。
五、数据质量与合规风险(只谈"实验设计前端"链路的具体节点)
- LLM 幻觉引物/探针序列是头号风险,且有综述级证据:Biomedical Instrumentation 综述的结论明确——通用 LLM 可复述 Tm/GC 概念但计算准确性不足,不适合独立用于引物设计[1];ACS Nano Medicine 2025 年专门发表了"指导聊天机器人设计核酸检测探针"的论文,把这件事作为严肃研究问题对待(本期未能获取全文细节,以标题与摘要级信息为准,间接来源)[15]。实操纪律:任何 LLM 给出的序列必须回到 Primer-BLAST/OligoAnalyzer 类确定性工具做特异性与二聚体回检——把 LLM 当"生成草稿的人",把确定性算法当"签字的审查者"。
- 虚增效率声明与"厂商宣称"陷阱:本主题的性能数字有两类来源,审计属性完全不同:一类是同行评审论文里的可比基准(PrimeGen 131 重面板 98.7% vs ARTIC v5.3.2 91.2%、CellAgent 完成率 92% vs GPT-4 直用约一半)[7][8];另一类是厂商内容平台的宣传口径(衍因"80 家企业、385 所高校、215 家科研院所""一周上手")[13]。后者没有第三方验证,写进选型报告必须保留厂商宣称标签并要求现场 PoC 复现。
- 实验安全边界:本主题的生成式能力直接产出可合成的核酸序列(siRNA、sgRNA、UTR、甚至从头生成的基因序列如 PlantGFM 的 7 条植物基因[20]与 Cas13a 人工 gRNA 文库[15])。AI 辅助设计降低了序列获取门槛,实验室在采纳这类工具时应同步核对所用序列是否符合本单位生物安全委员会的合成序列审查流程;该审查义务不因"序列是 AI 生成的"而减轻。
- 数据不出域需求与部署形态绑定:引物/靶点信息在药物研发与植物新种质语境下是核心资产。这决定了选型分叉:走 SaaS(衍因宣称数据境内存储[13])还是本地部署(PrimeGen GPLv3 自部署+国内可用的 Qwen2-VL 做视觉智能体,本身就是"数据不出域"思路的工程体现[7])。涉密或核心 IP 场景,纯海外云端 LLM 方案在合规上先天弱势。
- 基准不可比与数据泄漏:RNA 结构预测领域的教训直接适用:CASP16 显示长程作用短板、RNA 结构数据仅约序列数据 1/25,且基准去冗余(RNA3DB/RNAsolo)就是为了防测试集泄漏——期刊上的 SOTA 不等于在你的 RNA 上好用,跨分布(未见 RNA 家族)泛化失效是综述反复强调的点[5][2]。任何 RNA 语言模型给的设计先验,都必须在你自己的靶序列家族上做小规模实测回验。
- AI 方案的留痕与可追溯:AI 生成的引物、体系与协议一旦进入实验,就成为实验记录的一部分;"哪段序列是人给的、哪段是模型建议的、用了什么提示词与模型版本"应记入 ELN。无纸化记录与审计追踪的通用框架见本站 2026-09-14 栏目 C,本篇不重做——只强调一点:AI 设计建议是"假设"不是"结论",其溯源要求与人工设计完全相同。
六、对现有工作流的人力替代效应评估
谁在做这件事?今天分子/蛋白实验室里,RNA 实验设计是一批"半结构化劳动":研究生开 Primer3/BLAST 排引物、查文献抄 siRNA 序列、翻协议手册配 IVT 体系、拼脚本跑单细胞分析。这些劳动的共同点是"规则明确但环节琐碎",正是 LLM 编排最能压缩的部分。分段评估如下。
- 靶序列检索与整理(替代最干净):PrimeGen 的检索智能体自动从 OMIM/NCBI 取序列、其 131 重面板设计对应的传统做法是数天级人工比对——这一段被论文证明可自动化且有增益[7]。替代的是查库与拼接时间,不是设计判断。
- 候选生成与多轮优化(部分替代,替代的是迭代而非规则):滑窗滚雪球+损失函数+LLM 优化器的组合,在 78 重面板上收敛快于遗传算法与 Adalead(论文口径)[7];但二聚体率、GC 偏移这些规则本身仍由经典损失函数定义——LLM 替代的是"人肉迭代几十轮",不替代"知道该罚什么"。
- 协议撰写与机器人脚本转换(新能力,从无到有):协议智能体把实验步骤经 RAG 转成液体处理机器人 Python 脚本[7],BioPlanner 证明协议伪代码化可自动评测[9]——过去需要"懂实验又懂自动化脚本"的双栖人员,现在研究生可借工具完成初版;省的是自动化工程师的排期,新增的是人工复核脚本的义务。
- 单细胞/Ribo-seq 分析(替代门槛而非岗位):CellAgent 把"会写 Seurat/Scanpy 流水线"的门槛从数月编程学习压到自然语言描述任务(完成率 92%)[8];CellWhisperer 让非生物信息背景者用英语对话探索数据(AUROC 约 0.94 的细胞类型零样本预测,作者自评概念验证)[11]。被压缩的是生信支持的排队时间,被放大的恰恰是结果误读风险——注释结果仍需专业复核。
- 设计责任(不可替代):引物进了 qPCR 报不好、siRNA 敲不下来,责任在实验设计者而非工具。综述的结论"AI 是增强而非取代实验人员专业判断的工具"[1],与本篇所有证据一致:模型建议、人来签字,这条边界与 09-19 篇"预测建议、人来决定"完全同构。
- 人力账口径示例(假设明示,非测量值):设一实验室每月 10 个新靶点需设计 qPCR 引物与验证方案,传统流程每靶点约 2 小时(查序列、排引物、BLAST、写方案),假设"检索+候选生成+协议初稿"自动化可省 50%–60%,即约 10–12 小时/月(假设推算,非实测);PrimeGen 论文给出的健康经济学口径是分析层面(PCR.Ai 每样本省 63 分钟属 qPCR 分析侧,见 09-16 篇错位范围),本篇不重复计入。
对分子/蛋白实验室的实际影响
① 今天就能零成本升级设计栈:Primer-BLAST(NIH 免费网页)[6] 做引物+特异性回检、Cas13design 做 RNA 编辑 gRNA 打分[4]、RiNALMo 本地跑 RNA 结构先验[3]——这一层已经免费,不升级是纯损失。② 对"LLM 直接给序列"零容忍:综述级证据表明通用 LLM 不适合独立设计引物[1];正确姿势是 LLM 出草稿、确定性算法签字,验收任何 AI 设计工具时用 BioPlanner 式伪代码评测+自有靶点小样本回测当考卷[9]。③ 要闭环自动化就先看开源参照系:PrimeGen(GPLv3)给出了"检索→设计→协议→机器人执行→视觉查错"的完整开源蓝图[7],自建"对话式设计助手"的团队可先复现其框架再谈定制,而不是从零采购。④ 预算怎么分:桌面软件(SnapGene 学术 ¥3,176/年起[9])买的是易用与中文支持;国内 AI SaaS(衍因,学术免费、专业版按需报价[13])买的是 ELN 联动与数据境内;开源模型买的是先验但需 GPU 与验证人力——三者按需组合,别把"AI 设计助手"当成单一可采购品。⑤ 数据出域先想清楚:核心靶点序列走哪家云端,取决于你的合规红线;涉 IP 场景优先本地开源方案(PrimeGen/RiNALMo 均可自部署)。⑥ 渠道现实:ebaiao.cn 实验软件类 5 个 Azenta SKU+莫纳定制开发都是数字化基础层[16]——在渠道买不到"AI 设计助手",能买到的是把设计结果管起来的 LIMS/库存系统与项目制定制入口。纳入理由:RNA 实验设计是分子实验链的最前端,与后续的记录(09-14 篇)、检测判读(09-16 篇)成链,属栏目 C 数字化主轴。
结论边界声明:① "对话式 RNA 实验设计助手作为独立商用产品已规模化落地"本期未发现可核实证据,结论限于"传统算法规模化、深度学习论文验证、LLM 多智能体论文/开源早期";② 衍因智研云的产品能力、客户数量、"一周上手"等全部为厂商宣称(出自厂商自有内容平台);③ Inceptive 的技术能力与 Alnylam 合作细节为公司口径,量化指标未公开;④ Benchling 订阅价、衍因专业版价、Inceptive 产品价、RiNALMo giga 版显存要求、IVT 体系 AI 优化产品化情况均未确认;⑤ ebaiao.cn 渠道 SKU 结论基于 2026-08-27 快照,依赖"当前在架"者需重新核对;⑥ CellWhisperer 细节转述自 MedSci 对 Nature Biotechnology 论文的报道(二手),PlantGFM 细节转述自华中农业大学官网新闻,PrimeGen 细节转述自 fmread 对 NBE 论文的中文解读并已对照 DOI 核题,引用以转述口径为准;⑦ ACS Nano Medicine 聊天机器人设计探针论文与 Cas13a 人工 gRNA 文库论文因出版商页受限,仅采用标题与搜索摘要级信息(间接来源);⑧ 人力节省数字为本报告假设推算并已明示,非实测值。本期公开信息不足以支撑任何"厂商份额/市场占比"结论。
来源(可靠性分级:★高 = 官方文件/一手数据/论文/中标公示/企业公开价目/渠道一手商品页;★中 = 行业报告/二手转述/经销页/厂商资源页;★低 = 媒体转引/转载/未确认)
- ★★中 生物通(ebiotrade)转述综述:人工智能(AI)用于聚合酶链式反应(PCR):一项最先进的综述(原载 Biomedical Instrumentation;引物设计方向盘点——树模型 BioInnovate AI LGBM AUC 0.97、QuantPrime/OligoAnalyzer/Primer3 工具生态、Tm 预测专用模型相关系数 0.89、明确结论:GPT-3.5/GPT-4 可算 Tm/GC 但准确性不佳、不适合独立用于引物设计、"AI 是增强而非取代";二手转述,原网页部分编码乱码)
https://www.ebiotrade.com/newsf/2026-7/202607060851336852.htm
- ★★中 生物通(ebiotrade)转述综述:机器学习与语言模型在RNA结构预测中的应用:进展与展望(RNAfold/ViennaRNA 热力学基线、EternaBench 学习类优于热力学、RNA-FM(23.7 亿条预训练)/RhoFold+/StructRFM/RibonanzaNet/RNADiffFold 模型谱系、CASP16 长程作用短板、PDB RNA 结构数据约仅序列数据 1/25、跨分布泛化易失效;二手转述)
https://www.ebiotrade.com/newsf/2026-7/20260722103725312.htm
- ★★★高 GitHub(lbcb-sci):RiNALMo — General-Purpose RNA Language Model(giga 650M/mega 150M/micro 35M 三档;3600 万条 ncRNA 预训练;代码 Apache 2.0、权重 CC BY 4.0;期刊版 Nature Communications 2025(s41467-025-60872-5);GitHub 175 stars;结构预测跨家族泛化为作者宣称)
https://github.com/lbcb-sci/RiNALMo
- ★★★高 纽约基因组中心 Sanjana Lab:Cas13design — Transcriptome-wide Cas13 guide RNA design(gRNA 打分/四分位基于大规模并行 tiling 筛选数据、v0.3 起用 4 套数据集训练;覆盖人 hg19/GENCODE v19、小鼠、斑马鱼、果蝇、线虫、拟南芥及 SARS-CoV-2/MERS/H1N1/HIV1;免费网页工具、源码开源于 GitLab;配套 Wessels 等 Nature Biotechnology 2020 与 Guo 等 Cell Genomics 2021 论文)
https://cas13design.nygenome.org/
- ★★★高 arXiv 2406.10391:BEACON: Benchmark for Comprehensive RNA Tasks and Language Models(2024;对 13 种 RNA 结构预测工具的系统基准,RNA-FM 等基础模型显著优于热力学基线)
https://arxiv.org/html/2406.10391
- ★★★高 NCBI(NIH/NLM)官方工具:Primer-BLAST — Finding specific primers(Primer3 引物设计+BLAST 特异性检验,免费公共在线服务,已核验页面在访)
https://www.ncbi.nlm.nih.gov/tools/primer-blast/
- ★★★高 Nature Biomedical Engineering(DOI: 10.1038/s41551-025-01455-z,2025-06-09 在线):Accelerating Primer Design for Amplicon Sequencing Using Large Language Model-Powered Agents(华大系 MGI Tech+中国科学院大学等;GPT-4o 核心控制器+检索/引物/协议/实验四智能体,Qwen2-VL 视觉查错;131 重 SARS-CoV-2 面板覆盖度 98.7% vs ARTIC v5.3.2 91.2%、955 重携带者筛查面板扩增均一性 87.17%/二聚体率 1.77%、78 重面板 LLM 优化器收敛快于遗传算法;GPLv3 开源 GitHub melobio/primegen)
https://doi.org/10.1038/s41551-025-01455-z
- ★★★高 arXiv 2407.09811(2024-07):CellAgent: An LLM-driven Multi-Agent Framework for Automated Single-cell RNA-seq Data Analysis(GPT-4 多智能体 Planner/Executor/Evaluator+GPT-4V 评图;50 余数据集基准任务完成率 92%、约为 GPT-4 直用两倍以上;批次校正 0.684 优于 scVI 0.642;arXiv 预印本,未见正式期刊信息)
https://arxiv.org/html/2407.09811v1
- ★★★高 ACL Anthology(EMNLP 2023 main):BioPlanner: Automatic Evaluation of LLMs on Protocol Planning in Biology(自然语言实验协议→伪代码的自动评测框架);及 SnapGene 中国区官网公开价目页(人民币含税:学术订阅 ¥3,176/年起、商业 ¥16,742/年起、永久授权学术 ¥27,222/商业 ¥104,350,2026-09 查询,简体中文界面)
https://aclanthology.org/2023.emnlp-main.162/ ;https://www.snapgene.cn/?c=index&a=pricing
- ★★★高 上海卡贝信息技术(Geneious Prime 中国区授权商):Geneious Prime 2026 版产品定价(人民币/年含税:个人商业 ¥19,509、学术 ¥5,625;2 席位商业 ¥40,834/学术 ¥11,616;10 席位商业 ¥204,170/学术 ¥58,080;仅年度订阅,2026-09 查询)
https://www.cabit.com.cn/products/stat/geneious/pricing.html
- ★★中 MedSci 报道:NBT|聊天就能分析基因表达?多模态AI模型通过对话实现单细胞RNA测序数据解读(CellWhisperer,维也纳医科大学,Nature Biotechnology 2025"Multimodal learning enables chat-based exploration of single-cell data";CLIP 式对比学习 Geneformer+BioBERT、约 108 万对 RNA-seq 图谱-文本+10.6 万对话训练、集成 CELLxGENE、零样本细胞类型 AUROC≈0.94、英语查询、作者自评概念验证;二手转述)
https://www.medsci.cn/article/show_article.do?id=e780905122d0
- ★★中 IntuitionLabs 行业分析:AI siRNA Design: Alnylam and Inceptive Deal Analysis(Inceptive 背景:Transformer 共同作者 Jakob Uszkoreit 联合创办、累计融资约 1.2 亿美元;2026-06-03 合作:总价值高达 20 亿美元、首付款 3,000 万美元现金+股权;生成式 AI 用于 siRNA 靶 mRNA 建模与序列探索;量化指标均为公司口径、未公开;行业分析性二手来源)
https://intuitionlabs.ai/articles/ai-sirna-design-alnylam-inceptive-deal
- ★★★高 衍因科技官方内容平台:衍因智研云(SnapGene 协作替代方案)("1+3+N"架构:智研分子含 AI 自动引物设计、智研笔记 ELN、实验室管理、AI 智能体"灵研"覆盖 CRISPR 设计等;学术版免费、专业版/企业版按需报价;宣称服务 80 家企业/385 所高校/215 家科研院所、数据境内存储、一周上手——以上产品与客户数字均为厂商宣称,建议独立验证)
https://www.yanyin.tech/cms/XraA0Nla.html
- ★★★高 arXiv 2508.20130:Artificial Intelligence for CRISPR Guide RNA Design: Explainable Models and Off-Target Safety(2025;AI 预测 gRNA 活性与脱靶安全的可解释模型综述)
https://arxiv.org/abs/2508.20130
- ★★★高 论文(检索摘要级引用,出版商页 403 受限,间接来源):Instructing a Chatbot to Design Nucleic Acid Probes for Diagnostics(ACS Nano Medicine,DOI: 10.1021/acsnanomed.5c00062,2025)——把"指导聊天机器人设计核酸检测探针"作为研究问题;及 Model-directed generation of artificial CRISPR–Cas13a guide RNA libraries(Nature Biotechnology 2024,s41587-024-02422-w,出版商页 303 受限)——模型指导生成人工 Cas13a gRNA 文库。两篇仅采用标题与搜索摘要,未核对全文
https://pubs.acs.org/doi/10.1021/acsnanomed.5c00062 ;https://www.nature.com/articles/s41587-024-02422-w
- ★★★高 ebaiao.cn 渠道一手(2026-08-27 快照,均询价制、price=null):Azenta(渠道代理/合作品牌)DP5 解码软件 878、ARCON™ 存储系统控制软件 929、FreezerPro® 冰箱库存管理 SKU:FreezerPro、Limfinity® 生物样本库 LIMS SKU:Limfinity-Biobanking、Limfinity® 细胞系 LIMS SKU:Limfinity-CellLine;莫纳生物(渠道代理/合作品牌)自动化定制开发服务 SKU:MONAD-CUSTOM-DEV——"实验软件"类全部 5 个 SKU+定制开发参照,均为数字化基础层、非 AI 设计工具
- ★★★高 PMC11189900(同行评审收录):Optimizing 5′UTRs for mRNA-delivered gene editing using deep learning(深度学习优化 5′UTR 提升递送基因编辑效率;IVT/UTR 序列设计层的论文证据)
https://pmc.ncbi.nlm.nih.gov/articles/PMC11189900/
- ★★★高 BMC Genomics(2025):UTR-Insight: integrating deep learning for efficient 5′ UTR discovery and design(深度学习整合进 5′UTR 发现与设计流程)
https://link.springer.com/article/10.1186/s12864-025-11269-7
- ★低 腾讯新闻/新浪财经媒体转载(媒体转引,未逐条核验):CompBioAgent:LLM 驱动的单细胞 RNA 测序数据探索智能体(2026-07-27);Paper2Agent 把研究方法变成 AI Agent(2026-09-19)——国内 LLM 智能体与协议代理化的媒体级线索,仅作趋势参照
https://news.qq.com/rain/a/20260727A0BTCF00 ;https://finance.sina.com.cn/roll/2026-09-19/doc-inisiwwe7622842.shtml
- ★★★高 华中农业大学南湖新闻网(官方):我校团队首次实现AI设计植物基因全链条表达验证(PlantGFM 植物基因组基础模型:Hyena 长序列算子、12 种植物 108 亿碱基自监督预训练、64kb 长上下文;从头生成 3,000 条候选、7 条进本氏烟草瞬时表达、全部转录为 RNA、2 条稳定蛋白表达;RNA-seq/RT-qPCR/Western Blot 验证;Advanced Science 在线发表)
https://news.hzau.edu.cn/info/1010/72888.htm
渠道复核说明:对 ebaiao.cn 2026-08-27 快照按"实验软件"类复核,该类在售仅 5 个 SKU(全部 Azenta),渠道内无"大模型 RNA 实验设计助手"直接在售型号,另引用莫纳生物定制开发服务作为项目制开发生态参照;以上均为数字化基础层生态关联,本报告严格区分"基础层"与"AI 设计工具"。受限源说明:pubs.acs.org 403、nature.com Cas13a 论文 303、知乎 403、搜狐未采用——相应内容以搜索摘要与交叉来源核验并已标注"间接来源"。来源计数:有效来源 20 条,其中 ★高 15 条([3][4][5][6][7][8][9][10][13][14][15][16][17][18][20])、★中 4 条([1][2][11][12])、★低 1 条([19]);满足单篇 ≥6 条且 ★高/★中 ≥3 条的门槛。SnapGene/Geneious 价格均为人民币、2026-09 查询,分别出自官网直供与授权商公开价目。