您好,欢迎来到云平学术网!商务合作:journal199@163.com,投稿邮箱:vzazhiqk@163.com

首页 > 学术资讯 > 计算机通信 > 人工智能驱动RNA研究:从序列设计到结构预测及药物转化的前沿进展与挑战

人工智能驱动RNA研究:从序列设计到结构预测及药物转化的前沿进展与挑战

上传时间:时间:2026-08-21 11:24:04

  • 关键词:
  • 核糖核酸;人工智能;序列优化;结构预测;RNA修饰;药物研发;干湿闭环

摘要

核糖核酸(RNA)作为生命活动的核心调控分子,其结构多样性与功能复杂性远超传统认知。从基因表达调控到表观遗传修饰,从非编码RNA的远程调控到mRNA疫苗的快速响应,RNA研究已成为生命科学和生物医药领域的核心前沿。然而,RNA序列的庞杂性、修饰的动态性、结构的高维性以及相互作用网络的错综复杂,使得传统实验手段和经典计算方法在通量、精度和系统性方面均面临严峻挑战。近年来,人工智能(AI)技术凭借其强大的模式识别能力、高维数据挖掘能力和端到端的预测建模能力,为RNA研究提供了全新的范式。本文系统综述了AI在RNA序列元件优化、RNA修饰位点预测、RNA二级与三级结构预测、RNA-蛋白质相互作用建模等关键方向的应用进展;深入剖析了当前AI驱动RNA研究所面临的高质量标注数据匮乏、模型可解释性不足、计算与实验转化效率低等核心瓶颈;并从数据资源整合、模型算法优化、干湿实验闭环体系建设等维度,展望了未来AI与RNA研究深度融合的发展路径,以期为加速基础科学发现与创新RNA疗法的研发提供理论参考。

关键词:核糖核酸;人工智能;序列优化;结构预测;RNA修饰;药物研发;干湿闭环

1 引言

RNA是连接基因组信息与蛋白质功能的桥梁,更是基因表达调控网络中的核心节点。过去几十年中,RNA研究经历了从“DNA与蛋白质之间的被动信使”到“具有复杂调控功能的主动参与者”的范式转变。微小RNA(miRNA)、长链非编码RNA(lncRNA)、环状RNA(circRNA)等非编码RNA家族的相继发现,以及mRNA疫苗在新冠疫情中的成功应用,不断刷新人类对RNA功能边界的认知。与此同时,RNA修饰(如m6A、m5C、Ψ等)的动态可逆性及其在转录后调控中的关键作用,进一步揭示了RNA调控网络的精细与复杂。

然而,RNA研究的深入发展正面临多重技术瓶颈。首先,RNA的结构动态性极高,单链RNA可通过分子内碱基配对形成复杂的二级和三级结构,这些结构直接决定其稳定性、翻译效率和相互作用特异性,但实验解析RNA三维结构的速度远远落后于蛋白质。其次,RNA修饰具有时空特异性,同一修饰在不同细胞类型、不同生理状态下分布迥异,传统基于抗体或测序的识别方法在灵敏度和通量上均存在局限。再次,RNA与蛋白质、DNA、小分子之间的相互作用网络错综复杂,涉及静电作用、氢键、碱基堆积等多种弱相互作用,传统基于物理模型的计算方法难以准确捕捉。

在此背景下,人工智能技术为突破上述瓶颈提供了前所未有的机遇。从早期的传统机器学习方法,到深度神经网络,再到当前的大语言模型和生成式AI,AI方法在RNA研究中的应用已从单一的分类预测逐步扩展到序列生成设计、结构建模、功能注释乃至药物研发的全链条。本文旨在系统梳理这一交叉领域的发展脉络,分析现有方法的优势与局限,并探讨未来可能的研究方向。

2 RNA研究中AI方法的技术谱系

结合现有研究进展,RNA领域的AI方法可以概括为三大类:传统机器学习方法、深度学习方法,以及机器学习/深度学习与物理建模和采样过程相结合的协同策略。这种划分并非严格互斥的分类体系,在实际应用中往往存在交叉与融合。

2.1 传统机器学习方法:稳健的基线工具

传统机器学习方法主要依赖人工构建的序列特征(如k-mer频率、核苷酸组成)、结构特征(如最小自由能MFE、配对概率)或进化特征(如保守性评分),通过支持向量机(SVM)、随机森林(RF)、梯度提升树(XGBoost)等算法进行分类或回归。这类方法在小样本且特征定义较清晰的场景中仍可作为稳健基线,尤其适用于局部规律较明确的任务,如RNA局部基序识别、基础功能分类以及特定修饰位点的初步筛选。

然而,传统机器学习对表达调控、修饰背景与细胞情境等跨模态信息的整合能力相对有限。当任务涉及长序列、多目标耦合优化或复杂环境条件时,人工特征工程往往难以穷尽所有相关信号,目标函数构建的完备性与计算代价共同成为限制因素。

2.2 深度学习方法:从表征学习到生成设计

以卷积神经网络(CNN)、循环神经网络(RNN)和Transformer为代表的深度学习模型,能够直接从原始序列或结构输入中学习多尺度表征,无需繁琐的人工特征工程。在RNA二级结构概率预测、RNA-蛋白质相互作用预测等复杂任务中,深度学习模型通常具备更高的性能上限。特别是Transformer架构,凭借其自注意力机制对长程依赖关系的强大捕捉能力,已成为RNA基础模型的首选架构。

预训练基础模型是深度学习在RNA领域的又一重要进展。通过在大规模未标注或弱标注RNA序列数据上进行自监督预训练,这些模型学习到通用的序列表征,可迁移至下游多种任务(如结构预测、功能注释、修饰识别),在小样本场景下表现尤为突出。代表性工作包括RNA-FM、Uni-RNA等,它们借鉴了自然语言处理中BERT或GPT的设计理念,将RNA序列视为"生物语言"进行建模。

生成式模型则推动AI赋能的RNA研究由属性预测进一步走向理性设计。在mRNA序列优化等任务中,生成式框架(如变分自编码器VAE、生成对抗网络GAN、扩散模型)能够直接输出候选序列方案,从而更契合RNA药物的工程化需求。生成模型通常依赖代理指标(如预测得分、结构能量先验、配对概率)进行条件生成以引导候选产生,但其关键瓶颈在于:高评分候选序列未必能在真实实验体系中实现相应功能,因为代理指标对应的实验数据往往缺失或预测模型能力不足。因此,生成式方法的应用价值高度依赖评估器质量、约束机制设置以及后续实验反馈通路的有效建立。

2.3 物理-数据协同策略:兼顾精度与合理性

在RNA三级结构预测等标签稀缺且构象空间巨大的任务中,将机器学习与物理建模相结合的协同策略通常比单一方法更具现实可行性。典型做法是将深度学习模型预测得到的配对概率、接触图或距离分布作为约束条件,输入到基于物理的能量函数或蒙特卡洛采样过程中,从而缩小构象搜索空间并提高筛选效率。例如,将神经网络预测的碱基配对概率纳入RNA二级结构预测的动态规划算法,或将接触图预测结果作为分子动力学模拟的引导约束。

这种协同策略既能发挥数据驱动模型从海量序列中学习统计规律的优势,又能通过物理模型保证预测结果的生物物理合理性。然而,其效果同样依赖先验质量、采样覆盖率与评分函数准确性,更适合被视为模型与模拟协同的工作流。

2.4 方法选择的方法论考量

在将AI方法应用到RNA相关研究中时,需要综合考虑序列长度与搜索空间规模、标注数据的数量、任务类型,以及对可解释性、生物物理一致性与结果可控性的要求。对于目标函数能够较为明确表达且对可控性与可复现性要求较高的任务(如受约束的密码子优化),物理或规则驱动方法仍具有重要基础价值。而对于数据充足、模式复杂、对端到端性能要求高的任务,深度学习方法则更具优势。实际研究中,往往需要根据具体问题灵活选择和组合不同方法。

3 AI在RNA研究核心方向的应用进展

3.1 RNA序列元件优化

mRNA疫苗和RNA药物的设计高度依赖序列元件的优化,包括5' UTR和3' UTR的选择、密码子使用偏好的调整、GC含量的平衡以及二级结构的最小化等。传统方法主要依赖经验规则和简单的序列搜索,难以同时兼顾翻译效率、稳定性和免疫原性等多重目标。

AI方法在此领域的应用已从早期的密码子优化算法(如基于密码子适应指数CAI的启发式搜索)发展到基于深度强化学习或生成模型的端到端序列设计。例如,利用循环神经网络或Transformer模型学习天然高表达mRNA的序列模式,然后生成具有类似特征的候选序列;或将mRNA序列优化建模为多目标优化问题,利用遗传算法或贝叶斯优化在翻译效率、结构稳定性和免疫原性之间寻找帕累托最优解。一些研究还将实验测得的翻译效率数据作为监督信号,训练神经网络预测序列功能,进而指导序列迭代优化。

3.2 RNA修饰位点预测

RNA修饰是表观转录组学的核心内容,目前已发现超过170种化学修饰。准确识别这些修饰在转录本上的位置和分布,是理解其功能机制的前提。AI方法在m6A、m5C、Ψ等常见修饰的位点预测中已取得显著成果。

早期方法主要利用序列上下文特征和传统机器学习分类器。随着深度学习的发展,基于CNN或双向LSTM的模型能够自动从序列中学习修饰位点的局部和全局模式。近期,基于Transformer的预训练模型通过在大规模RNA序列上的自监督学习,进一步提升了跨物种、跨修饰类型的预测性能。一些方法还整合了多组学数据(如MeRIP-seq、Pseudo-seq的峰信号)和结构信息,通过多模态融合提高预测准确性。然而,不同实验技术产生的数据存在系统偏差,且许多修饰缺乏高精度的金标准数据集,这仍是制约预测模型泛化能力的重要因素。

3.3 RNA二级与三级结构预测

RNA二级结构预测是RNA信息学中最经典的问题之一。传统方法如Mfold和RNAfold基于最小自由能(MFE)原则,通过动态规划算法寻找最优或近优的碱基配对方案。AI方法的引入为这一领域带来了新思路:深度学习模型可以从已知结构的RNA序列中学习配对偏好,预测碱基配对概率矩阵,然后将其作为约束融入传统算法,或直接通过端到端网络输出结构预测。

在RNA三级结构预测方面,AI方法正在缩小与蛋白质结构预测(如AlphaFold2)之间的差距。尽管已解析的RNA三维结构数量有限(PDB中约5000个非冗余RNA结构,远少于蛋白质的20万+),但基于深度学习的接触图/距离图预测、结合Rosetta或分子动力学模拟的整合方法,已在部分RNA靶标上取得了有竞争力的结果。近期出现的RoseTTAFold RNA和AlphaFold3等多模态结构预测框架,进一步展示了AI在RNA-配体、RNA-蛋白质复合物结构建模中的潜力。

3.4 RNA-蛋白质相互作用建模

RNA与蛋白质的相互作用(RBP-RNA互作)是转录后调控的核心环节,涉及RNA剪接、运输、稳定性和翻译等多个过程。AI方法在此方向的应用主要包括:基于序列和结构的互作位点预测、RBP结合偏好建模、以及互作复合物的结构预测。

深度学习方法通过整合序列特征(如k-mer、motif)、结构特征(如二级结构、可及性)和进化信号(如同源序列保守性),显著提升了RBP结合位点预测的准确性。图神经网络(GNN)被用于建模RNA序列中碱基之间的拓扑关系,捕捉长程相互作用。在结构层面,AlphaFold-Multimer等框架的扩展版本已开始尝试预测RNA-蛋白质复合物的三维结构,尽管目前精度仍有限,但代表了重要的发展方向。

4 核心挑战

尽管AI在RNA研究中展现出巨大潜力,但其进一步突破与大规模落地仍面临一系列关键挑战。

4.1 高质量数据资源的匮乏与整合不足

数据是AI方法的燃料,但RNA领域的数据现状远不能满足需求。首先,与蛋白质相比,已解析的RNA三维结构数量极其有限,制约了结构预测模型的训练。其次,公共数据库中虽积累了大量RNA测序数据,但在数据规模、物种覆盖范围、实验条件一致性以及标注质量等方面仍存在明显不足。不同实验平台、不同处理流程带来的系统偏差直接影响模型训练的稳定性和泛化能力。多组学数据之间缺乏严格配对和系统整合,使得模型难以全面学习RNA在真实生物体系中的多层次调控关系。此外,许多功能性RNA数据(如体内翻译效率、稳定性参数)的获取成本高昂,标注稀缺问题尤为突出。

4.2 模型可解释性不足

深度学习模型在RNA序列功能预测等任务中往往能取得优异的预测性能,但其内部决策过程通常难以直接对应明确的生物物理机制或分子作用路径。这种"黑箱"特性使研究者难以从模型中提炼可检验的生物学假设,限制了模型结果对实验设计的指导价值。在临床与产业应用场景中,可解释性不足也降低了模型的可信度和监管接受度。例如,当AI模型预测某个mRNA序列具有"高翻译效率"时,如果无法解释是哪些序列元件或结构特征驱动了这一预测,实验验证的优先级排序就会变得困难。

4.3 计算预测向实验验证的转化效率偏低

AI能够高效生成具有潜在活性的RNA序列或结构预测,但这些计算候选能否真正转化为具有临床开发价值的药物分子,高度依赖后续湿实验的系统性验证。以mRNA疫苗设计为例,研究者不仅需要在真实生物体系中确认其功能有效性、结构可实现性与作用机制可靠性,还需进一步评估其在递送体系中的稳定性、化学修饰后的活性保持情况、载体适配性,以及潜在的毒性和免疫原性。由于RNA分子的序列组成、构象稳定性、修饰策略、递送方式与成药性之间存在高度耦合,加之实验验证成本高、周期长、标准路径尚不完全成熟,从AI设计到成药性确认的全过程呈现出高投入、高损耗的典型特征。

5 未来发展方向

针对上述挑战,未来AI在RNA研究中的发展需要在数据、模型与应用三个层面协同推进。

5.1 数据层面:构建高质量、多模态的RNA数据生态

首先,应充分依托单细胞测序、长读长测序(如PacBio HiFi、Oxford Nanopore)和空间组学等新兴技术,不断完善非编码RNA与转录后调控相关的高质量参考数据库。长读长测序技术能够直接读取全长转录本,有助于准确识别可变剪接异构体和RNA修饰的真实位置,为AI模型提供更准确的训练标签。

其次,加强基因组、转录组、蛋白组及表观组等多组学数据的系统性整合,构建配对的多模态数据集。通过实验技术革新(如icSHAPE用于RNA结构探测、CROSSlink用于体内RBP结合位点鉴定)和国际化数据共享机制的构建,逐步扩充RNA结构与功能相关的数据资源。

此外,积极探索迁移学习、小样本学习、主动学习等策略,降低模型对大规模标注数据的依赖。例如,利用在海量未标注RNA序列上预训练的模型作为起点,通过少量标注数据微调,即可在特定任务上取得良好性能。

5.2 模型层面:引入生物约束与提升可解释性

未来模型研究不仅需要继续提升预测性能,更应注重引入生物学约束与可解释性机制。一方面,将第一性原理的物理建模思想与数据驱动模型相结合,例如在损失函数中加入能量项、在架构设计中融入碱基配对规则,使模型输出与生物物理假设保持一致。另一方面,通过可解释性分析方法(如注意力权重可视化、显著性图谱、概念激活向量测试),增强模型输出与具体分子机制之间的对应关系。

同时,RNA基础模型的进一步发展值得期待。随着预训练技术的成熟和算力的提升,更大规模、更通用的RNA基础模型有望在跨物种、跨任务迁移中发挥核心作用。但需注意,预训练语料的分布偏差、下游任务对齐方式以及置信度校准质量,都将直接影响模型在实际应用中的可靠性。

5.3 应用层面:构建干湿闭环的转化体系

AI在RNA研究中的终极价值在于推动科学发现与药物研发。当前,行业头部企业已率先开展实践探索,形成具有示范意义的转化路径。

Insitro针对siRNA研发中靶点筛选不精准、脱靶效应、体内稳定性不足及递送效率低等瓶颈,整合多组学与临床数据,通过机器学习平台生成和优化siRNA候选,涵盖序列选择、靶基因敲低效果以及多维药物样性参数的联合建模与评估;并与GalNAc靶向递送技术相结合,推进临床前开发进程,打通基础研究至临床开发的转化通道。

Moderna与Merck合作开发的个体化新抗原mRNA疫苗mRNA-4157(V940)则展示了"数据获取—计算预测—实验/临床验证—策略迭代"的反馈闭环。基于患者肿瘤及血液样本的mRNA测序数据,AI算法识别体细胞突变并筛选最可能诱导免疫应答的候选新抗原,提高个体化候选发现与优先级排序的效率。后续制造、免疫原性评估以及临床疗效观察等湿实验与临床验证环节积累的数据,又反过来为候选选择策略的校准与优化提供支持。该疫苗在高风险黑色素瘤中的随机IIb期研究已显示出积极的临床结果,并已拓展至多项后续临床项目。

更进一步地,AI在RNA药物研发中的作用不应局限于生成候选,而应深度嵌入"设计—合成—测试—学习"的闭环体系。结合主动学习、贝叶斯优化等策略,根据每一轮实验结果动态挑选信息增益最高的候选分子和实验条件,从而减少盲目筛选与重复试错。以Insitro的TherML平台为例,该平台旨在构建闭环主动学习系统,利用计算预测指导实验设计并优先选择高信息增益实验,随后基于实验结果持续更新模型与优化策略,并通过对接自动化实验设施实现高通量循环迭代。

6 结语

人工智能正在深刻重塑RNA研究的范式,从序列设计到结构解析,从修饰识别到药物研发,AI技术已渗透至RNA科学的各个层面。然而,当前AI在RNA领域的应用仍处于快速发展但尚未完全成熟的阶段。高质量数据的稀缺、模型可解释性的不足、计算与实验之间的鸿沟,仍是亟待突破的关键瓶颈。

未来,随着高质量数据资源的持续积累、算法模型的迭代更新(特别是物理-数据协同建模的深入)、以及干湿闭环实验体系的广泛建立,AI与RNA科学的交叉融合必将释放巨大潜能。这不仅将加速RNA基础生物学机制的阐明,更将为mRNA疫苗、siRNA药物、适配体疗法等创新RNA药物的研发提供强有力的技术支撑,最终推动精准医疗从愿景走向现实。


相关新闻

推荐期刊

新闻导航

推荐资讯

热门关键词

友情连接 :

云平学术交流网属于综合性学术交流平台,信息来自源互联网共享,如有版权协议请告知删除,ICP备案:京ICP备2025103200号-1