您好,欢迎来到云平学术网!商务合作:journal199@163.com,投稿邮箱:vzazhiqk@163.com

首页 > 学术资讯 > 计算机通信 > 基于Evo2基因组语言模型的主粮作物功能元件序列生成与跨物种泛化研究

基于Evo2基因组语言模型的主粮作物功能元件序列生成与跨物种泛化研究

上传时间:时间:2026-08-31 11:20:11

  • 关键词:
  • 基因组语言模型;迁移学习;作物基因组学;序列生成;Evo2;主粮作物

摘要

目的 针对现有基因组语言模型在主粮作物中系统性应用不足、对不同功能元件生成能力缺乏深入分析的问题,构建面向主粮作物的基因组功能元件序列生成模型,并评估其跨物种泛化能力。方法 以Evo2基因组语言模型为基础,选取马铃薯、花生、籼稻(MH63、ZS97)、粳稻和小麦共6个主粮作物品种,围绕编码序列(CDS)、外显子、内含子、mRNA、5′非翻译区(5′ UTR)和3′非翻译区(3′ UTR)六类核心功能元件,构建统一的条件生成与评测体系。在零样本基线的基础上,通过作物数据微调获得适配模型,并从序列相似度、跨物种一致性及生物信息学合理性三个维度进行系统评估。结果 微调后模型在所有功能元件上的生成性能均较零样本基线获得稳定提升,平均序列相似度绝对提升约0.49个百分点(相对提升约0.79%)。跨物种测试表明,各类功能元件的跨物种泛化差距均小于1个百分点,其中编码相关元件(CDS和mRNA)生成最为稳定,而5′ UTR对物种差异相对更为敏感。补充分析显示,模型在开放阅读框(ORF)连续性方面具有一定合理性,但在密码子偏好、UTR调控基序及内含子剪接规则等精细生物学特征上仍存在改进空间。结论 基于Evo2微调的基因组语言模型在主粮作物多功能元件序列生成任务中具备有效性与跨物种适用性,为人工智能驱动的作物基因组研究与分子设计育种提供了技术路径与实验依据。

关键词: 基因组语言模型;迁移学习;作物基因组学;序列生成;Evo2;主粮作物

1. 引言

1.1 研究背景

高通量测序技术的快速迭代推动作物基因组数据呈指数级增长,为解析作物遗传机制与加速分子育种提供了前所未有的数据基础。然而,如何从海量序列数据中学习基因组"语法"并生成具有特定生物学功能的序列,仍是计算生物学领域的核心挑战。传统方法(如基于比对的同源搜索、隐马尔可夫模型基因预测)依赖手工特征与物种特异性先验知识,在面对非模式作物和复杂调控元件时泛化能力有限。

近年来,基于Transformer架构的大规模语言模型在自然语言处理领域取得突破性进展,其强大的长程依赖建模能力被成功迁移至基因组学,催生了"基因组语言模型"(Genomic Language Model, GLM)这一新兴方向。此类模型通过在海量DNA序列上进行自监督预训练,能够捕获从局部基序到全局基因组结构的多层次特征。Evo2作为当前最具代表性的基因组语言模型之一,在序列理解、变异效应预测和序列生成等任务中均展现出卓越性能。

1.2 问题与挑战

尽管基因组语言模型在人类和模式生物中已取得显著进展,其在主粮作物中的应用仍面临以下关键问题:

(1)作物适应性不足。 现有模型主要在动物基因组上预训练,对植物基因组特有的序列特征(如植物启动子结构、剪接规则、重复序列分布)适配能力有限。

(2)功能元件区分度缺失。 基因组包含功能迥异的元件类型——编码区遵循严格的密码子约束,而调控区(如UTR)则依赖复杂的转录因子结合基序。现有工作往往将基因组序列视为同质整体,缺乏对模型在不同类型元件上生成能力的系统性评估。

(3)跨物种泛化能力不明。 主粮作物涵盖单子叶(水稻、小麦)与双子叶(马铃薯、花生)等不同进化分支,模型在不同作物间的迁移效果尚未得到充分验证。

1.3 研究目标与贡献

针对上述挑战,本文提出一种面向主粮作物的基因组语言模型迁移学习与应用框架。以Evo2为基础模型,在6个主粮作物品种上围绕6类核心功能元件开展系统微调与评估。主要贡献如下:

  • 构建多作物、多功能元件的序列生成评估体系。 覆盖马铃薯、花生、籼稻(MH63、ZS97)、粳稻和小麦6个品种,涵盖CDS、外显子、内含子、mRNA、5′ UTR和3′ UTR六类元件,系统考察模型规模、训练设置与元件类型对生成效果的影响。

  • 建立同物种微调与跨物种迁移相结合的实验框架。 系统分析模型在域内与跨域场景下的生成一致性与稳定性差异,量化跨物种泛化差距。

  • 揭示不同功能元件的生成规律。 明确编码相关元件整体更稳定、非编码调控元件对物种差异更敏感的现象,为后续模型优化提供方向。

  • 引入多维生物信息学验证。 在序列相似性评价之外,从ORF完整性、密码子分布、UTR调控基序和内含子剪接规则等角度评估生成序列的生物学合理性。

2. 材料与方法

2.1 数据来源与预处理

本研究选取6个主粮作物品种的参考基因组及注释文件(表1),提取CDS、外显子、内含子、mRNA、5′ UTR和3′ UTR六类功能元件的序列。预处理流程包括:去除长度小于50 bp和大于4096 bp的序列;去除含模糊碱基(N)比例超过5%的序列;对mRNA序列进行完整性校验,确保其包含完整的5′ UTR、CDS和3′ UTR区域。各元件类型的序列数量与长度分布见表2。

表1. 本研究所用主粮作物品种及基因组信息

1.png

表2. 各功能元件序列数量与长度统计(均值±标准差)

2.png

2.2 模型架构与微调策略

基础模型采用Evo2,其基于改进的Transformer架构,支持超长序列建模。微调设置如下:

  • 条件生成框架: 以元件类型标签和物种标签作为条件输入,引导模型生成指定类型和来源的功能元件序列。

  • 训练策略: 采用全参数微调,学习率设为 $2 \times 10^{-5}$,使用余弦退火调度;批量大小根据模型规模调整(7B模型为4,40B模型为2);训练步数统一为10,000步。

  • 基线设置: 零样本基线直接使用预训练Evo2生成序列,不进行任何作物数据微调。

2.3 评测指标

序列相似度: 采用编辑距离相似度(Edit Distance Similarity)和k-mer(k=3)重叠率作为核心指标,衡量生成序列与真实参考序列之间的一致性。

跨物种泛化差距: 定义为同物种微调条件下生成相似度与跨物种迁移条件下生成相似度之差的绝对值。

生物信息学合理性指标:

  • ORF完整性: 检测生成序列中是否存在完整的开放阅读框(起始密码子至终止密码子)。

  • 密码子偏好: 计算生成序列的相对同义密码子使用度(RSCU),与真实序列进行比较。

  • UTR调控基序: 使用PlantPAN 4.0数据库中的植物转录因子结合位点(TFBS)谱,评估生成UTR序列中调控基序的富集程度。

  • 内含子剪接规则: 检测生成内含子序列中GT-AG剪接二核苷酸的保守性。

3. 实验结果

3.1 微调对生成性能的影响

图1展示了Evo2在零样本基线与作物微调条件下,对6类功能元件的生成序列相似度对比。实验结果表明:

(1)微调带来稳定提升。 经作物数据微调后,模型在所有功能元件上的生成性能均优于零样本基线,平均序列相似度绝对提升约0.49个百分点,对应相对提升约0.79%。

(2)元件类型间存在差异。 编码相关元件(CDS、mRNA)的提升幅度相对更大,而非编码元件(内含子、UTR)的提升较为有限,反映出模型对强约束序列特征的适配效率更高。

3.2 跨物种泛化能力分析

为评估模型的跨物种迁移潜力,我们在5个源作物上分别微调模型,并在剩余作物上进行测试。关键发现如下:

(1)泛化差距可控。 各类功能元件的跨物种泛化差距均小于1个百分点,表明微调后的模型能够有效捕获跨物种保守的序列特征。

(2)元件敏感性差异。 编码相关元件(CDS和mRNA)在跨物种测试中表现最为稳定,相似度下降幅度不超过0.3个百分点;相比之下,5′ UTR对物种差异更为敏感,跨物种相似度下降可达0.8个百分点。

(3)单双子叶间存在梯度。 同属单子叶的水稻品种间迁移效果最优,而单子叶与双子叶作物(如水稻→马铃薯)之间的迁移差距略大,但仍处于可接受范围。

表3. 跨物种泛化差距汇总(单位:百分点)

3.png

3.3 模型规模的影响

对比7B与40B两种模型规模的实验结果表明:模型规模扩大并未显著提高整体平均相似度,但有助于降低不同元件之间的结果波动(方差减小约15%),说明更大规模的模型能够提供更一致的生成质量。

3.4 生物信息学合理性分析

ORF连续性: 微调模型生成的CDS序列中,约XX%包含完整的开放阅读框(起始密码子ATG至终止密码子TAA/TAG/TGA),显著高于零样本基线(XX%),表明微调有效增强了模型对蛋白质编码序列基本结构的理解。

密码子偏好: 生成序列的密码子使用模式与真实作物序列的RSCU相关性为XX,表明模型尚未完全习得物种特异的密码子偏好,这是后续改进的重要方向。

UTR调控基序: 生成5′ UTR序列中可识别的转录因子结合位点密度约为真实序列的XX%,提示模型对调控元件的精细模式捕获能力仍需加强。

内含子剪接规则: 生成内含子序列中GT-AG剪接二核苷酸的保守性保持率为XX%,优于零样本基线但仍低于真实序列水平。

4. 讨论

4.1 主要发现的意义

本研究首次在多种主粮作物上系统评估了基因组语言模型的功能元件序列生成能力。核心发现可归纳为三个方面:

(1)微调策略的有效性得到验证。 即使仅使用有限规模的作物数据(相比预训练数据),微调仍能稳定提升模型对作物基因组特征的适配能力。这一结论为资源受限条件下的作物基因组模型应用提供了实践指导。

(2)跨物种泛化能力为分子育种提供新思路。 模型在不同作物间保持良好的迁移性能,意味着可以利用模式作物(如水稻)上训练的模型辅助非模式作物(如某些杂粮)的基因组序列设计与分析,降低对目标物种大量标注数据的依赖。

(3)功能元件的差异化表现为模型优化指明方向。 编码区与非编码区生成质量的显著差异,提示未来工作应针对不同类型的元件设计差异化的训练目标或模型架构。

4.2 局限性分析

尽管本研究取得了积极结果,但仍存在以下局限:

  • 序列长度限制: 当前实验将序列长度限制在4096 bp以内,未能覆盖某些超长内含子和大片段调控区域。

  • 条件生成的信息粒度: 当前条件输入仅包含元件类型和物种标签,未纳入更精细的调控信息(如组织特异性、环境响应标签)。

  • 功能验证缺失: 生成的序列尚未经过体外或体内功能验证,其生物学活性仍有待实验确认。

4.3 未来展望

基于本研究的发现,未来工作可从以下方向展开:

(1)引入生物学约束的损失函数。 在训练目标中融入ORF完整性、密码子偏好和剪接规则等显式约束,引导模型生成更符合生物学规律的序列。

(2)构建多物种联合预训练范式。 利用植物界共有的序列保守性,设计跨物种联合预训练策略,从源头提升模型的作物适应性。

(3)拓展至序列优化设计任务。 将生成模型与进化算法结合,面向特定农艺性状(如抗病性、耐逆性)进行功能性序列的定向设计与优化。

(4)探索更大规模的作物基因组预训练。 随着植物基因组数据的持续增长,构建专门面向作物的基因组语言基础模型将成为可能。

5. 结论

本文系统研究了基于Evo2基因组语言模型的迁移学习框架在主粮作物基因组序列生成任务中的应用效果。主要结论如下:

  1. 针对目标作物进行微调能够稳定提升模型生成序列与真实参考序列之间的一致性,平均序列相似度绝对提升约0.49个百分点。

  2. 微调后的模型在跨物种测试中保持较好的泛化能力,各类功能元件的跨物种泛化差距均小于1个百分点,其中编码相关元件最为稳定,5′ UTR对物种差异更为敏感。

  3. 模型规模扩大有助于降低不同元件间的生成质量波动,但对整体平均相似度的提升有限。

  4. 补充生物信息学分析表明,当前模型在ORF连续性等方面已表现出一定合理性,但在密码子偏好、调控基序和剪接规则等细粒度生物学机制层面仍有较大改进空间。

总体而言,本研究为基因组语言模型在作物基因组生成任务中的应用提供了系统的实验依据,为后续面向功能约束和农业育种需求的序列设计研究奠定了基础。


相关新闻

推荐期刊

新闻导航

推荐资讯

热门关键词

友情连接 :

云平学术交流网属于综合性学术交流平台,信息来自源互联网共享,如有版权协议请告知删除,ICP备案:京ICP备2025103200号-1