上传时间:时间:2026-08-31 11:20:11
目的 针对现有基因组语言模型在主粮作物中系统性应用不足、对不同功能元件生成能力缺乏深入分析的问题,构建面向主粮作物的基因组功能元件序列生成模型,并评估其跨物种泛化能力。方法 以Evo2基因组语言模型为基础,选取马铃薯、花生、籼稻(MH63、ZS97)、粳稻和小麦共6个主粮作物品种,围绕编码序列(CDS)、外显子、内含子、mRNA、5′非翻译区(5′ UTR)和3′非翻译区(3′ UTR)六类核心功能元件,构建统一的条件生成与评测体系。在零样本基线的基础上,通过作物数据微调获得适配模型,并从序列相似度、跨物种一致性及生物信息学合理性三个维度进行系统评估。结果 微调后模型在所有功能元件上的生成性能均较零样本基线获得稳定提升,平均序列相似度绝对提升约0.49个百分点(相对提升约0.79%)。跨物种测试表明,各类功能元件的跨物种泛化差距均小于1个百分点,其中编码相关元件(CDS和mRNA)生成最为稳定,而5′ UTR对物种差异相对更为敏感。补充分析显示,模型在开放阅读框(ORF)连续性方面具有一定合理性,但在密码子偏好、UTR调控基序及内含子剪接规则等精细生物学特征上仍存在改进空间。结论 基于Evo2微调的基因组语言模型在主粮作物多功能元件序列生成任务中具备有效性与跨物种适用性,为人工智能驱动的作物基因组研究与分子设计育种提供了技术路径与实验依据。
关键词: 基因组语言模型;迁移学习;作物基因组学;序列生成;Evo2;主粮作物
高通量测序技术的快速迭代推动作物基因组数据呈指数级增长,为解析作物遗传机制与加速分子育种提供了前所未有的数据基础。然而,如何从海量序列数据中学习基因组"语法"并生成具有特定生物学功能的序列,仍是计算生物学领域的核心挑战。传统方法(如基于比对的同源搜索、隐马尔可夫模型基因预测)依赖手工特征与物种特异性先验知识,在面对非模式作物和复杂调控元件时泛化能力有限。
近年来,基于Transformer架构的大规模语言模型在自然语言处理领域取得突破性进展,其强大的长程依赖建模能力被成功迁移至基因组学,催生了"基因组语言模型"(Genomic Language Model, GLM)这一新兴方向。此类模型通过在海量DNA序列上进行自监督预训练,能够捕获从局部基序到全局基因组结构的多层次特征。Evo2作为当前最具代表性的基因组语言模型之一,在序列理解、变异效应预测和序列生成等任务中均展现出卓越性能。
尽管基因组语言模型在人类和模式生物中已取得显著进展,其在主粮作物中的应用仍面临以下关键问题:
(1)作物适应性不足。 现有模型主要在动物基因组上预训练,对植物基因组特有的序列特征(如植物启动子结构、剪接规则、重复序列分布)适配能力有限。
(2)功能元件区分度缺失。 基因组包含功能迥异的元件类型——编码区遵循严格的密码子约束,而调控区(如UTR)则依赖复杂的转录因子结合基序。现有工作往往将基因组序列视为同质整体,缺乏对模型在不同类型元件上生成能力的系统性评估。
(3)跨物种泛化能力不明。 主粮作物涵盖单子叶(水稻、小麦)与双子叶(马铃薯、花生)等不同进化分支,模型在不同作物间的迁移效果尚未得到充分验证。
针对上述挑战,本文提出一种面向主粮作物的基因组语言模型迁移学习与应用框架。以Evo2为基础模型,在6个主粮作物品种上围绕6类核心功能元件开展系统微调与评估。主要贡献如下:
构建多作物、多功能元件的序列生成评估体系。 覆盖马铃薯、花生、籼稻(MH63、ZS97)、粳稻和小麦6个品种,涵盖CDS、外显子、内含子、mRNA、5′ UTR和3′ UTR六类元件,系统考察模型规模、训练设置与元件类型对生成效果的影响。
建立同物种微调与跨物种迁移相结合的实验框架。 系统分析模型在域内与跨域场景下的生成一致性与稳定性差异,量化跨物种泛化差距。
揭示不同功能元件的生成规律。 明确编码相关元件整体更稳定、非编码调控元件对物种差异更敏感的现象,为后续模型优化提供方向。
引入多维生物信息学验证。 在序列相似性评价之外,从ORF完整性、密码子分布、UTR调控基序和内含子剪接规则等角度评估生成序列的生物学合理性。
本研究选取6个主粮作物品种的参考基因组及注释文件(表1),提取CDS、外显子、内含子、mRNA、5′ UTR和3′ UTR六类功能元件的序列。预处理流程包括:去除长度小于50 bp和大于4096 bp的序列;去除含模糊碱基(N)比例超过5%的序列;对mRNA序列进行完整性校验,确保其包含完整的5′ UTR、CDS和3′ UTR区域。各元件类型的序列数量与长度分布见表2。
表1. 本研究所用主粮作物品种及基因组信息

表2. 各功能元件序列数量与长度统计(均值±标准差)

基础模型采用Evo2,其基于改进的Transformer架构,支持超长序列建模。微调设置如下:
条件生成框架: 以元件类型标签和物种标签作为条件输入,引导模型生成指定类型和来源的功能元件序列。
训练策略: 采用全参数微调,学习率设为 $2 \times 10^{-5}$,使用余弦退火调度;批量大小根据模型规模调整(7B模型为4,40B模型为2);训练步数统一为10,000步。
基线设置: 零样本基线直接使用预训练Evo2生成序列,不进行任何作物数据微调。
序列相似度: 采用编辑距离相似度(Edit Distance Similarity)和k-mer(k=3)重叠率作为核心指标,衡量生成序列与真实参考序列之间的一致性。
跨物种泛化差距: 定义为同物种微调条件下生成相似度与跨物种迁移条件下生成相似度之差的绝对值。
生物信息学合理性指标:
ORF完整性: 检测生成序列中是否存在完整的开放阅读框(起始密码子至终止密码子)。
密码子偏好: 计算生成序列的相对同义密码子使用度(RSCU),与真实序列进行比较。
UTR调控基序: 使用PlantPAN 4.0数据库中的植物转录因子结合位点(TFBS)谱,评估生成UTR序列中调控基序的富集程度。
内含子剪接规则: 检测生成内含子序列中GT-AG剪接二核苷酸的保守性。
图1展示了Evo2在零样本基线与作物微调条件下,对6类功能元件的生成序列相似度对比。实验结果表明:
(1)微调带来稳定提升。 经作物数据微调后,模型在所有功能元件上的生成性能均优于零样本基线,平均序列相似度绝对提升约0.49个百分点,对应相对提升约0.79%。
(2)元件类型间存在差异。 编码相关元件(CDS、mRNA)的提升幅度相对更大,而非编码元件(内含子、UTR)的提升较为有限,反映出模型对强约束序列特征的适配效率更高。
为评估模型的跨物种迁移潜力,我们在5个源作物上分别微调模型,并在剩余作物上进行测试。关键发现如下:
(1)泛化差距可控。 各类功能元件的跨物种泛化差距均小于1个百分点,表明微调后的模型能够有效捕获跨物种保守的序列特征。
(2)元件敏感性差异。 编码相关元件(CDS和mRNA)在跨物种测试中表现最为稳定,相似度下降幅度不超过0.3个百分点;相比之下,5′ UTR对物种差异更为敏感,跨物种相似度下降可达0.8个百分点。
(3)单双子叶间存在梯度。 同属单子叶的水稻品种间迁移效果最优,而单子叶与双子叶作物(如水稻→马铃薯)之间的迁移差距略大,但仍处于可接受范围。
表3. 跨物种泛化差距汇总(单位:百分点)

对比7B与40B两种模型规模的实验结果表明:模型规模扩大并未显著提高整体平均相似度,但有助于降低不同元件之间的结果波动(方差减小约15%),说明更大规模的模型能够提供更一致的生成质量。
ORF连续性: 微调模型生成的CDS序列中,约XX%包含完整的开放阅读框(起始密码子ATG至终止密码子TAA/TAG/TGA),显著高于零样本基线(XX%),表明微调有效增强了模型对蛋白质编码序列基本结构的理解。
密码子偏好: 生成序列的密码子使用模式与真实作物序列的RSCU相关性为XX,表明模型尚未完全习得物种特异的密码子偏好,这是后续改进的重要方向。
UTR调控基序: 生成5′ UTR序列中可识别的转录因子结合位点密度约为真实序列的XX%,提示模型对调控元件的精细模式捕获能力仍需加强。
内含子剪接规则: 生成内含子序列中GT-AG剪接二核苷酸的保守性保持率为XX%,优于零样本基线但仍低于真实序列水平。
本研究首次在多种主粮作物上系统评估了基因组语言模型的功能元件序列生成能力。核心发现可归纳为三个方面:
(1)微调策略的有效性得到验证。 即使仅使用有限规模的作物数据(相比预训练数据),微调仍能稳定提升模型对作物基因组特征的适配能力。这一结论为资源受限条件下的作物基因组模型应用提供了实践指导。
(2)跨物种泛化能力为分子育种提供新思路。 模型在不同作物间保持良好的迁移性能,意味着可以利用模式作物(如水稻)上训练的模型辅助非模式作物(如某些杂粮)的基因组序列设计与分析,降低对目标物种大量标注数据的依赖。
(3)功能元件的差异化表现为模型优化指明方向。 编码区与非编码区生成质量的显著差异,提示未来工作应针对不同类型的元件设计差异化的训练目标或模型架构。
尽管本研究取得了积极结果,但仍存在以下局限:
序列长度限制: 当前实验将序列长度限制在4096 bp以内,未能覆盖某些超长内含子和大片段调控区域。
条件生成的信息粒度: 当前条件输入仅包含元件类型和物种标签,未纳入更精细的调控信息(如组织特异性、环境响应标签)。
功能验证缺失: 生成的序列尚未经过体外或体内功能验证,其生物学活性仍有待实验确认。
基于本研究的发现,未来工作可从以下方向展开:
(1)引入生物学约束的损失函数。 在训练目标中融入ORF完整性、密码子偏好和剪接规则等显式约束,引导模型生成更符合生物学规律的序列。
(2)构建多物种联合预训练范式。 利用植物界共有的序列保守性,设计跨物种联合预训练策略,从源头提升模型的作物适应性。
(3)拓展至序列优化设计任务。 将生成模型与进化算法结合,面向特定农艺性状(如抗病性、耐逆性)进行功能性序列的定向设计与优化。
(4)探索更大规模的作物基因组预训练。 随着植物基因组数据的持续增长,构建专门面向作物的基因组语言基础模型将成为可能。
本文系统研究了基于Evo2基因组语言模型的迁移学习框架在主粮作物基因组序列生成任务中的应用效果。主要结论如下:
针对目标作物进行微调能够稳定提升模型生成序列与真实参考序列之间的一致性,平均序列相似度绝对提升约0.49个百分点。
微调后的模型在跨物种测试中保持较好的泛化能力,各类功能元件的跨物种泛化差距均小于1个百分点,其中编码相关元件最为稳定,5′ UTR对物种差异更为敏感。
模型规模扩大有助于降低不同元件间的生成质量波动,但对整体平均相似度的提升有限。
补充生物信息学分析表明,当前模型在ORF连续性等方面已表现出一定合理性,但在密码子偏好、调控基序和剪接规则等细粒度生物学机制层面仍有较大改进空间。
总体而言,本研究为基因组语言模型在作物基因组生成任务中的应用提供了系统的实验依据,为后续面向功能约束和农业育种需求的序列设计研究奠定了基础。
计算机在会计领域的普遍应用,使得企业单位的会计核算工作越来越多地被计算机所取代。会计计算机化成为促进会计工作规范化和现代化的一种重要手段和会计工作发展的一个新的研究课题。 论文关键词:会计档案管理企业单位会计工作规范化电算化会计核算工作计算机化会计领域现代化 一电算化会计档案的特点 会计电算化就是以电子计算机为主的当代电子枝术和信息技术应用到会计实务中的简称,是用电子计算机代替人工记账、报账...
[摘要]传统国际刑事司法协助机制在应对跨境网络犯罪时面临迟滞性困境,催生了网络远程搜查的跨境适用趋势,此举虽提升了取证效能,却对属地主权原则构成严峻挑战。本文通过法教义学分析,厘清网络远程搜查作为一种独立强制性侦查措施的法律品格,借镜美、日、德三国的差异化实践样态,主张在比例原则的框架下对其适用边界予以限缩。研究表明,仅在基于权利主体有效同意、依托境内网络服务提供者协助,以及客观上无法开展司法协助...
分析数字签名的功能、原理及其与传统手写签名的差别,对基于身份的数字签名进行了探讨,给出了数字签名在电子政务中的具体应用。 论文关键词:数字签名:电子政务;信息安全 1概述 1.1概念与功能 数字签名是防止他人对传输的文件进行破坏.以及确定发信人的身份的手段该技术在数据单元上附加数据,或对数据单元进行秘密变换.这种数据和变换允许数据单元的接收者用以确认数据单元来源和数据单元的完整性,从而达到...
随着互联网的广泛应用,网络信息安全问题越来越受到人们的关注。本文分析了目前网络信息安全领域存在的多种安全问题,提出了实现网络信息安全的防范措施。1引言随着Internet的迅猛发展,网络上各种新业务也不断兴起,比如电子商务、网上银行、数字货币、网上证券等,使得工作、生活变得非常方便,但病毒侵虐、网络犯罪、黑客攻击等现象时有发生,严重危及我们正常工作、生活。据国际权威机构统计,全球每年因网络安全问题...
通过对教学实践工作的不断探索与总结,从教学内容安排、教学内容拓展和教学手段运用三个方面对“光电技术”课程的教学方法进行了研究,并将其运用到课堂,取得了良好的教学效果。 1960年第一台红宝石激光器的问世可以说是光学发展史上的里程碑,该发明解决了光频载波问题,此后光电子技术得以蓬勃发展,在现代信息产业结构中扮演着重要角色。…由于社会发展的需要,近十多年来许多高...
介绍了信息系统建设中软件项目管理的理念,深入探讨了软件项目管理的组织模式、内容、配置管理、质量管理、风险管理及人员管理等,并给出了软件项目计划书的范本。 论文关键词:软件项目管理;软件配置管理;软件项目计划书 1软件项目管理的组织模式 1.1项目管理委员会。项目管理委员会是公司项目管理的最高决策机构,—般由公司总经理、副总经理组成。主要职责如下:(1)照项目管理相关制度管理项...
信息技术的发展,给人类社会带来了极大的便利,更是铁路“十一五”规划实现跨越式发展的重要保障。信息化同时也带来了风险,铁路基层站段信息系统存在的安全问题,就是一个应当引起我们关注和积极研究应对措施的课题。随着信息化的发展,铁路层站段的运输十产已经越来越离不开计算机及络技术的运用了,尤其是近几年,TMIS系统、货运计量监控系统、列车追踪系统等已经深人到我们层站段的各个业务作业领...
计算机基础课的教学不同于现代化教育体系中的那些传统的课教学,它的教学是一种极其复杂的过程。建构主义教学理论恰好提供了一种与传统的教学理论不同的学习理论;利用建构主义学习理论指导计算机基础课的实践教学我认为是现代化计算机教学的一个改革的方向。 论文关键词:计算机基础教学;传统教学;建构主义;意义建构;协作学习 0、引言 随着计算机科技遵循”摩尔定律”飞速发展的事实,以及...
科学有效的软件项目管理有助于项目开发的成功.本文介绍了软件项目管理的内容并结合软件项目开发经验,探讨了影响软件项目管理的几个关键因素. 0引言 随着信息技术的飞速发展,软件产品的规模和复杂度随之增加,传统作坊式的开发方式逐步被以项目组为单位的协作式开发方式所取代,这就必然涉及到对软件项目的管理.实践表明,一个软件项目的成败,不在于其项目组的技术人员的技术水平,而在于是否采用的合适的管理:.好的...
为防止恶意攻击,文章从税控信息加密、税控软件系统在线升级、异常情况处理等方面阐述了进一步提高税控收款机安全性的设计方法 论文关键词:税控收款机;信息加密;软件在线升级;异常情况处理 税控系统由于涉及信息的敏感性,自然成为黑客的攻击目标。为防止恶意攻击,并保证税控收款机在诸如掉电、异常拔卡等异常事件发生时的信息安全,根据信息技术安全性评估准则(GB/T18336—2001)的要求,税...