
0 引言
云计算是一个热门研究方向,许多企业都相继开发出自己的云端系统进行运算与研究。然而,只要是计算机就会发生错误[1]。在云计算中由于资源的高度动态性和异构性,使云计算平台较传统计算平台出错几率更高[2]。为减少发生错误所造成的损失,需要容错机制保证系统在故障情况下也能持续运行[3]。容错包括故障检测或识别、故障预测和故障恢复3个策略。故障检测或识别通常用于检测故障类型,然后用最合适的方案进行故障诊断。故障预测侧重于根据历史数据预测故障发生的概率,并应用合适的调度策略降低故障概率。故障恢复常用技术有作业复制和检查点[4]。作业复制的优点是不需要重新计算,因为每个作业都会同时分配给不同资源的多个副本,如果其中一个失败,其它作业副本仍然可以处理[5]。但是,这种技术不是很有效,因为作业的副本单独执行可能会占用作业队列。检查点是另一种技术,它要求将运行任务的状态存储在一个已定义的检查点上。如果作业执行失败,则从最后一次保存的状态重新启动任务执行而不是从头开始,这样可极大地节省任务执行时间。
针对云计算容错技术,国内外学者进行了相应研究,提出了许多算法:文献[6]提出了周期任务模型的容错调度算法,但是该模型要求所有任务的周期完全相同,文献[7] 研究了动态实时调度算法与速率单调算法。文献[8]讨论带固定优先级实时调度算法,这些算法均没有考虑系统的容错问题。文献[9]针对当前计算机系统计算和存储资源丰富但并行文件系统写带宽提高相对滞后的特点,提出了基于内存缓存的异步检查点容错技术。文献[10]提出了一种主备份的容错调度策略用于对宿主机的错误容忍,其使用主从宿主机结构,需要设置多个宿主机作为备份宿主机,对宿主机资源浪费比较严重。文献[11]提出了增强型蚁群优化算法(Enhanced Ant Colony Optimization, EACO),根据任务和资源数量引入动态蒸发速率确定信息素蒸发速率,确保每个资源处理的任务数量很多时蒸发率很小,否则蒸发率会很高,实验结果表明控制蒸发率可有效平衡所有资源的负载。文献[12]提出了基于信任的蚁群优化调度算法(Trust-based Ant Colony Optimization,TACO),旨在尽量减少作业完成时间,平衡所有可用资源的工作量,同时引入面向资源的信任机制处理资源故障问题。文献[13]通过ACS算法和有向无环图(DAG)方法相结合,提出了一种新的云计算故障管理算法,该算法可提供有效的资源分配但没有恢复操作。文献[14]提出基于遗传算法(Genetic Algorithm,GA)的混合蚁群优化算法,以克服元启发式算法不受控制的性质,但会降低云计算分配性能。文献[15]提出在云计算中使用检查点的容错蚁群优化算法(Fault Tolerance ACO,FTACO),有效利用云计算中的动态资源解决故障和负载平衡问题。文献[16]提出了使用蚁群优化算法进行云计算的容错作业调度以满足服务质量需求,该服务使用资源失败率和基于检查点的回滾恢复策略。在任务执行期间,故障索引管理器将不断与检查点处理程序交互以记录资源故障率,每发生一次故障,都将应用回滚恢复技术以节省执行时间,该算法减少了任务总执行时间,提高了吞吐量和平均周转时间。 1 系统建模
蚁群优化算法是一种生物启发式算法,为求解优化问题和设计元启发式算法提供一个自适应概念[17]。蚁群优化算法在处理调度和负载均衡时非常有效,且在查找最佳路径过程中出现故障时可构建替代路径,图1为蚁群在查找最佳路径期间出现故障最终找到替代路径的例证[18]。
流程如下:①通过蚁群1建立最优资源a的路径路线;②资源a执行任务失败,重新调用提交流程;③通过蚁群1建立替代资源b的新路径,并完成任务的提交和处理;④从不同来源的蚁群2选择由前一个蚁群1构造的最优路径分配下一个任务。
本文受蚁群寻找最适合资源的最佳路径概念启发,基于此概念进一步扩展,提出基于蚁群算法的动态容错技术(Dynamic ACS-based Fault Tolerance, DAFT),使蚁群能够在重新提交任务过程中执行资源研究,以确保任何执行失败的任务都被完全处理。此外,进一步改进信息素更新技术,作为一种惩罚失败的资源机制,使其不那么有吸引力以最终减少失败的可能性,并根据资源适当控制任务分配。
基于蚁群算法的动态容错算法对每个任务都会生成一个蚁群,根据信息素值选择执行资源。初始化的信息素值首先被启动,以确定所有资源的状态,然后提交队列中的第一个任务。资源的选择是基于信息素初始计算或信息素更新过程的信息素值的量。在执行过程中,每个任务被分成几个检查点,这些检查点将按顺序处理以保持输出的真实性。如果任务执行成功,蚁群会更新全局信息素再执行后增加的信息素;但是,如果在执行过程中出现任何故障,最后一个检查点将重新提交给另一个合适的资源,并且会更新本地信息素,此外每个成功的检查点还将更新本地信息素。最后,资源将与更新的信息素一起发布,用于下一个任务分配。利用重新提交的新资源、检查点技术和资源执行历史记录的方法,减少任务执行和处理时间,提高云计算环境的成功率。
2 基于蚁群算法的动态容错技术
2.1 算法描述
在初始任務期间,每个资源应具有预定义的参数,例如处理器速度、当前负载和带宽以及处理元素的数量,所有这些参数将用来计算初始的信息素值,[PVij] 用于每个资源[i]和任务[j]的组合。 初始信息素值由公式(1)给出。
假定所有资源都是相互关联的,这意味着如果任务来自特定资源,那么它就可以分配给所有可用的资源。[PVmatrix] 中的每一行都列出了资源[i]的可能任务列表,任务[j]的可能资源列表。
每列中最大的信息素值被蚁群视为最适合的资源,并且该任务分配给选定索引所引用的资源进行处理。 一旦任务被分配,相应[PVmatrix]中的信息素值将根据公式(3)更新全局信息素,以减少分配给当前资源的信息素量,使它变得对下一个蚁群不具有吸引力,让其探索其它资源。
2.2 算法流程
图2为DAFT算法流程,实现步骤如下:
(1)初始化。配置所有参数,根据公式(1)计算每个资源的初始化信息素值,为每项任务生成一个单独的蚁群,在第一次迭代中确定具有最高初始信息素的资源。
(2)开始循环。根据蚁群优化算法思想确定最适合的资源,然后发出任务提交信号,通过公式(3)更新全局信息素的值,确实任务是否完成。如果任务完成则结束,否则继续判断任务执行状态。如果任务执行成功就保存检查点,增加成功计数,并根据公式(1)-公式(5)更新局部信息素值。如果任务执行失败,则检索最后一个检查点,重新提交,增加失败计数,并根据公式(5)更新局部信息素,重复步骤(2)操作。
(3)任务状态。任务完成时,终止执行。
3 实验结果
为了验证本文的DAFT算法性能,定义平均成功率为70%(0.7),误差范围用标准偏差±0%(0.0)~±30%(0.3)表示。使用具有标准偏差的伪随机算法分配成功率,在初始化过程中定义每个单独资源范围。每种资源具有不同的成功率,且这些信息在资源分配期间不被蚁群知道。为确保实验的可靠性,每个资源都设置为具有相同的处理能力,参数如表1所示。
在云计算环境中,除了处理能力之外,每个可用资源都具有不同的适应性。在这种情况下,可使用最小和最大适应值形成适应范围。实验结果表明,启发式能够改善任务分配过程并最终提高云计算环境性能。随着执行深入,成功和失败的次数被记录并最终影响资源信息素值的蒸发。可根据资源适应度动态分配任务,如资源的成功率为0%,则分配给它的任务量最少。另一方面,如果资源的成功率非常高,则会分配最多的任务。除了在调度或重新提交过程中考虑资源适应性以外,检查点还允许从最后保存的状态重新提交失败的任务,这大大减少了处理时间,因为任务不需要从头开始。
4 结语
为了提高云计算容错性能,本文提出在云环境下基于蚁群算法的动态容错技术,利用检查点回滚技术消除从一开始就重新启动任务,减少了任务总执行时间,提高了吞吐量和平均周转时间。在资源分配期间,根据其适合度通过蚁群算法的启发式能力选择最佳资源,不但减少了每个任务的处理时间,还提高了云计算环境的成功率。与TACO算法和FTACO算法进行比较,仿真结果表明,本文方法在容错性上明显优于TACO算法和FTACO算法,最大限度提高了云环境下的容错性能。但是,在任务调度过程中,保存检查点的数量太多会加大数据量计算,因此如何控制保存检查点数量是后续研究目标。
由于室内外温度的变化,混凝土许变以及收缩、及汽车动荷载等一系列外部荷载作用的影响,桥梁梁体长度会发生一些变化,使梁端发生位移。为了适应这种位移,并且保持整个梁体平稳,保证行车安全舒适,桥梁结构中必须在合理的位置设置伸缩缝。一、桥梁伸缩缝的作用由于公路桥梁都处于室外,并且根据其使用功能,公路桥梁会受到温度变化、混凝土变形、动荷载等一系列因素的作用,使得桥体产生变形。如果这种变形量过大,会影响到桥体的...
一、政策风向标:2025年医疗领域新规解读2025年医疗圈迎来多重政策叠加期,国家医保局发布的四项新规彻底重构医疗支付体系。门诊押金制度的取消直接降低患者就医门槛,而医保卡跨省家庭共享功能则释放了"健康储蓄"新可能,这些都将间接影响医护人员服务量考核指标。值得关注的是中药标准管理专项规定,首次将经典名方研发纳入法定标准体系,为中药从业人员提供明确的科研转化路径。(1)免疫规划调整带来的科研机遇百白...
“随着年龄的增长,呼吸道局部的防御功能和整个免疫功能是下降的,再加上老年人多合并多种基础疾病,因此老年人容易罹患呼吸道感染,而且一旦罹患了以后容易发展成重症,是我们特别需要关注的一组人群。”11月26日,国家卫健委召开新闻发布会,介绍冬季呼吸道疾病防治情况,专家对老年人预防和治疗呼吸道疾病给出建议。 接种疫苗是最需要的预防措施 ...
随着医疗卫生行业人才评价体系的不断完善,2025年度湖南省卫生系列高级职称专业理论考试即将启动。本次考试聚焦专业能力与实务水平,旨在选拔高素质卫生技术人才。以下从报名流程、考试安排、政策调整等维度全面解读公告要点,助力考生高效备考。一、报名流程优化:线上操作更便捷报名方式统一采用湖南省卫生考试官网在线报名(官网地址:www.hnwsrc.com),考生需在5月24日—30日及6月3日两个时间段内完...
2023年4月11日,上海阳光医药采购网《关于公布全国药品集中采购中选结果的通知》(以下简称“通知”),德展大健康股份有限公司(以下简称“德展健康”)全资子公司北京嘉林药业股份有限公司(以下简称“嘉林药业”)产品氨氯地平阿托伐他汀钙片在列。根据《通知》显示,本次集采中选结果将于2023年7月实施,具体执行日期以各地发布通知为准。 据了解,2021年6月,嘉林药业产品氨氯地平阿托伐他汀钙片顺利获得...
1地下室底板裂缝高层建筑地下室的底板一般较厚,有的厚达2~3m,属大体积混凝土施工。发生裂缝的主要原因是水化热高、与环境气温温差大、或养护不当,裂缝严重的可导致底板渗漏若混凝土温度较高时突然浇冷水养护,也会产生无规则的多条微裂缝。对于大体积混凝土底板施工可采取下列措施:选用低水化热的矿渣水泥掺加高效减水剂,以减少用水量掺加粉煤灰,以减少水泥用量掺加UEA微膨胀剂,以补偿收缩分层分段浇筑混凝土,并加...
据美国趣味科学网10日报道,美国天文学家发现了一个“失控”的黑洞,似乎正在逃离其宿主星系,在太空中狂奔,身后拖曳着一些气体和恒星。研究团队指出,如果这一发现获得证实,将是超大质量黑洞可从其宿主星系喷射出来并在星际空间漫游的首个观测证据。相关研究刊发于最新一期《天体物理杂志快报》。 研究人员使用哈勃空间望远镜观测距离地球约75亿光年的矮星系RCP28时,发现了这个“落跑”的黑洞,其表现为一条明亮的...
4月8日,国家科学技术奖励工作办公室公布2023年度国家科学技术奖初评结果。 2023年度国家科学技术奖初评共计通过59项国家自然科学奖项目、52项国家技术发明奖通用项目、132项国家科学技术进步奖通用项目,在国家科技管理信息系统公共服务平台(https://service.most.gov.cn/jl)公布。初评通过的19项国家技术发明奖专用项目和39项国家科学技术进步奖专用项目在委托...
新中国成立60周年来,我国科技事业蓬勃发展,取得了许多为世界瞩目的成就。尤其在1978年以后,我国的科技事业在经过了十年寒冬后,重新站在了世界科技创新力竞争的起跑线上,我国科技体制改革也逐渐起步,助推新中国科技发展。 我国原有科技体制是在计划经济体制下逐步形成的,其突出特点是科技资源集中在政府所属独立科研院所。这一体制曾在特定的历史时期,为我国经济发展、国防建设和...
在漫长的人类文明发展历程中,土木工程始终占据着举足轻重的地位。它不仅是构建社会基础设施的基石,更是驱动经济与科技进步的关键力量。今日,让我们共同踏上一段探索之旅,深入剖析土木工程专业的历史渊源、当前现状及未来趋势,并一同领略那些在该领域内享有崇高声誉的顶尖学府风采。正文部分一、土木工程专业:历史脉络与发展轨迹古代萌芽:追溯至新石器时代,土木工程的概念已初露端倪。那时的人们利用简陋工具进行土方作业与...
影响因子:0.000
影响因子:0.240
影响因子:0.000
影响因子:4.260
影响因子:0.360
影响因子:5.304
影响因子:0.000
影响因子:13.540