本帖最后由 陈璨 于 2026-9-9 10:52 编辑
一、引言 在用户的日常运维使用中,常常涉及到需要从单个大集群中分离一台或数台主机另组集群的场景。本文为这种场景提供一个已经验证的操作步骤和经验分享。
二、概述
缩容的主要步骤分为:删除磁盘组、删除主机这里两步。通过主动将磁盘组中的数据在其他盘上进行重建,再进行隔离,来实现删除磁盘的目的。其中删除磁盘组的操作与耗时都比较多,业务性能要求不高的可以对ssd进行【保证数据安全进行隔离】,这样能够减少操作的次数,对工程师比较友好。
三、工具缩容 缩容分为两种,一个是adeploy工具缩容,适用于已支持的低版本。二是手动缩容,适用于未被工具支持的新版本,如6.11.1R1、6.11.3等。
四、手动缩容 (1)注意事项 手动缩容时的注意事项与工具缩容时注意事项是类似的,但是更细节一些因此手动缩容需要额外注意。
1、手动缩容时,需要按照先删除硬盘,再删除主机的步骤,逐台主机进行。 2、在删除磁盘时,会有IO波动主要是在进行数据同步和数据重建,需要注意客户业务影响。 3、建议优先选择隔离SSD,这样会连带整个磁盘组一次性完成隔离。如果磁盘组内多块hdd分开隔离,最后隔离ssd的时候可能会报错。详见faq3 4、硬盘隔离时不能选择快速隔离,快速隔离不能达到删除磁盘的目的,必须选择优先保证数据安全! 5、不支持同时进行缩容任务,并发数限制1个任务,即每次只能开始一块hdd或者一块ssd的隔离。(会有如下提示)
6、支持多块盘同时处于隔离状态,即允许多块盘依次完成隔离后同时存在。 7、对于整个磁盘组预计隔离时间过长的,可以先隔离hdd,再隔离ssd,这样能分段进行隔离。 8、集群中主机均在线,且磁盘无故障,无亚健康,以保证能够正常进行数据迁移; 9、虚拟存储卷类型为普通卷或延伸卷,目前复合卷不支持缩容; 10、不支持同时缩容一个集群的多台主机,每次只能缩容一台; 11、缩容过程中会禁用集群的卷运维操作,即不允许创建卷、扩容卷、删除卷、替换磁盘、替换主机等; 12、延伸卷场景下,待删除主机所在故障域内数据节点数不能低于3台,且如果原本两个故障域内主机数相等,只缩容其中一台会导致容量不平衡。为了保证容量平衡,最好是每个故障域都缩容掉同样的主机数; 13、延伸卷场景下,待删除主机所在故障域内数据节点数不能低于3台,且如果原本两个故障域内主机数相等,只缩容其中一台会导致容量不平衡。为了保证容量平衡,最好是每个故障域都缩容掉同样的主机数; 14、环境中有数据平衡、数据同步等任务正在执行时(缩容触发的任务不在此类),不建议进行缩容,需等任务结束后再开始缩容; 15、待删主机上如果有正在使用的共享盘、iSCSI盘等链接,或者是作为共享盘跨卷服务或者iSCSI服务的接入主机时,需要技术支持介入处理,且处理过程中可能会出现业务断流情况; 16、缩容后需将被删除的主机恢复出厂设置,否则该主机后续无法被其它环境使用。 17、被缩容主机(A)的已使用容量加上剩下任意一台主机的已使用容量(B已用)之和,除以这台主机的总容量(B总)的值要小于90%,注:换算成运算式为(A已用+B已用)/B总<90%,其中A为被缩容主机,B为同一个存储卷中剩下的任意一台主机,A已用:为A主机已使用容量,B已用:为B主机已使用容量,B总:为B主机总容量 18、5主机场景下缩容,除缩容主机外,剩余主机中至少需要3台主机不少于2个磁盘组
(2)缩容前的必要评估准备 1、评估待缩容主机的cpu和内存资源 我们需要对缩容前后的集群CPU、内存资源进行评估,需要保证在缩容主机之后,剩余的CPU占用不会高于80%,内存占用不会高于85%;
2、评估待缩容集群的硬盘资源 其次硬盘资源需要在缩容之后满足缩容的要求,如缩容后存储卷内数据节点不低于3,待缩容的主机容量使用不小于90%等。
这里提供一个较为简单的容量计算方法,将存储卷中节点的使用容量和总容量代入如下语句,发给deepseek或者千问等ai进行计算即可。ai问法:(现有五台服务器的存储使用TB数为:XX、XX、XX、XX、XX。我现在要进行服务器缩容,存储评估公式要求,被缩容的主机A已使用容量,加上任意一台主机B已使用容量,除以主机B的总容量时,要小于90%,公式总结为:(A使用+B使用)/B总容量 < 90%。五台主机的总容量都是29.1TB,现在我要缩容已使用了XX TB和XX TB的这两台主机,在逐台进行缩容时,原有的数据容量会平均迁移到剩余主机上。因此请按照这个公式,计算缩容过程能否正常进行?并给出计算步骤)
(3)操作步骤 配置虚拟机调度策略 1、 SCP配置云主机组,选择所有虚拟机
2、 配置主机组,勾选需要缩容以外的所有主机。 3、 配置虚拟机调度策略,调度方式选【必须在特定主机组运行】,云主机组和主机组分别选择前述步骤所配置,并勾选【启用】。
迁移待缩容主机的虚拟机 1、 在实体机界面,点击需要迁移虚拟机的主机。 2、 勾选全部虚拟机,再点击【更多操作】-【迁移】,目标运行位置选择为【自动选择】,再多次点击【下一步】直到开始迁移。
隔离磁盘or磁盘组 1. 如隔离ssd磁盘时长不超过12小时,则整个磁盘组进行迁移。如果隔离ssd磁盘时长超过12小时,则先隔离hdd,再隔离ssd方式分段进行,以缩短时间避免影响业务。(但是最后隔离ssd的时候可能报错,建议业务能接受的情况下直接隔离ssd)
2. 等待任务列表中的存储任务结束后,再进行下一块磁盘的隔离。
删除主机 等隔离完所有磁盘后,对主机点击【更多】,选择删除主机。
(4)回退方案 1、 当前如果是完成所有磁盘隔离后,需要将磁盘恢复。可以点击对应磁盘组的ssd,选择解除隔离。
2、 当前如果是已经完成了磁盘删除,需要将磁盘恢复。可按照磁盘扩容步骤将磁盘重新扩容至对应存储
五、FAQ (1)删除主机失败,检测到删除主机失败,检测到存在虚拟机通过当前主机跨卷访问存储,请迁移到存储卷内主机后,再重试删除!
由于当前集群存在2个不同的卷,因此虚拟机会有跨卷访问存储的情况。跨卷访问存储即为:主机123属于vs1,主机456属于vs2,一台存储数据在vs1上的vm,运行在主机4上。
根因1. 有虚拟机使用了待删除主机的跨卷访问ip,不允许删除主机
2. 有挂载点使用了待删除主机的跨卷访问ip
3、也有可能是虚拟机挂载了与vm不在同一个vs的软件分发盘,池模式个人盘也会提示跨卷运行。软件分发盘可以解除挂载,池模式个人盘只能删除再重新创建。具体可以在HCI集群的【存储】-【aDesk磁盘管理】查看相关磁盘的存储位置。
(2)删除主机失败,检测到卷接入IP存在当前主机上,请联系深信服科技处理后,重试删除!转研发支持,考虑是主机上有存储卷相关的角色或者配置没切到其他主机,需要手动切走。 680以上vs容器中 vsmgr volume hosts 可以查看存储卷相关的hosts和角色
(3)隔离了单个磁盘组内所有HDD后,隔离磁盘组的ssd保存不允许隔离。
1、取消当前磁盘组的所有hdd的隔离 2、重新点击ssd进行隔离。 注意:取消hdd隔离时候没有io影响。
|