Um design de UPS só é aprovado quando todos os escritores param antes do armazenamento partilhado e todos os anfitriões terminam antes do corte da bateria, com tempo restante medido para novas tentativas.
Um único estado verde da UPS no hipervisor não prova que as VMs, os contentores, o switch de rede e o NAS recebem ou sobrevivem ao mesmo evento. Defina marcas temporais e condições de interrupção, execute primeiro um evento de software e, em seguida, faça um teste controlado de perda da rede elétrica com cópias de segurança atuais e acesso à consola local. A decisão final também deve incluir a recuperação a frio, porque os serviços que param corretamente podem ainda reiniciar antes de o armazenamento estar pronto.
Defina a condição de aprovação e o limite de interrupção
Um design de encerramento da UPS só é aprovado se as aplicações deixarem de aceitar escritas, as bases de dados e os contentores terminarem, as VMs atingirem o estado parado, os anfitriões de computação encerrarem e o armazenamento partilhado for desligado por último, enquanto a rede de controlo permanece disponível. A recuperação deve iniciar o armazenamento e a rede antes dos sistemas convidados dependentes.
O Network UPS Tools pode distribuir o estado de uma UPS monitorizada pelos clientes; um modelo de servidor e cliente de UPS prático explica o modelo de servidor e cliente. Esse caminho de controlo não comprova a autonomia da bateria nem a ordem dos sistemas convidados, por isso enumere todos os dispositivos, dependências, responsáveis pelo encerramento, tempos limite e watts medidos antes de testar.
Prepare acesso à consola local, cópias de segurança atuais, transações descartáveis e um observador identificado. Interrompa se o armazenamento comunicar erros, a carga da bateria estiver abaixo do limiar de início planeado, o autoteste da UPS não estiver saudável ou algum dispositivo necessário não puder ser desligado manualmente.
Execute um evento de software antes de remover a alimentação da rede
Acione o evento suportado de bateria fraca simulada ou de encerramento forçado sem cortar a alimentação da rede. Registe marcas temporais sincronizadas para o estado da UPS, a notificação do cliente, a paragem da aplicação, o encerramento do sistema convidado, a paragem do contentor, o encerramento do anfitrião, a desmontagem do armazenamento e o momento em que os serviços de rede desaparecem.
Use a sequência da ZimaSpace para otimizar a ordem de encerramento da UPS e manter os escritores e a computação à frente do armazenamento partilhado. Este teste acrescenta o critério de decisão: todas as dependências devem cumprir o respetivo prazo, não apenas receber um comando de encerramento.
APROVADO significa que todas as fases são concluídas pela ordem correta e o monitor da UPS permanece como fonte de autoridade. REPROVADO significa que um cliente não recebe o evento, um sistema convidado excede o tempo limite ou o armazenamento perde clientes prematuramente. Restaure a configuração e corrija apenas o elo que falhou antes de tentar uma interrupção real.
Execute um teste controlado de perda da rede elétrica
Com a pilha sob uma carga representativa e as cópias de segurança pausadas, desligue a entrada da rede elétrica utilizando o método de teste seguro do fabricante da UPS, mantendo intacta a saída da UPS. Registe o tempo até ao limiar do evento, a percentagem de carga, a estimativa da bateria, as durações do encerramento e a margem restante. Não desligue cabos de dados nem de alimentação de armazenamento em funcionamento.
Um fluxo de trabalho detalhado para Proxmox e NUT descreve o tempo de encerramento limpo dos sistemas convidados para encerramentos limpos dos sistemas convidados. Use o respetivo modelo de tempos como comparação, mas preserve o pior caso medido nos seus próprios anfitriões, armazenamento e bateria envelhecida.
Interrompa restaurando a alimentação da rede se algum sistema convidado for terminado à força, o armazenamento ficar indisponível enquanto os clientes escrevem, o switch de rede morrer prematuramente, a temperatura subir inesperadamente ou a autonomia restante se aproximar do tempo limite não resolvido mais longo. Uma aprovação apenas de software não pode substituir um teste de bateria reprovado.
Verifique a recuperação a frio e a repetibilidade
Depois de todos os dispositivos estarem totalmente desligados, restaure a alimentação da rede e observe se a UPS, o switch, o NAS, o hipervisor, os contentores e as aplicações arrancam pela ordem prevista. Verifique os sistemas de ficheiros, os registos de recuperação da base de dados, o estado das VMs, as montagens e uma transação descartável. Desative o arranque automático não controlado até a disponibilidade do armazenamento ser determinística.
Repita o evento de software após qualquer alteração de tempo limite e, em seguida, faça outro teste de alimentação controlado após alterações à bateria, à UPS, ao switch, ao anfitrião ou à topologia de armazenamento. Mantenha a duração de encerramento medida e a reserva da bateria no registo de manutenção.
Aprove o design apenas depois de dois ciclos encerrarem corretamente, recuperarem sem reparação e manterem uma reserva superior ao percurso mais lento. Escale telemetria inconsistente da UPS, colapso da bateria ou erros de armazenamento; esses problemas invalidam a alegação de encerramento mesmo que a consola do anfitrião indique “desligado”.
Suporte e Dicas
Mais para Ler

A partilha NAS mostra ficheiros antigos após a substituição do armazenamento: verificações e soluções
Compare o armazenamento local com a partilha ativa e um cliente limpo. Repare apenas a camada que tenha sido comprovadamente desatualizada e, em seguida,...

Guia de manutenção do arrefecimento de mini PCs: ventoinhas, grelhas de ventilação e valores térmicos de referência
Utilize leituras repetíveis em repouso e sob carga. Limpe primeiro o fluxo de ar externo, confirme o comportamento da ventoinha e abra o chassis...

Lista de verificação da atualização do firmware do servidor doméstico para a BIOS, a ordem de arranque e os dispositivos
Registe primeiro as versões, as entradas UEFI e o estado do armazenamento e do passthrough. Atualize uma camada de cada vez e mantenha o...

