O que faz com que um array RAID permaneça degradado após a substituição de um disco?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

Uma matriz RAID permanece degradada quando o substituto é visível mas ainda não se tornou um membro válido para reconstrução. Causas comuns são tamanho errado, metadados externos, estado não suportado, falta de atribuição manual ou outro disco fonte em falha.

Não inicialize o substituto nem importe uma configuração externa aleatoriamente. Primeiro identifique a matriz exata, o papel em falta, o número de série do substituto, o estado do controlador e a elegibilidade para reconstrução. O objetivo é anexar um alvo vazio elegível sem alterar a configuração da fonte confiável.

Confirme que o substituto é reconhecido pelo controlador correto

Um disco pode aparecer no sistema operativo enquanto permanece indisponível para o controlador RAID, ou aparecer para o controlador num slot de invólucro diferente do esperado. Compare o número de série físico, baía, porta do controlador e contagem de setores reportada.

Se o novo disco não for visível na camada RAID, verifique a alimentação, backplane, cabo, modo HBA e mapeamento do invólucro antes de alterar os metadados da matriz. Inserções repetidas sem identificar o número de série podem levar à manutenção do membro errado.

Ready, Unconfigured e Spare não estão a reconstruir

Muitos controladores de hardware colocam um novo disco num estado neutro, como Ready ou Unconfigured Good. A matriz permanece degradada até que o disco seja atribuído como substituto, reserva dedicada ou reserva global elegível conforme o fluxo de trabalho desse controlador.

Um novo disco em estado Ready é um exemplo útil: a simples presença não preenche o papel em falta no RAID. Verifique se é necessária inserção a quente, substituição manual ou atribuição de reserva.

O RAID por software geralmente necessita de uma adição explícita

As matrizes md do Linux não reintroduzem necessariamente um disco desaparecido apenas porque um dispositivo de bloco retornou no mesmo caminho. O membro antigo pode ainda estar marcado como removido, enquanto o substituto existe apenas como um dispositivo não utilizado.

O comportamento de re-adicionar manualmente com mdadm reflete um limite de segurança: confiar automaticamente num dispositivo que desapareceu anteriormente pode ser pior do que exigir que um administrador o verifique e adicione deliberadamente.

Metadados estrangeiros podem bloquear a substituição

Um disco reutilizado pode conter assinaturas RAID de outro array. Os controladores etiquetam isto como estrangeiro porque importá-lo poderia alterar a configuração ativa. Um disco novo em folha também pode conter metadados de fábrica, teste ou uso anterior que impedem a elegibilidade automática.

Não importe configuração estrangeira de um disco destinado a ser uma substituição vazia. No caso de estado de disco de substituição estrangeiro, alterar o novo membro para um estado não configurado-bom foi o caminho relevante, não importar a sua definição antiga do array.

A capacidade e a geometria dos setores devem cumprir o mínimo do array

A substituição deve fornecer pelo menos tantos setores utilizáveis quanto o membro falhado. Um disco nominalmente igual pode ser um pouco menor. Alguns controladores também rejeitam uma alteração no formato lógico ou físico dos setores, tipo de interface, qualificação de firmware ou capacidade de encriptação.

Compare o tamanho exato e o formato dos setores em vez de apenas a etiqueta na caixa. Se o controlador reportar o novo disco como não suportado ou demasiado pequeno, não o force a ficar online; escolha um alvo maior compatível.

Outro disco de origem pode estar a impedir a reconstrução

Uma reconstrução necessita de dados legíveis dos membros sobreviventes. Se outro disco tiver setores irrecuperáveis, tempos limite repetidos ou quedas do array, o controlador pode abortar, manter a substituição como reserva ou permanecer degradado após uma tentativa de reconstrução falhada.

Revise o registo de eventos desde o momento em que o disco original falhou até à tentativa de substituição. O alerta mais recente pode referir-se ao alvo, enquanto o verdadeiro bloqueio é um erro de leitura num membro de origem diferente.

Utilize uma ordem de resolução de problemas baseada no estado

Estado de substituição Significado provável Próxima verificação
Não detetado Problema de ligação ou caminho do controlador Energia, cabo, baía, HBA, mapa serial
Pronto / Não configurado Bom Visível mas não atribuído Atribuição de substituição ou reserva
Estrangeiro Metadados RAID antigos presentes Verifique a identidade; limpe apenas os metadados do novo alvo
Demasiado pequeno / não suportado Falha de elegibilidade Setores exatos, formato, suporte do controlador
Reserva, não a reconstruir Sem gatilho ou erro de fonte Papel em falta, política, registos de membro sobrevivente
Reconstrução abortada Fonte ou caminho não pôde ser concluído Erros de leitura, tempos esgotados, segunda falha

Uma atribuição manual de reconstrução específica do controlador pode usar uma ação de reserva a quente para desencadear a recuperação. Use a transição de estado documentada da plataforma em vez de comandos genéricos copiados de outro sistema RAID.

Verifique o Gatilho de Reconstrução Antes de Sair do Sistema

Uma vez atribuída a substituição, observe tempo suficiente para confirmar que os blocos processados aumentam e que o número de série pretendido é o alvo. Uma transição de estado que começa e aborta imediatamente ainda é um array degradado, mesmo quando o painel exibiu brevemente a reconstrução.

Guarde o primeiro erro após uma interrupção. Muitas vezes identifica o bloqueio real de forma mais clara do que o resumo final, especialmente quando um disco fonte sobrevivente expira ou o controlador rejeita a geometria do alvo.

Perguntas Frequentes

Devo inicializar primeiro o disco de substituição?

Normalmente não. A inicialização pode escrever metadados e pode ser destrutiva se o disco errado for selecionado. Prepare apenas o alvo confirmado como vazio usando o fluxo de trabalho de substituição do controlador.

Por que a troca a frio deixou o novo disco por usar?

Alguns controladores detetam e associam uma substituição de forma diferente durante a inserção a quente. A troca a frio pode deixar um papel em falta mais um disco pronto separado que deve ser atribuído manualmente.

Posso forçar o disco a ficar online?

As ações de forçar online destinam-se a situações específicas de recuperação e podem promover dados obsoletos. Para uma substituição nova e vazia, atribua-a como alvo de reconstrução ou reserva em vez de fingir que contém dados atuais do array.

O Array Torna-se Saudável Apenas Após Alterações na Membro

Uma substituição visível não remove o estado degradado. Deve ser elegível, atribuída ao papel em falta, reconstruída a partir de fontes legíveis e promovida a um membro ativo sincronizado.

Suporte e Dicas

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.