Solução da comunidade

Disco em falta no RAID5 do ZimaOS numa nova configuração: o que verificar

A new three-disk RAID5 alternated between one missing disk and all disks missing, suggesting unstable drive detection rather than a normal single-disk failure.

Se um RAID5 acabado de criar alternar entre um disco em falta e todos os discos em falta, pare a reconstrução e verifique primeiro se as três unidades são detetadas de forma consistente. Esse padrão aponta mais fortemente para problemas de alimentação, cablagem, backplane/controlador ou instabilidade na deteção dos discos do que para três falhas simultâneas de RAID.

O RAID5 atual do ZimaOS requer pelo menos três discos e deverá apresentar um membro com falha como Degradado. Reiniciar repetidamente não corrige um caminho de unidade que desaparece de forma intermitente.

Passo 1: Verifique Todos os Discos Fora da Vista do RAID

lsblk -o NAME,SIZE,MODEL,SERIAL,TRAN
dmesg | grep -Ei 'ata|sas|scsi|reset|error|fail' | tail -150

Execute estas verificações após vários arranques a frio. Os três discos de 16 TB deverão aparecer sempre, com informações estáveis sobre o modelo e o número de série.

Passo 2: Volte a Ligar as Ligações de Alimentação e de Dados

Desligue completamente o sistema antes de voltar a ligar os discos, os cabos SATA/SAS, os conectores do backplane ou as ligações ao HBA. Um disco grande de 3,5 polegadas pode desaparecer durante o arranque quando a alimentação é insuficiente.

Passo 3: Verifique o SMART de Cada Disco

smartctl -x /dev/sdX

Procure testes automáticos falhados, erros de suporte, tempos limite de comandos, setores pendentes ou erros de interface. Um disco novo também pode estar avariado.

Passo 4: Inspecione o Estado do RAID

O guia atual de configuração do armazenamento do ZimaOS indica que um membro com falha deverá colocar o conjunto no estado Degradado, mantendo os dados acessíveis.

Os utilizadores avançados também podem consultar:

cat /proc/mdstat
mdadm --detail /dev/mdX

Utilize estes comandos apenas se o conjunto atual for baseado em md e souber qual é o dispositivo correto.

Não Recrie o RAID Até a Deteção Estar Estável

Se todos os discos desaparecerem de forma intermitente, uma nova criação limpa do RAID voltará simplesmente a falhar. Corrija primeiro o caminho de hardware/controlador.

O RAID5 Requer Três Membros Fiáveis

O guia atual do RAID5 do ZimaOS descreve o RAID5 como armazenamento com paridade simples, capaz de sobreviver à falha de um membro. Não foi concebido para tolerar a deteção instável de vários discos.

Faça uma Cópia de Segurança Antes de Reconstruir um Conjunto Existente

Se o conjunto já contiver dados, não o elimine nem recrie apenas porque a interface indica um membro em falta. Proteja primeiro os dados e determine se o disco falhou realmente ou se apenas desapareceu do controlador.

Verifique Separadamente a Lógica de Substituição/Reconstrução

Se um disco específico estiver consistentemente assinalado como falhado, substitua apenas esse disco e siga o processo de reconstrução do ZimaOS. Não inicialize a substituição aleatoriamente nem a adicione a um novo conjunto.

O guia de resolução de problemas da reconstrução do RAID apresenta o passo seguinte depois de a deteção estar estável.

Perguntas Frequentes

Porque é que um RAID5 novo indica Disco em Falta?

Um disco pode ter sido desligado durante a criação ou pode não estar a ser detetado de forma fiável devido à alimentação, cablagem, backplane ou controlador.

Devo reiniciar repetidamente?

Não. Em vez disso, utilize verificações repetidas da deteção para diagnosticar o caminho de hardware instável.

O RAID5 pode funcionar com dois discos?

Não. O RAID5 atual do ZimaOS requer pelo menos três discos.

Devo reconstruir de raiz se todos os discos desaparecerem por vezes?

Não. Corrija primeiro a deteção dos discos; caso contrário, o novo conjunto poderá falhar da mesma forma.