Um SSD SATA pode desaparecer após um reinício a quente quando o controlador ou a ligação permanece num estado incorreto que só a remoção total da alimentação consegue limpar.
Um reinício normal repõe o software, mas pode não remover a alimentação de standby do SSD, do controlador, do backplane ou da porta da motherboard. Se a ligação não ficar pronta, a unidade pode desaparecer antes de as partições, os sistemas de ficheiros, os pools ou as aplicações entrarem em funcionamento. Um encerramento completo altera o diagnóstico porque força uma inicialização mais profunda do controlador e da ligação. Comece por identificar a camada mais baixa que perde o dispositivo, em vez de reconstruir imediatamente o armazenamento ou substituir o sistema de ficheiros.
Determine se é a BIOS, o controlador SATA ou apenas o sistema operativo que perde o SSD
Registe se o SSD aparece na BIOS ou UEFI, na vista do controlador do sistema operativo, na lista de dispositivos de bloco, na tabela de partições e no sistema de ficheiros montado antes e depois de um reinício a quente.
O guia libATA do Linux descreve como o controlador aguarda que uma ligação SATA fique pronta e pode considerar um dispositivo ausente quando essa prontidão falha. O seu modelo de recuperação de ligações SATA explica por que motivo um disco pode desaparecer antes de se alcançar qualquer camada do sistema de ficheiros.
Se a BIOS também perder o SSD, concentre-se no firmware, na alimentação da porta, na inicialização da ligação, no cabo e no controlador da unidade. Se a BIOS o detetar, mas o sistema operativo não, preserve os registos do sistema operativo e inspecione a enumeração do controlador e o modo do controlador.
Compare o reinício a quente, o encerramento completo e a remoção da alimentação
Teste um reinício normal, um encerramento do sistema operativo seguido de uma ligação imediata e um encerramento com a alimentação desligada durante tempo suficiente para que as linhas de standby descarreguem. Repita cada estado pelo menos duas vezes.
A vista dos dispositivos PCI fornece um limite claro entre a presença do controlador e a deteção do armazenamento. O utilitário lspci pode confirmar se o próprio controlador AHCI ou SATA mudou durante o reinício, mesmo quando o dispositivo de bloco SSD está ausente.
Se apenas a remoção total da alimentação restaurar a unidade, os candidatos mais prováveis são um estado retido do controlador, uma reposição incompleta da PHY SATA, o estado do firmware do SSD ou uma interação com a gestão de energia. Este padrão é menos compatível com um problema normal de montagem ou de partições.
Inspecione a primeira ligação SATA e o erro de reposição
Guarde o registo de eventos do kernel ou do sistema relativo ao reinício a quente falhado antes de efetuar um arranque a frio. Procure mensagens de ligação interrompida, falhas de COMRESET, tempos limite de prontidão do dispositivo, comandos IDENTIFY falhados ou reposições repetidas da porta.
A gestão ativa de energia da ligação SATA pode colocar a ligação em estados de baixo consumo que algumas combinações de controladores e SSD gerem mal. A ArchWiki alerta para o facto de uma gestão agressiva da energia da ligação poder causar problemas graves em dispositivos incompatíveis.
O primeiro erro é mais útil do que as mensagens posteriores que indicam que o sistema de ficheiros ou o pool está indisponível. Preserve o número da porta e o modelo da unidade para que todos os testes posteriores de cabos, ranhuras e firmware possam ser associados ao mesmo percurso.
Verifique o cabo SATA, o conector de alimentação e os contadores de erros da interface
Volte a encaixar o cabo de dados SATA e o conector de alimentação com o servidor completamente desligado. Inspecione patilhas de bloqueio soltas, dobras acentuadas, divisores, conectores do backplane e adaptadores.
As orientações de resolução de problemas de armazenamento da Unraid indicam que o aumento de erros CRC UDMA deve levar à verificação dos cabos de dados, cabos de alimentação, ligações do controlador e portas, em vez de se avançar imediatamente para a reparação do sistema de ficheiros.
Uma contagem histórica de CRC não prova que o cabo atual continue danificado. Registe o valor bruto, execute um ciclo de reinício controlado e verifique se o contador aumenta.
Analise o SMART do SSD, os registos de erros e o estado do firmware
Capture o modelo do SSD, o número de série, a revisão do firmware, o número de ciclos de alimentação, o número de encerramentos inseguros, os erros da interface e os registos de erros do dispositivo disponíveis enquanto a unidade estiver visível.
A referência do smartctl descreve atributos SMART e registos de erros que ajudam a distinguir problemas de saúde da memória flash de falhas de transporte ou do controlador.
Aplique uma atualização do firmware do SSD apenas depois de verificar as cópias de segurança, a compatibilidade do modelo e as instruções de recuperação do fabricante. Altere uma camada de firmware de cada vez, para que seja possível identificar uma correção bem-sucedida.
Utilize uma nova análise apenas como diagnóstico
Quando o controlador continua presente, mas o disco está em falta, efetue uma única nova análise de armazenamento suportada depois de parar todas as operações de E/S ativas. Registe se o SSD regressa sem um ciclo de alimentação.
A Microsoft documenta que o comando rescan localiza discos recentemente detetados no DiskPart, sendo útil para distinguir uma enumeração atrasada do sistema operativo de uma unidade ausente ao nível do controlador.
Uma nova análise bem-sucedida não é uma solução permanente. Mostra que o controlador e o SSD conseguem comunicar após outra tentativa de deteção, pelo que o trabalho restante deve concentrar-se no firmware, no controlador, no modo do controlador ou na inicialização da ligação.
Isole a unidade, a porta e o controlador antes de os substituir
Depois de efetuar uma cópia de segurança dos dados, mude o SSD para uma porta SATA comprovadamente funcional utilizando um cabo comprovadamente funcional, ou teste uma unidade comprovadamente funcional no percurso original. Altere apenas um componente por ciclo.
O guia da ZimaSpace sobre a distinção entre falhas do cabo SATA e da unidade apresenta o fluxo de isolamento adjacente para percursos de armazenamento que falham de forma intermitente.
O problema está resolvido quando o SSD permanece visível através de vários reinícios a quente, arranques a frio, períodos de inatividade e leituras prolongadas, sem novos erros de ligação. Deixe de utilizar a unidade para dados primários se continuar a desaparecer através de portas e cabos comprovadamente funcionais ou se apresentar erros do dispositivo em agravamento.
Suporte e Dicas
Mais para Ler

O Plex pode partilhar uma GPU com outro contentor Docker?
O Plex e outro contentor conseguem frequentemente aceder à mesma GPU, mas é necessário testar o suporte dos controladores, o mapeamento de dispositivos, a...

Como saber se um erro do Plex vem do cliente ou do servidor
Reproduza o mesmo item noutro cliente, compare o percurso da sessão e, em seguida, recolha provas do servidor apenas depois de o âmbito lhe...

Como configurar a cache do Plex e o armazenamento temporário de transcodificação
Proteja o estado persistente do Plex enquanto coloca os ficheiros temporários de transcodificação num armazenamento local adequado e, em seguida, verifique a limpeza, o...

