Um conjunto de SSD abranda frequentemente quando se aproxima da capacidade máxima, porque o controlador e o sistema de ficheiros ficam com menos espaço de trabalho limpo para escritas, realocação, metadados e instantâneos.
O ponto dos 15 por cento não é um limite universal, mas constitui um limiar de aviso útil para muitas cargas de trabalho de servidores domésticos. O conjunto pode ter bytes lógicos livres, enquanto os instantâneos, o aprovisionamento fino, os metadados do sistema de ficheiros, os ficheiros eliminados mas ainda abertos ou a ausência de suporte para discard reduzem o espaço que os controladores SSD e o software de armazenamento conseguem realmente reutilizar. Diagnostique a margem de escrita efetiva e a latência de escrita, em vez de depender de uma única percentagem no painel.
Confirme qual valor de espaço livre atingiu os 15 por cento
Compare a capacidade bruta dos SSD, a capacidade do conjunto, o espaço livre do sistema de ficheiros, a alocação aprovisionada de forma fina, a utilização de instantâneos, as quotas, os blocos reservados e o volume da aplicação que parece lento. Estes valores respondem a perguntas diferentes.
O GNU Coreutils explica que o espaço disponível é comunicado com base nos registos do sistema de ficheiros montado, que podem não incluir todos os elementos do conjunto, instantâneos, volumes finos ou reservas ao nível do controlador que afetam as escritas.
Se apenas um conjunto de dados ou volume fino estiver quase cheio, corrija essa camada em vez de considerar que todos os SSD estão lentos. Se todo o conjunto tiver pouca capacidade não alocada, prossiga com as verificações do espaço de trabalho do controlador, do discard e dos instantâneos.
Compreenda por que motivo as escritas NAND precisam de espaço de trabalho limpo
Meça a latência de escrita sustentada e de pequenas escritas aleatórias antes e depois de o conjunto ultrapassar o limiar. A velocidade de leitura pode continuar aceitável, enquanto as escritas são interrompidas ou se tornam inconsistentes.
A Crucial descreve o over-provisioning do SSD como capacidade reservada utilizada para recolha de lixo, nivelamento de desgaste e blocos de substituição, o que explica por que motivo uma menor margem de escrita pode aumentar a realocação em segundo plano durante novas escritas.
Não presuma que todas as lentidões significam que a memória flash está desgastada. Um SSD saudável pode ficar temporariamente lento quando precisa de apagar, mover e reescrever mais dados válidos para cada nova escrita.
Verifique se o discard ou TRIM chega aos SSD
Verifique se os blocos eliminados do sistema de ficheiros são descartados continuamente, periodicamente ou nunca. Inclua todas as camadas entre o sistema de ficheiros e o SSD: encriptação, RAID, aprovisionamento fino, HBA, disco virtual e caixa externa.
A operação retrim do Optimize-Volume da Microsoft demonstra que os blocos eliminados têm de ser comunicados através da pilha de armazenamento, para que o dispositivo os possa preparar para reutilização.
Um comando bem-sucedido ao nível do sistema de ficheiros não prova que o SSD recebeu o discard. Compare os contadores do dispositivo ou o comportamento de escrita controlado antes e depois de uma operação trim suportada e não ative o discard através de uma camada que não o preserve de forma segura.
Verifique os instantâneos, as reciclagens e os ficheiros eliminados mas ainda abertos
Meça o espaço ocupado por instantâneos, clones, pastas de retenção, reciclagens, registos de bases de dados e ficheiros abertos cujas entradas de diretório foram eliminadas. Estes elementos podem manter os blocos alocados depois de os utilizadores acreditarem que os dados já desapareceram.
A documentação do ZFS da Oracle explica que os instantâneos retêm blocos referenciados, pelo que a eliminação de um ficheiro ativo grande pode não devolver o espaço de armazenamento enquanto os instantâneos antigos continuarem a depender desses blocos.
Elimine apenas pontos de retenção que excedam a política e confirme quais os blocos que referenciam. Um instantâneo grande não é automaticamente obsoleto e uma eliminação de emergência pode remover o único caminho de recuperação para uma alteração recente.
Separe o over-provisioning do controlador do espaço livre do sistema de ficheiros
Verifique se cada SSD tem espaço reservado não particionado, uma área sobresselente definida pelo fabricante ou over-provisioning gerido pelo anfitrião. O espaço livre do sistema de ficheiros e a reserva do controlador têm finalidades relacionadas, mas diferentes.
A Kingston explica que o over-provisioning do anfitrião deixa capacidade não alocada, para que o controlador do SSD tenha espaço de trabalho adicional além dos blocos livres visíveis no sistema de ficheiros.
Não reduza um conjunto ativo sem cópias de segurança verificadas e um procedimento de redução suportado. O over-provisioning é mais seguro quando planeado antes da implementação ou introduzido durante uma migração controlada.
Execute um trim suportado e meça a recuperação
Depois de remover dados e instantâneos desnecessários, execute a operação de discard suportada pela plataforma durante um período de baixa carga. Registe quantos bytes foram descartados e se a latência de escrita se altera depois de o SSD concluir a limpeza em segundo plano.
O manual do fstrim explica que o discard se aplica aos blocos não utilizados do sistema de ficheiros e que a aplicação repetida de trim às mesmas regiões pode não proporcionar benefícios adicionais.
Um trim que comunique zero bytes não é automaticamente uma falha; o sistema de ficheiros pode já ter aplicado o trim ou uma camada intermédia pode bloquear o discard. Recorra às evidências da própria pilha de armazenamento antes de alterar as opções de montagem.
Recupere margem e verifique o verdadeiro estrangulamento
Mova dados temporários, expire apenas os instantâneos aprovados pela política, compacte as bases de dados quando suportado e recupere uma margem deliberada de espaço livre. Em seguida, repita a mesma carga de escrita enquanto mede a latência, a profundidade da fila, o tempo de espera do CPU e a temperatura dos SSD.
O artigo da ZimaSpace sobre sinais de aviso da cache SSD apresenta a fronteira adjacente entre a pressão reversível causada pelo espaço e as evidências de que o próprio dispositivo pode estar a falhar.
O diagnóstico está concluído quando a latência de escrita melhora após a recuperação verificada de espaço ou discard, os instantâneos e metadados permanecem dentro da política e a mesma carga de trabalho se mantém estável acima da reserva escolhida. Se o desempenho continuar fraco com espaço abundante, investigue o estrangulamento térmico, o desgaste, os erros do controlador, o comportamento do RAID ou a E/S da aplicação.
Suporte e Dicas
Mais para Ler

O Plex pode partilhar uma GPU com outro contentor Docker?
O Plex e outro contentor conseguem frequentemente aceder à mesma GPU, mas é necessário testar o suporte dos controladores, o mapeamento de dispositivos, a...

Como saber se um erro do Plex vem do cliente ou do servidor
Reproduza o mesmo item noutro cliente, compare o percurso da sessão e, em seguida, recolha provas do servidor apenas depois de o âmbito lhe...

Como configurar a cache do Plex e o armazenamento temporário de transcodificação
Proteja o estado persistente do Plex enquanto coloca os ficheiros temporários de transcodificação num armazenamento local adequado e, em seguida, verifique a limpeza, o...

