¿Qué hace que un conjunto de SSD se ralentice cuando el espacio libre cae por debajo del 15 %?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Un grupo de SSD suele ralentizarse cuando se acerca a su capacidad máxima porque el controlador y el sistema de archivos disponen de menos espacio de trabajo limpio para las escrituras, la reubicación, los metadatos y las instantáneas.

El umbral del 15 % no es un límite universal, pero sí una advertencia útil para muchas cargas de trabajo de servidores domésticos. El grupo puede tener bytes lógicos libres mientras que las instantáneas, el aprovisionamiento fino, los metadatos del sistema de archivos, los archivos eliminados pero aún abiertos o la falta de compatibilidad con discard reducen el espacio que los controladores SSD y el software de almacenamiento pueden reutilizar realmente. Diagnostica el margen de escritura efectivo y la latencia de escritura en lugar de depender de un único porcentaje del panel.

Confirma qué cifra de espacio libre llegó al 15 %

Compara la capacidad bruta de los SSD, la capacidad del grupo, el espacio libre del sistema de archivos, la asignación con aprovisionamiento fino, el uso de instantáneas, las cuotas, los bloques reservados y el volumen de aplicación que parece lento. Estos valores responden a preguntas diferentes.

GNU Coreutils explica que el espacio disponible del sistema de archivos se informa a partir de la contabilidad del sistema de archivos montado, que puede no incluir todos los grupos, instantáneas, volúmenes finos o reservas a nivel del controlador que afectan a las escrituras.

Si solo un conjunto de datos o un volumen fino está casi lleno, repara esa capa en lugar de considerar que todos los SSD están lentos. Si todo el grupo tiene poca capacidad sin asignar, continúa con las comprobaciones del espacio de trabajo del controlador, discard e instantáneas.

Comprende por qué las escrituras NAND necesitan espacio de trabajo limpio

Mide la latencia de escritura sostenida y de escritura aleatoria pequeña antes y después de que el grupo cruce el umbral. La velocidad de lectura puede seguir siendo aceptable mientras las escrituras se interrumpen o se vuelven inestables.

Crucial describe el sobreaprovisionamiento de SSD como una capacidad reservada que se utiliza para la recolección de basura, la nivelación del desgaste y los bloques de sustitución. Esto explica por qué un menor margen de escritura puede aumentar la reubicación en segundo plano durante las nuevas escrituras.

No supongas que toda ralentización significa que la memoria flash está desgastada. Un SSD en buen estado puede volverse temporalmente lento cuando necesita borrar, mover y reescribir más datos válidos por cada escritura entrante.

Verifica que discard o TRIM llegue a los SSD

Comprueba si los bloques eliminados del sistema de archivos se descartan de forma continua, periódica o nunca. Incluye todas las capas entre el sistema de archivos y el SSD: cifrado, RAID, aprovisionamiento fino, HBA, disco virtual y carcasa.

La operación retrim de Optimize-Volume de Microsoft muestra que los bloques eliminados deben comunicarse a través de la pila de almacenamiento para que el dispositivo pueda prepararlos para su reutilización.

Un comando correcto en la capa del sistema de archivos no demuestra que el SSD haya recibido discard. Compara los contadores del dispositivo o el comportamiento de escritura controlado antes y después de una operación de trim compatible, y no habilites discard en una capa que no lo preserve de forma segura.

-15% OFF

Comprueba las instantáneas, las papeleras de reciclaje y los archivos eliminados pero abiertos

Mide el espacio ocupado por instantáneas, clones, carpetas de retención, papeleras de reciclaje, registros de bases de datos y archivos abiertos cuyas entradas de directorio se hayan eliminado. Estos elementos pueden mantener los bloques asignados después de que los usuarios crean que los datos ya no existen.

La documentación de ZFS de Oracle explica que las instantáneas conservan los bloques referenciados, por lo que eliminar un archivo activo grande puede no devolver su almacenamiento mientras las instantáneas antiguas sigan dependiendo de esos bloques.

Elimina únicamente los puntos de retención que superen la política y confirma qué bloques referencian. Una instantánea grande no es automáticamente obsoleta, y eliminarla de emergencia puede borrar la única vía de recuperación de un cambio reciente.

Separa el sobreaprovisionamiento del controlador del espacio libre del sistema de archivos

Comprueba si cada SSD tiene espacio reservado sin particionar, un área de reserva definida por el fabricante o sobreaprovisionamiento gestionado por el host. El espacio libre del sistema de archivos y la reserva del controlador cumplen funciones relacionadas, pero diferentes.

Kingston explica que el sobreaprovisionamiento del host deja capacidad sin asignar para que el controlador SSD disponga de espacio de trabajo adicional más allá de los bloques libres visibles para el sistema de archivos.

No reduzcas un grupo activo sin copias de seguridad verificadas y una ruta de reducción compatible. El sobreaprovisionamiento es más seguro cuando se planifica antes de la implementación o se introduce durante una migración controlada.

Ejecuta un trim compatible y mide la recuperación

Después de eliminar datos e instantáneas innecesarios, ejecuta la operación de discard compatible con la plataforma durante un periodo de poca carga. Registra cuántos bytes se descartaron y si la latencia de escritura cambia después de que el SSD complete la limpieza en segundo plano.

El manual de fstrim explica que discard se aplica a los bloques no utilizados del sistema de archivos y que repetir el trim en las mismas regiones puede no aportar beneficios adicionales.

Que un trim informe de cero bytes no significa automáticamente que haya fallado; es posible que el sistema de archivos ya se haya sometido a trim o que una capa intermedia bloquee discard. Utiliza las pruebas de la propia pila de almacenamiento antes de cambiar las opciones de montaje.

Recupera margen y verifica el verdadero cuello de botella

Mueve los datos temporales, elimina solo las instantáneas aprobadas por la política, compacta las bases de datos cuando sea compatible y recupera un margen deliberado de espacio libre. Después, repite la misma carga de escritura mientras mides la latencia, la profundidad de cola, la espera de CPU y la temperatura de los SSD.

El artículo de ZimaSpace sobre señales de advertencia de una caché SSD ofrece el límite adyacente entre la presión reversible por falta de espacio y las pruebas de que el propio dispositivo podría estar fallando.

El diagnóstico está completo cuando la latencia de escritura mejora tras verificar el margen o recuperar discard, las instantáneas y los metadatos se mantienen dentro de la política y la misma carga de trabajo permanece estable por encima de la reserva elegida. Si el rendimiento sigue siendo deficiente con espacio suficiente, investiga la limitación térmica, el desgaste, los errores del controlador, el comportamiento del RAID o la E/S de la aplicación.

Soporte y Consejos

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.