Una matriz NAS degradada puede ralentizarse antes de que comience la reconstrucción porque la falla ya ha cambiado cómo se completan las lecturas y escrituras ordinarias. La matriz puede perder una fuente de espejo paralela, reconstruir datos de paridad faltantes bajo demanda, reintentar una unidad inestable o enrutar más trabajo a través de los miembros sobrevivientes.
La reconstrucción es una carga de trabajo posterior que restaura al miembro faltante. La operación degradada comienza tan pronto como la matriz deja de confiar en un miembro, por lo que la latencia de la aplicación puede aumentar incluso mientras la bahía de reemplazo está vacía y no se muestra ninguna barra de progreso de reconstrucción.
¿Qué cambia en el momento en que falta un miembro RAID?
La mayoría de las matrices redundantes continúan operando en modo degradado, pero su ruta de datos ya no es la ruta saludable usada cuando todos los miembros están disponibles.
El controlador de la matriz o la capa de software registra al miembro como fallido, no disponible o ya no confiable. A partir de ese momento, cada solicitud debe evitar la fuente faltante y preservar la consistencia con menos dispositivos.
La penalización exacta depende del nivel RAID y del bloque solicitado. Las lecturas que apuntan a datos sobrevivientes pueden seguir siendo relativamente directas, mientras que las lecturas que requieren el miembro fallido necesitan reconstrucción u otra réplica.
¿Por qué las lecturas de paridad requieren más trabajo antes de la reconstrucción?
Una solicitud de datos que pertenecían al miembro fallido se convierte en una lectura degradada. Durante ese proceso, las lecturas degradadas consumen CPU recuperando datos de las piezas de datos y paridad sobrevivientes.
En lugar de leer un bloque solicitado, la matriz puede necesitar bloques de varias unidades sobrevivientes, realizar un cálculo XOR o de código de borrado y devolver el resultado reconstruido al cliente. Eso aumenta la dispersión del dispositivo y el procesamiento por solicitud.
Debido a que esta reconstrucción ocurre en primer plano, los usuarios pueden notar aperturas de archivos más lentas, lecturas de bases de datos, búsquedas en medios o el inicio de aplicaciones antes de que se haya añadido cualquier unidad de reemplazo.
¿Por qué un espejo pierde el paralelismo de lectura?
Los espejos saludables pueden distribuir las lecturas entre copias equivalentes. Después de que un miembro falla, el miembro restante del espejo sirve las lecturas solo, eliminando el paralelismo de lectura y la distribución de colas que existían antes de la falla.
El rendimiento secuencial puede acercarse a la capacidad de un solo disco en lugar del comportamiento combinado del par espejo. Las solicitudes aleatorias también se acumulan detrás de la cola de un solo dispositivo en lugar de ser atendidas por la réplica menos ocupada.
Esta penalización no requiere cálculos de paridad. Proviene de perder una copia disponible y concentrar la carga de trabajo en el miembro sobreviviente.
¿Por qué un disco medio fallido puede ser más lento que una falla limpia?
Un disco que sigue visible pero tiene problemas con sectores puede pasar mucho tiempo reintentando comandos. En RAID por software de Linux, los largos tiempos de espera por errores pueden detener la matriz antes de que la capa de almacenamiento se rinda y reconstruya el bloque en otro lugar.
Estas pausas pueden ser peores que un disco que falla limpiamente y se elimina del camino activo. Las solicitudes esperan al miembro incierto, las colas se acumulan detrás de él y las aplicaciones experimentan latencia prolongada incluso cuando el rendimiento promedio aún parece aceptable.
Los controladores y plataformas NAS difieren en sus políticas de tiempo de espera, recuperación de errores y eliminación de miembros. Por eso, dos matrices con el mismo nivel RAID pueden responder de manera muy diferente al mismo disco marginal.
¿Cómo compiten las cargas de trabajo normales de NAS con la E/S degradada?
Los discos sobrevivientes deben continuar sirviendo SMB, NFS, contenedores, indexación de medios, copias de seguridad y bases de datos de aplicaciones mientras también suministran lecturas adicionales para los datos faltantes. el modo degradado estresa los discos restantes.
Una solicitud que antes tocaba uno o dos dispositivos puede ahora involucrar a todo el grupo de paridad. Esto consume ancho de banda, aumenta la profundidad de la cola y puede expulsar entradas útiles de caché con datos y metadatos reconstruidos.
La desaceleración se vuelve más visible en matrices de HDD, sistemas multiusuario ocupados y cargas de trabajo con muchas operaciones de E/S pequeñas y dependientes. Una copia secuencial grande puede ocultar la latencia que una base de datos de aplicaciones expone de inmediato.
¿Qué cambia cuando finalmente comienza la reconstrucción?
Agregar una unidad de reemplazo inicia la segunda fase de rendimiento. El sistema debe restaurar la redundancia, y el tráfico de reconstrucción puede ralentizar las lecturas y escrituras mientras las aplicaciones en primer plano permanecen activas.
La reconstrucción lee datos sobrevivientes, calcula el contenido faltante y lo escribe en el reemplazo. Ese amplio flujo en segundo plano compite con el trabajo degradado en primer plano que ya estaba ocurriendo.
Por lo tanto, la prioridad de reconstrucción es un compromiso. Una reconstrucción más agresiva puede acortar la ventana vulnerable pero consumir más ancho de banda inmediato, mientras que una reconstrucción muy suave preserva la capacidad de respuesta a costa de permanecer degradado por más tiempo.
| Estado del arreglo | Trabajo extra | Efecto probable para el usuario |
|---|---|---|
| Espejo saludable | Las lecturas pueden usar cualquiera de las copias | Paralelismo y menor presión en la cola |
| Espejo degradado | Un miembro atiende todas las lecturas | Menor rendimiento y mayor latencia |
| Arreglo de paridad degradado | Bloques faltantes reconstruidos bajo demanda | Más lecturas de dispositivos y trabajo de CPU |
| Reconstrucción de arreglo de paridad | Reconstrucción en primer plano más flujo de recuperación | Una segunda penalización de rendimiento, a menudo mayor |
Preguntas frecuentes
¿Puede un arreglo RAID degradado ser lento incluso cuando no se está ejecutando una reconstrucción?
Sí. El arreglo puede ya estar reconstruyendo lecturas faltantes, usando un miembro espejo restante o esperando reintentos de una unidad inestable.
¿Cada lectura se vuelve más lenta en un arreglo de paridad degradado?
No necesariamente. Las lecturas de datos aún disponibles directamente en los miembros sobrevivientes pueden seguir siendo rápidas, mientras que las solicitudes que requieren la contribución del miembro fallido necesitan reconstrucción.
¿Por qué a veces quitar una unidad fallida puede mejorar la capacidad de respuesta?
Una unidad marginal puede retener comandos durante intentos repetidos de recuperación. Una vez que el arreglo deja de esperarla, la capa RAID puede reconstruir lecturas fallidas de forma predecible a partir de la redundancia.
¿Siempre debe establecerse la prioridad de reconstrucción al máximo?
No existe una configuración universal que se adapte a todos los NAS. Una prioridad más alta acorta el tiempo degradado pero puede reducir la capacidad de respuesta del servicio. La decisión debe reflejar la importancia de la carga de trabajo, la condición del arreglo y la preparación de la copia de seguridad.
Conclusión final
Un NAS no espera a que la reconstrucción se degrade. El rendimiento puede caer inmediatamente porque la ruta de lectura saludable ya ha desaparecido: los espejos pierden una réplica, los arreglos de paridad reconstruyen bloques faltantes y las unidades marginales pueden mantener colas en reintentos prolongados. La reconstrucción añade una segunda carga de trabajo sobre esa ruta degradada, por lo que la desaceleración suele comenzar antes de que aparezca la barra de progreso y se intensifica después de que empieza.
Centro de Tecnología e IA
Más para leer

¿Por qué Home Assistant funciona de manera diferente en conexiones LAN y remotas?
Las sesiones de Home Assistant en la LAN y de forma remota utilizan rutas de red diferentes; la latencia remota añade DNS, cifrado, WAN,...

¿Home Assistant funciona de forma fiable detrás de CGNAT o una doble NAT?
CGNAT y la doble NAT normalmente no afectan al control local de Home Assistant; principalmente cambian la forma en que los clientes remotos pueden...

¿Cómo afecta la latencia de red a Home Assistant durante las interrupciones de Internet?
La pérdida de conexión a Internet y la latencia de red son fallos distintos: las rutas de los dispositivos locales pueden seguir siendo rápidas...

