Después de una pérdida de energía, un conjunto RAID puede permanecer inactivo porque se detectó su metadato, pero el sistema no pudo iniciarlo de forma segura con los miembros y el estado disponibles.
El término “inactivo” describe más directamente los conjuntos md de Linux, aunque otras pilas de almacenamiento tienen fallos similares de importación o activación. Verifique el descubrimiento de dispositivos, los metadatos de los miembros, el estado sucio o degradado, la configuración de inicio y las fallas en la ruta de energía antes de intentar un inicio forzado.
Entienda Qué Significa Inactivo en RAID de Linux
Un conjunto md inactivo puede tener dispositivos y algo de configuración adjunta mientras rechaza la E/S normal. No es lo mismo que un conjunto saludable que simplemente no está montado, y los comandos de montaje no pueden reparar el paso de activación faltante.
Un estado de conjunto inactivo está configurado pero no activo, con la E/S devolviendo errores. Este estado permite que el sistema continúe descubriendo o reconfigurando miembros sin pretender que el conjunto esté listo.
Inspeccione /proc/mdstat, el detalle del conjunto y cada superbloque de miembro antes de cambiar el estado. El objetivo es entender por qué se detuvo la activación, no convertir “inactivo” en “activo” sin confirmar el conjunto de miembros.
Uno o Más Miembros Pueden No Haber Reaparecido
Un corte repentino puede exponer un cable de alimentación marginal, backplane, cable SATA, puerto del controlador o disco que no se inicializa en el siguiente arranque. Entonces, el conjunto ve menos miembros de los que sus metadatos indican que deberían estar presentes.
mdadm normalmente compara los dispositivos disponibles no de repuesto con el conteo activo esperado antes de iniciar. Un conjunto puede permanecer parcialmente ensamblado cuando faltan dispositivos esperados, aunque exista suficiente metadato para crear una entrada de dispositivo md.
Apague de forma segura si se requiere inspección de hardware, luego revise conectores, arranque, detección del controlador, números de serie y datos SMART. Restaure la conectividad faltante antes de elegir un inicio degradado, porque una falla transitoria en la ruta puede ser más fácil y segura de reparar que reconstruir el conjunto.
Un Apagado No Limpio Puede Dejar el Conjunto Sucio
La pérdida de energía puede interrumpir escrituras antes de que cada miembro y bloque de paridad alcance un estado consistente. Entonces, los metadatos del conjunto registran que se requiere una resincronización, reproducción de mapa de bits, reproducción de diario u otra acción de consistencia en el próximo inicio.
Linux md soporta diferentes políticas de consistencia tras un apagado inesperado, incluyendo resincronización completa, mapa de bits de intención de escritura, diario y registro parcial de paridad. La política de consistencia determina cuánto trabajo se necesita antes de que la redundancia pueda volver a ser confiable.
Un conjunto sucio pero completo puede iniciar y resincronizar normalmente. Un conjunto sucio que también está degradado requiere mucha más precaución, porque los datos faltantes y la paridad incierta pueden eliminar la información necesaria para una reconstrucción confiable.
La Paridad Sucia y Degradada Puede Provocar un Rechazo por Seguridad
RAID 5 o RAID 6 pueden ser rechazados al inicio cuando están sucios y falta un miembro. El rechazo protege contra un estado donde la paridad puede estar obsoleta y los datos ausentes no pueden verificarse contra otra copia.
Existe una protección de inicio degradado forzado porque forzar esa combinación puede crear corrupción indetectable. Por lo tanto, el inicio degradado forzado es una decisión explícita del administrador y no un comportamiento normal de arranque.
No omita esta protección hasta entender el miembro faltante, el estado de respaldo y el historial de escritura. Restaure primero la ruta del dispositivo o clone los miembros fallidos; si debe continuar la recuperación, minimice las escrituras y verifique los archivos recuperados de forma independiente.
El Descubrimiento y la Configuración en el Arranque Pueden Estar Incompletos
Los discos pueden estar todos saludables mientras que el inicio aún no detecta el conjunto porque el descubrimiento de dispositivos termina después del intento de ensamblaje, la configuración carece de la identidad del conjunto o el initramfs contiene configuraciones RAID obsoletas.
Un archivo de configuración RAID puede describir dispositivos y conjuntos para que las herramientas de inicio sepan qué escanear y ensamblar. Los registros de configuración del conjunto precisos son especialmente importantes cuando el descubrimiento automático no puede inferir confiablemente el conjunto previsto.
Compare los UUID de los miembros activos con la configuración instalada y el entorno de arranque. Corrija la configuración obsoleta solo después de confirmar la identidad real del conjunto; generar una nueva configuración a partir de un conjunto incompleto puede hacer que el próximo arranque falle consistentemente.
Los Metadatos Externos Pueden Necesitar su Gestor en Espacio de Usuario
Algunos conjuntos usan formatos de metadatos externos gestionados por espacio de usuario en lugar de completamente por el kernel. Tras una interrupción abrupta, el proceso contenedor o monitor puede no haber completado los reconocimientos necesarios para los cambios de estado de los miembros.
Los metadatos gestionados externamente pueden suspender la actividad hasta que el espacio de usuario reconozca un evento. Por lo tanto, un conjunto de componentes inactivo puede reflejar un paso de gestión faltante en lugar de discos de datos fallidos.
Identifique el formato de metadatos antes de aplicar comandos md genéricos. Los formatos asistidos por firmware o contenedores pueden requerir el monitor, utilidad de controlador o flujo de recuperación NAS apropiados para que las actualizaciones de metadatos ocurran en el orden correcto.
Recupere en el Orden de Menor Riesgo
Comience con evidencia de solo lectura: liste dispositivos de bloque por ID estable, asocie números de serie a ranuras, examine metadatos de miembros, revise los registros del arranque anterior y verifique si cada disco esperado está presente. No cree un conjunto nuevo ni borre superbloques.
Intente el ensamblaje normal de la plataforma después de corregir la conectividad y configuración. Use modos de solo lectura o lectura automática cuando estén soportados, y reserve las opciones de ejecución degradada o forzada para casos donde se entienda el miembro faltante exacto y el riesgo de consistencia.
Después de la recuperación, complete cualquier resincronización o limpieza, confirme las copias de seguridad e investigue la causa de la interrupción. Un SAI, energía y cableado confiables, configuración RAID actual, IDs de dispositivo estables y alertas reducen la probabilidad de que el próximo evento de energía presente el mismo estado inactivo.
| Pista de estado inactivo | Explicación probable | Primera verificación |
|---|---|---|
| Miembro esperado ausente | El disco o la ruta no se inicializó | Números de serie, energía, cable, detección del controlador |
| Todos los miembros presentes; conjunto sucio | Escrituras interrumpidas requieren trabajo de consistencia | Estado del conjunto y política de consistencia |
| Paridad sucia y degradada | Inicio automático bloqueado por seguridad | Restaurar miembro o clonar antes de forzar |
| Miembros visibles solo después del arranque | Problema de sincronización en descubrimiento o configuración | Estado de mdadm.conf e initramfs |
Soporte y Consejos
Más para leer

¿Cuáles son los riesgos de forzar la reconexión de un miembro RAID que falta?
Las opciones de fuerza pueden omitir las comprobaciones de seguridad relacionadas con metadatos obsoletos, paridad sucia, escrituras faltantes o grupos activos; inspeccione y preserve...

Cómo distinguir un cable SATA defectuoso de un disco NAS que está fallando
Realice un seguimiento de si los errores siguen al disco o permanecen en la ruta SATA, y separe los contadores de transporte de la...

¿Pueden las unidades con diferentes velocidades compartir el mismo arreglo espejado?
Los discos de velocidad mixta pueden reflejar datos, pero el miembro más lento puede establecer límites de escritura, recuperación, latencia y carga de trabajo...

