¿Qué causa que un arreglo RAID permanezca degradado después de agregar un disco de reemplazo?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Una matriz RAID permanece degradada cuando el reemplazo es visible pero no se ha convertido en un miembro válido para reconstrucción. Las causas comunes son tamaño incorrecto, metadatos externos, estado no soportado, falta de asignación manual u otro disco fuente fallando.

No inicialice el reemplazo ni importe una configuración externa al azar. Primero identifique la matriz exacta, el rol faltante, el número de serie del reemplazo, el estado del controlador y la elegibilidad para reconstrucción. El objetivo es conectar un destino vacío elegible sin cambiar la configuración de la fuente confiable.

Confirme que el reemplazo sea detectado por el controlador correcto

Un disco puede aparecer en el sistema operativo mientras sigue siendo inaccesible para el controlador RAID, o aparecer para el controlador en una ranura del chasis diferente a la esperada. Compare el número de serie físico, la bahía, el puerto del controlador y el conteo de sectores reportado.

Si el disco nuevo no es visible en la capa RAID, revise la alimentación, el backplane, el cable, el modo HBA y el mapeo del chasis antes de cambiar los metadatos de la matriz. La inserción repetida sin identificar el número de serie puede llevar a dar servicio al miembro incorrecto.

Ready, Unconfigured y Spare no están reconstruyendo

Muchos controladores de hardware colocan un disco nuevo en un estado neutral como Ready o Unconfigured Good. La matriz permanece degradada hasta que el disco se asigna como reemplazo, repuesto dedicado o repuesto global en caliente elegible según el flujo de trabajo de ese controlador.

Un nuevo disco en estado Ready es un ejemplo útil: la sola presencia no cumple el rol faltante en el RAID. Verifique si se requiere inserción en caliente, reemplazo manual o asignación de repuesto.

El RAID por software usualmente necesita una adición explícita

Las matrices md de Linux no necesariamente vuelven a añadir un disco desaparecido solo porque un dispositivo de bloque haya vuelto a aparecer en la misma ruta. El miembro antiguo puede seguir marcado como eliminado, mientras que el reemplazo existe solo como un dispositivo sin usar.

El comportamiento de re-agregado manual con mdadm refleja un límite de seguridad: confiar automáticamente en un dispositivo que desapareció previamente puede ser peor que requerir que un administrador lo verifique y agregue deliberadamente.

Los metadatos extranjeros pueden bloquear el reemplazo

Un disco reutilizado puede contener firmas RAID de otro arreglo. Los controladores lo etiquetan como extranjero porque importarlo podría alterar la configuración activa. Un disco completamente nuevo también puede llevar metadatos de fábrica, prueba o uso previo que impiden la elegibilidad automática.

No importe configuración extranjera de un disco destinado a ser un reemplazo vacío. En un caso de estado de disco de reemplazo extranjero, cambiar el nuevo miembro a un estado sin configurar-bueno fue el camino relevante, no importar su definición antigua del arreglo.

La capacidad y la geometría de sectores deben cumplir con el mínimo del arreglo

El reemplazo debe proporcionar al menos tantos sectores utilizables como el miembro fallido. Un disco nominalmente igual puede ser un poco más pequeño. Algunos controladores también rechazan un cambio en el formato lógico o físico de sector, tipo de interfaz, calificación de firmware o capacidad de cifrado.

Compare el tamaño exacto y el formato de sector en lugar de solo la etiqueta de la caja. Si el controlador reporta que el disco nuevo no es compatible o es demasiado pequeño, no lo fuerce en línea; elija un objetivo compatible y más grande.

Otro disco fuente puede estar impidiendo la reconstrucción

Una reconstrucción necesita datos legibles de los miembros sobrevivientes. Si otro disco tiene sectores irrecuperables, tiempos de espera repetidos o caídas del arreglo, el controlador puede abortar, mantener el reemplazo como repuesto o permanecer degradado tras un intento fallido de reconstrucción.

Revise el registro de eventos desde el momento en que falló el disco original hasta el intento de reemplazo. La alerta más reciente puede referirse al objetivo, mientras que el verdadero bloqueo es un error de lectura en otro miembro fuente.

Usar un orden de solución de problemas basado en el estado

Estado de reemplazo Significado probable Próxima verificación
No detectado Problema de conexión o ruta del controlador Energía, cable, bahía, HBA, mapa serial
Listo / Sin configurar Bueno Visible pero no asignado Asignación de reemplazo o repuesto
Extranjero Metadatos RAID antiguos presentes Verifique la identidad; borre solo los metadatos del nuevo objetivo
Demasiado pequeño / no soportado Fallo de elegibilidad Sectores exactos, formato, soporte del controlador
Repuesto, no reconstruyendo Sin disparador ni error de fuente Rol faltante, política, registros de miembro sobreviviente
Reconstrucción abortada No se pudo completar la fuente o ruta Errores de lectura, tiempos de espera, segundo fallo

Una asignación manual de reconstrucción específica del controlador puede usar una acción de repuesto en caliente para activar la recuperación. Use la transición de estado documentada de la plataforma en lugar de comandos genéricos copiados de otro sistema RAID.

Verifique el disparador de reconstrucción antes de salir del sistema

Una vez asignado el reemplazo, observe el tiempo suficiente para confirmar que los bloques procesados aumentan y que el número de serie previsto es el objetivo. Una transición de estado que comienza y se aborta inmediatamente sigue siendo un arreglo degradado, incluso cuando el panel muestra brevemente que se está reconstruyendo.

Guarde el primer error después de una interrupción. A menudo identifica el verdadero bloqueo con más claridad que el resumen final, especialmente cuando un disco fuente sobreviviente se agota o el controlador rechaza la geometría del objetivo.

Preguntas frecuentes

¿Debo inicializar primero el disco de reemplazo?

Por lo general, no. La inicialización puede escribir metadatos y puede ser destructiva si se selecciona el disco incorrecto. Prepare solo el objetivo confirmado como vacío usando el flujo de trabajo de reemplazo del controlador.

¿Por qué el intercambio en frío dejó el disco nuevo sin usar?

Algunos controladores detectan y asocian un reemplazo de manera diferente durante la inserción en caliente. El intercambio en frío puede dejar un rol faltante más un disco listo separado que debe asignarse manualmente.

¿Puedo forzar el disco en línea?

Las acciones de forzar en línea están destinadas a situaciones específicas de recuperación y pueden promover datos obsoletos. Para un reemplazo nuevo y vacío, asígnelo como objetivo de reconstrucción o repuesto en lugar de fingir que contiene datos actuales del arreglo.

El arreglo solo se vuelve saludable después de cambios en la membresía

Un reemplazo visible no elimina el estado degradado. Debe ser elegible, asignado al rol faltante, reconstruido a partir de fuentes legibles y promovido a un miembro activo sincronizado.

Soporte y Consejos

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.