Reconstrucción RAID en curso pero los errores de E/S aumentan: qué hacer

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Si los errores de E/S siguen aumentando durante una reconstrucción NAS, reduzca las escrituras y trate al miembro sobreviviente o la ruta de conexión como inestable. Un porcentaje en progreso no hace que sea seguro ignorar el aumento de fallos de lectura.

El objetivo inmediato es preservar los datos legibles e identificar si los errores son fallos de medios, reinicios de enlace o un objetivo defectuoso. Guarde registros y números de serie, confirme el estado de la copia de seguridad y evite reiniciar repetidamente la reconstrucción mientras el conjunto fuente se deteriora.

Los errores crecientes anulan la barra de progreso

Un porcentaje de reconstrucción responde cuánto del objetivo ha sido procesado. No responde si cada lectura de la fuente tuvo éxito. Compare los contadores acumulativos de lectura, escritura, suma de verificación, medios y tiempo de espera de comandos en intervalos regulares.

Cuando la reconstrucción avanza mientras los errores también aumentan, el arreglo puede estar reconstruyendo la mayoría de los bloques pero fallando en regiones específicas. Una lectura fallida en la fuente puede importar más que miles de lecturas exitosas cuando el nivel RAID no tiene copias restantes para ese bloque.

Identifique qué dispositivo está produciendo los errores

Asocie cada identificador de registro a un número de serie físico. Determine si los errores provienen del miembro antiguo que sobrevive, del nuevo objetivo o de una ruta de controlador compartida. Un error de escritura en el objetivo y un error de lectura en la fuente requieren decisiones diferentes.

Los datos de salud del disco ayudan a priorizar la investigación. El uso operativo de Backblaze de cinco atributos de advertencia SMART centra la atención en los indicadores de reasignación, incorrigibles, tiempo de espera, pendientes y offline-incorrigibles en lugar de depender de una única etiqueta general de salud.

Separe los errores de medios de los errores de enlace

Sectores pendientes o incorrigibles indican medios ilegibles. El aumento de UDMA CRC, los reinicios de transporte y las desconexiones repetidas suelen indicar un problema en el cable, backplane, puente, alimentación o ruta del controlador. Ambos pueden interrumpir la reconstrucción, pero cambiar discos no solucionará un problema en un enlace compartido.

Una explicación del conteo de errores UDMA CRC distingue los errores de transferencia de interfaz del daño en el plato. Guarde el conteo bruto, corrija una variable de conexión y verifique si el contador sigue aumentando.

No siga reiniciando una reconstrucción fallida

Cada reinicio completo vuelve a leer los miembros sobrevivientes y puede estresar las mismas regiones débiles sin producir un mejor resultado. Si la operación aborta repetidamente cerca de la misma dirección o un segundo disco falla, detenga los intentos rutinarios de reparación.

Una reconstrucción bloqueada por errores en la fuente demuestra el límite central: cuando la única fuente buena tiene una lectura irrecuperable, el arreglo no tiene otro lugar para obtener los datos faltantes. Las opciones forzadas no pueden recrear contenido desconocido.

Elija entre continuar, copiar o crear imágenes

Condición Dirección preferida Por qué
Errores estables, reconstrucción en progreso Monitoree con carga reducida La recuperación puede completarse normalmente
Aumentan los errores de enlace, el medio es estable Estabilice el cable, la bahía o la ruta del controlador La falla puede estar fuera del disco
Aumentan los errores en el medio de origen Copie primero los datos críticos legibles La redundancia restante se está debilitando
Abortos repetidos en el mismo rango Detenga los reintentos ciegos de reconstrucción Área ilegible persistente
El segundo miembro se desconecta o falla Considere el flujo de trabajo de imagen/recuperación El arreglo puede superar la tolerancia a fallos

Si los datos son irremplazables y la copia de seguridad no está verificada, crear imágenes de los miembros legibles puede ser más seguro que permitir otra reconstrucción automática. Un flujo de trabajo orientado a la recuperación de fallo del segundo disco durante la reconstrucción enfatiza detener los intentos de reparación con muchas escrituras cuando el conjunto sobreviviente es inestable.

Reduzca el trabajo en primer plano sin ocultar el incidente

Detenga las copias de seguridad, la indexación de medios, las descargas, las máquinas virtuales y otras escrituras evitables. Mantenga solo los servicios necesarios para copiar datos críticos o monitorear el arreglo. Reducir la carga de trabajo puede disminuir la cola y facilitar la interpretación del momento de los errores.

No borre registros, restablezca contadores SMART ni reinicie repetidamente antes de capturar evidencia. Un reinicio puede cambiar los nombres de los dispositivos y borrar la secuencia que muestra qué miembro falló primero.

Qué Capturar Antes de Apagar

  • Estado del arreglo, nivel RAID, roles de los miembros, objetivo de reconstrucción y contadores exactos de progreso
  • Cada modelo de disco, número de serie, bahía, puerto del controlador e identificador actual del dispositivo
  • Eventos del kernel o controlador que cubren desde la primera falla hasta el último error de E/S
  • Valores SMART de medios en bruto, tiempo de espera, temperatura y errores de interfaz
  • Lista de archivos o rangos de bloques ilegibles y el estado de la última copia de seguridad verificada

Este registro soporta una prueba controlada de cable, reemplazo de disco, clonación o recuperación profesional sin adivinar qué miembro contenía los datos más recientes.

Requiere un Seguimiento Estable Después de Cualquier Intervención

Después de reemplazar un cable, mover un disco con número de serie confirmado o reducir la carga de trabajo, restablezca solo la línea base de comparación relevante y observe si hay recurrencia. Una mejora temporal no es prueba de que la falla subyacente haya desaparecido.

El arreglo debería completar la recuperación, volver a la membresía completa y pasar una verificación de integridad posterior sin nuevos errores de E/S. Hasta que las tres condiciones se mantengan bajo una carga de trabajo representativa normal, mantenga el incidente abierto de forma segura y conserve los registros capturados.

Preguntas Frecuentes

¿Puedo dejar que la reconstrucción termine si solo aparecen algunos errores?

Solo cuando los errores se entienden, son estables y los datos están respaldados. El aumento de errores de lectura en la fuente o los reinicios repetidos son una señal de escalada incluso cuando el porcentaje objetivo sigue aumentando.

¿Debo reemplazar el disco con el conteo SMART más alto?

No automáticamente. Confirme si los errores siguen al disco con número de serie o permanecen con su bahía y ruta de conexión. Reemplazar el miembro incorrecto durante una operación degradada puede destruir la fuente válida restante.

¿Puede una reconstrucción completada aún contener archivos dañados?

Sí. Algunas implementaciones pueden completarse mientras informan sectores irrecuperables o archivos afectados. Siempre revise el informe final de errores y realice una verificación de integridad después de que el arreglo vuelva a un estado estable.

La Condición de Parada

Cuando aumentan los errores de E/S durante la reconstrucción, proteja los datos legibles antes de buscar la finalización. Continúe solo después de comprobar que el conjunto de origen y la ruta de conexión son lo suficientemente estables para suministrar cada bloque restante.

Soporte y Consejos

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.