Preocúpate cuando los errores de suma de comprobación reaparezcan después de registrar y borrar la línea base anterior, no simplemente porque un contador no sea cero.
ZFS puede reparar un bloque defectuoso cuando la redundancia proporciona una copia válida, pero la reparación no explica por qué llegaron datos incorrectos. Guarda zpool status -v y los registros del sistema pertinentes, verifica las copias de seguridad y, después, usa la recurrencia, el patrón de dispositivos afectados y un scrub limpio para decidir si el evento fue aislado o si la falla sigue activa.
Registra lo que ZFS corrigió antes de borrar nada
Guarda el estado completo del pool, la marca de tiempo del scrub, los recuentos de errores por dispositivo y cualquier lista de errores permanentes. Captura también, al mismo tiempo, los mensajes del kernel relativos a reinicios del enlace, tiempos de espera de comandos, fallas del controlador, comprobaciones de máquina y eventos de alimentación inesperados.
Una explicación detallada de la comunidad sobre los contadores de sumas de comprobación reparadas de ZFS y sus posibles causas distingue los bloques corregidos de la falla del cable, la alimentación, el controlador, la memoria o el disco que pudo haberlos producido. La reparación no certifica la integridad de la ruta de hardware.
Confirma que existe otra copia utilizable de los datos importantes antes de someter el pool a carga. Borrar los contadores es aceptable solo después de guardar las pruebas, porque la siguiente decisión depende de si aparecen errores realmente nuevos.
Usa la recurrencia y el alcance como umbral de decisión
Después de guardar la línea base, borra los contadores y ejecuta un scrub durante una ventana estable de alimentación y temperatura. Si el scrub termina sin errores y el uso normal no produce errores nuevos, monitorea en lugar de reemplazar hardware por un único evento histórico.
Si el mismo disco acumula nuevos errores de suma de comprobación, inspecciona sus rutas de datos y alimentación, el historial de SMART, las estadísticas del enlace y el puerto del controlador. Si varios discos acumulan errores a la vez, prioriza los componentes compartidos, como la HBA, el backplane, la fuente de alimentación, el cableado, la memoria o la estabilidad del sistema.
Cualquier error de datos permanente, error de E/S repetido, suspensión del pool o recuento que aumente rápidamente eleva la urgencia. Detén las escrituras no esenciales, actualiza la copia de seguridad y aísla la capa sospechosa antes de que otro scrub añada carga.
Cambia una capa y demuestra el resultado
Con el sistema apagado, vuelve a conectar o reemplaza el cable de datos o alimentación sospechoso, o mueve el dispositivo a un puerto conocido como bueno. No cambies varias capas a la vez; de lo contrario, el resultado limpio no identificará qué componente modificó el resultado.
Para un patrón específico de un dispositivo, ejecuta la prueba del fabricante de la unidad o una lectura controlada después de revisar el historial de SMART. Para un patrón que afecte a varios dispositivos, prueba la memoria y la estabilidad de la alimentación, e inspecciona la ruta del controlador antes de asumir que varias unidades fallaron simultáneamente.
La guía de sistemas operativos para servidores domésticos ayuda a identificar dónde se encuentran el estado del pool, los registros del kernel y la administración del controlador en plataformas NAS y Linux habituales.
Verifica la recuperación con la carga de trabajo original
Ejecuta un scrub completo después de la reparación aislada y, a continuación, repite la carga de trabajo que expuso el problema anteriormente. La recuperación significa que el scrub termina sin nuevos errores de suma de comprobación, lectura o escritura, y que los contadores permanecen estables durante un reinicio y otra ventana representativa de carga de trabajo.
Reemplaza una unidad cuando las pruebas la sigan a través de una ruta conocida como buena, cuando SMART o las autopruebas también se deterioren, o cuando produzca nuevos errores después de descartar problemas de cableado y alimentación. Reemplaza o repara la capa compartida cuando los errores permanezcan asociados a un puerto, una carcasa, un controlador o un evento de alimentación.
Escala el problema de inmediato ante errores permanentes, un pool degradado sin redundancia suficiente o incertidumbre sobre qué copia es la autorizada. Un evento corregido es una advertencia que debe investigarse; una corrección nueva y reproducible demuestra que el diagnóstico no puede posponerse.
Preguntas frecuentes
¿zpool clear soluciona la causa? No. Restablece los contadores registrados después de guardar las pruebas; solo un scrub limpio y una carga de trabajo de seguimiento estable demuestran que la ruta subyacente ya no produce datos incorrectos.
¿Se puede ignorar un único error de suma de comprobación corregido? Trátalo como una advertencia registrada. Si no vuelve a aparecer después de borrar la línea base y realizar un scrub limpio, el monitoreo puede ser una respuesta proporcionada; la recurrencia o las fallas de E/S relacionadas requieren aislamiento.
¿Un informe SMART correcto descarta el disco? No. SMART puede no detectar problemas de cableado, controlador, alimentación y algunas fallas del dispositivo, por lo que debes combinarlo con el alcance de ZFS, los registros del sistema, intercambios controlados y scrubs posteriores a la reparación.
Soporte y Consejos
Más para leer

¿Qué brillo de pantalla ayuda a reducir la fatiga visual durante largas revisiones de archivos NAS?
No existe un porcentaje de brillo universal; ajusta una pantalla blanca a la habitación, controla el deslumbramiento, mantén el texto legible y valida durante...

Cómo reducir la tensión cervical cuando la consola del servidor doméstico está montada demasiado baja
Traslada el trabajo rutinario fuera de la consola baja o eleva el objetivo visual de forma segura, manteniendo el teclado más bajo y volviendo...

¿Por qué siento cansancio en los ojos después de mirar un panel de control de servidor brillante por la noche?
La fatiga frente al panel durante la noche suele combinar un desajuste de brillo, reflejos, concentración prolongada y una menor frecuencia de parpadeo; ajusta...

