¿Por qué una unidad puede informar SMART PASSED y aun así fallar en el mismo LBA durante una prueba de lectura completa?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Una unidad puede indicar SMART APROBADO y, aun así, fallar una lectura completa, porque el umbral de estado general no garantiza que todos los sectores sigan siendo legibles.

La línea de estado general de SMART resume los umbrales de fallo definidos por el fabricante; no significa que se haya leído toda la superficie durante esa comprobación. Una prueba de lectura completa accede a muchas más direcciones y puede revelar un sector localizado que no se puede corregir, un cabezal débil, una región de memoria flash defectuosa, un tiempo de espera agotado, un problema con el cable o un reinicio del controlador. La evidencia más útil es comprobar si el fallo se repite en el mismo LBA y si sigue apareciendo en la unidad cuando se cambia la ruta de conexión.

Separa el estado general de SMART de los resultados de las autopruebas

Guarda el informe SMART completo, no solo la línea final de APROBADO. Incluye los atributos, los registros de errores, el historial de autopruebas, los sectores pendientes, los sectores que no se pueden corregir, los errores CRC y la temperatura.

Smartmontools señala que una unidad puede conservar el estado SMART APROBADO después de una autoprueba fallida cuando un sector dañado o que no se puede corregir aún no ha superado el umbral de fallo general del fabricante.

Si el registro de autopruebas ya muestra un LBA fallido, guárdalo antes de ejecutar más pruebas. El resultado del estado general no debe prevalecer sobre las evidencias específicas del medio o de la prueba.

Comprende qué aporta una prueba de lectura completa

Registra la herramienta de prueba, el modo de lectura, el tamaño de bloque, el LBA inicial, el LBA final, el tiempo transcurrido y si vuelve a intentar las lecturas fallidas. Confirma que la prueba sea de solo lectura.

Seagate explica que su prueba Long Generic lee cada sector, por lo que puede encontrar un problema localizado que una comprobación de estado breve no detecte.

Un fallo de lectura completa es más útil para el diagnóstico cuando se produce repetidamente en la misma dirección. Un fallo que cambia de dirección o aparece únicamente a través de una carcasa puede indicar, en cambio, inestabilidad del transporte, la alimentación o el controlador.

Compara una segunda prueba extendida del fabricante

Cuando la unidad sea lo bastante estable y los datos estén protegidos, ejecuta el diagnóstico extendido o el análisis del medio compatible del fabricante. Guarda su código y registro.

Western Digital describe una prueba extendida como una prueba exhaustiva de la unidad, lo que la hace útil para confirmar que un fallo de lectura genérico no sea únicamente una particularidad de una herramienta.

No sometas repetidamente a estrés una unidad que contenga la única copia de datos importantes. Cuando los errores aumenten, es más seguro crear una imagen de las regiones legibles que seguir recopilando confirmaciones.

-15% OFF

Relaciona el LBA fallido con los propios registros de la unidad

Compara la dirección del fallo de lectura completa con el registro de autopruebas SMART, el registro de errores ATA, los cambios en los sectores pendientes y los errores de E/S del sistema. Registra si el mismo LBA o un rango cercano aparece repetidamente.

La referencia de smartctl de Debian documenta los resultados de las autopruebas y de los registros de errores, que pueden conservar la primera dirección de bloque lógico fallida.

Una dirección repetible apunta a un daño localizado del medio. Las direcciones aleatorias combinadas con errores CRC, reinicios del enlace o desaparición del dispositivo apuntan más probablemente a la ruta de conexión o al controlador.

Usa con cuidado una prueba de superficie de solo lectura

Comprueba que la herramienta elegida esté en modo de solo lectura y que se dirija al dispositivo correcto. Nunca uses una prueba destructiva con patrones de escritura en un disco que contenga datos necesarios.

El manual de badblocks distingue entre el análisis de solo lectura y los modos destructivos de escritura, algo esencial antes de probar un disco con datos.

Un análisis de superficie no es una reparación. Es una medición de la legibilidad en las condiciones actuales, y los reintentos repetidos pueden aumentar el estrés de una unidad que está fallando.

Distingue un fallo del medio de un fallo del cable, la alimentación o el controlador

Después de proteger los datos, repite una lectura breve y acotada alrededor del rango fallido mediante un cable conocido en buen estado, un puerto directo, una ruta de alimentación estable y, cuando sea práctico, otro controlador.

GNU ddrescue está diseñado para rescatar primero las regiones legibles mientras registra el progreso, lo que es más seguro que reiniciar repetidamente una lectura completa normal contra un disco inestable.

Si el mismo LBA falla a través de rutas conocidas en buen estado, la unidad es el componente común. Si el fallo desaparece o cambia al modificar la ruta, revisa la alimentación, el cable, el puente, la HBA y los registros del sistema anfitrión.

Protege los datos antes de decidir si debes sustituir la unidad

Detén las pruebas innecesarias cuando aumenten los errores, el dispositivo se reinicie, aumente el número de sectores pendientes o que no se pueden corregir en SMART, o la unidad contenga datos irreemplazables. Copia o crea primero una imagen de los datos legibles.

La guía de ZimaSpace sobre un cable SATA defectuoso frente a una unidad NAS que está fallando aborda la decisión relacionada de aislar la ruta; este artículo se centra en por qué SMART APROBADO y el resultado de una lectura de toda la superficie pueden no coincidir.

La unidad debe dejar de utilizarse para el servicio principal cuando persistan regiones ilegibles repetibles, pruebas extendidas fallidas, registros del dispositivo cada vez peores o errores que sigan a la unidad por su número de serie después de controlar la ruta de conexión.

Preguntas frecuentes

¿SMART APROBADO significa que una unidad está en buen estado?

Significa que la unidad no ha superado el umbral de fallo general del fabricante. No garantiza que todos los LBA sean legibles ni que no exista un fallo intermitente de la electrónica o del transporte.

¿Una prueba de lectura completa es destructiva?

Un análisis de solo lectura no está diseñado para modificar los datos, pero puede someter a estrés a una unidad débil. Las pruebas de superficie con patrones de escritura son destructivas y nunca deben utilizarse con datos necesarios.

¿Debo volver a intentar muchas veces la lectura del mismo sector fallido?

No. Los reintentos repetidos pueden hacer perder tiempo y someter a estrés a un medio inestable. Conserva el primer error, protege los datos legibles y utiliza una herramienta orientada a la recuperación cuando los datos sean importantes.

Soporte y Consejos

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.