Las 10 mejores herramientas de monitorización RAID para servidores domésticos

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

Un conjunto RAID puede parecer saludable mientras una de sus unidades empeora silenciosamente. También puede degradarse mientras los discos restantes siguen informando de que SMART ha sido superado.

Por lo tanto, una buena monitorización necesita más que una única luz verde de estado. La mejor configuración para un servidor doméstico supervisa el conjunto, las unidades físicas, las reconstrucciones o los scrubs, y las alertas que indican que algo ha cambiado.

La monitorización del RAID es más que SMART

El estado del RAID y el estado de los discos responden a preguntas diferentes.

Un monitor del conjunto te indica si el sistema de almacenamiento aún tiene los miembros esperados, si se ha perdido la redundancia y si hay una reconstrucción, resincronización, operación de scrub o comprobación de consistencia en curso.

La monitorización SMART examina el nivel inferior del conjunto, donde se encuentran los discos HDD, SSD y las unidades NVMe individuales. Puede revelar la temperatura, errores de medios, sectores pendientes, sectores reasignados, resistencia, resultados de las autopruebas y otras señales del dispositivo.

Monitorización de RAID
     |
     +-- Estado del conjunto
     |     Correcto / Degradado / Sin conexión
     |
     +-- Estado de la unidad
     |     SMART / NVMe / Temperatura
     |
     +-- Recuperación
     |     Reconstrucción / Resincronización / Scrub
     |
     +-- Historial
     |     Tendencias / Errores / Capacidad
     |
     +-- Alertas
           Correo electrónico / Notificación push / Webhook / Chat

La distinción importa porque un conjunto en buen estado puede contener una unidad deteriorada, mientras que un conjunto degradado aún puede contener varios discos individuales cuyo estado SMART siga siendo normal.

El modelo de RAID subyacente se explica con más detalle en cómo funciona el RAID, pero la monitorización parte de una regla más sencilla: supervisa tanto el conjunto como las unidades que lo componen.

¿Qué debería supervisar realmente una herramienta de monitorización de RAID?

Un monitor útil para un servidor doméstico debería cubrir tantas de estas capas como requiera su función:

Capa Señales importantes Por qué es importante
Estado del conjunto Correcto, degradado, sin conexión, miembro ausente Muestra si la redundancia sigue existiendo
Unidades físicas SMART, temperatura, estado de NVMe, desgaste Puede revelar que un disco se está deteriorando antes de que falle el conjunto
Recuperación Reconstrucción, resincronización, resilver, scrub, comprobación de consistencia Muestra si la redundancia se está restaurando o verificando
Errores Errores de E/S, errores de suma de comprobación, sectores incorregibles Proporciona pruebas de que la fiabilidad del almacenamiento está cambiando
Capacidad Uso del grupo, del sistema de archivos y de las unidades Evita que el agotamiento del espacio se convierta en una interrupción del servicio
Historial Temperatura, atributos SMART, tendencias de errores Muestra el deterioro gradual en lugar de una única instantánea actual
Alertas Correo electrónico, webhook, notificaciones push, chat, escalación Un panel no sirve de nada si nadie lo abre después de un fallo

Cómo clasificamos las mejores herramientas de monitorización de RAID

Esto no es una clasificación de los paneles más bonitos. Las herramientas siguientes resuelven distintas partes de la pila de monitorización.

Los evaluamos en torno a cinco preguntas prácticas:

  • ¿Qué puede observar realmente? ¿El estado del conjunto, los discos individuales, los grupos ZFS, el RAID por hardware o todo el servidor?
  • Does it preserve history? A slowly rising error count is often more useful than one current value.
  • ¿Conserva el historial? Un recuento de errores que aumenta lentamente suele ser más útil que un único valor actual.
  • ¿Puede enviar alertas sin comprobaciones manuales? La supervisión debería mostrar los problemas de forma proactiva.
  • ¿Qué dificultad tiene implementarlo? Un único NAS doméstico no debería requerir una infraestructura de observabilidad empresarial, a menos que el usuario la quiera.

¿Complementa las herramientas RAID nativas? Las configuraciones más sólidas suelen combinar un monitor específico del conjunto con una capa de supervisión del estado de los discos.

El orden numérico es editorial y no representa una puntuación sintética de referencia.

Los 10 mejores instrumentos de supervisión de RAID para servidores domésticos de un vistazo Herramienta Ideal para Estado del conjunto Estado de las unidades Historial Dificultad
1 Netdata Un panel para el servidor doméstico Baja a media
2 Scrutiny Tendencias del estado SMART No Excelente Excelente Baja
3 smartmontools Supervisión básica de discos No Excelente Limitado sin otra capa Baja
4 Monitor de mdadm RAID de software de Linux Excelente No Orientada a eventos Baja
5 OpenZFS ZED Eventos de grupos ZFS Excelente para ZFS Indirecta Orientada a eventos Baja a media
6 Almacenamiento de Cockpit Interfaz gráfica de Linux fácil para principiantes Limitada Baja
7 Prometheus + Grafana Métricas personalizadas a largo plazo Con exportadores Excelente Excelente Alta
8 Checkmk Varios servidores domésticos Con comprobaciones/complementos Media
9 StorCLI RAID por hardware LSI/Broadcom Excelente Excelente para unidades conectadas a controladoras Orientado a la CLI Media
10 Zabbix Alertas personalizadas avanzadas Con plantillas/scripts Excelente Alta

1. Netdata: el mejor panel general para la supervisión de RAID

Presentamos el espacio de demostración de Netdata | Netdata

Netdata es la mejor opción general cuando quieres una sola capa de supervisión para el sistema de almacenamiento y el resto del servidor doméstico.

Sus recopiladores de almacenamiento actuales cubren varias arquitecturas relevantes para los usuarios de RAID.

Para el RAID de software de Linux, el recopilador de RAID MD lee /proc/mdstat y realiza un seguimiento de los dispositivos MD. Para las unidades físicas, Netdata cuenta con un recopilador SMART basado en smartctl. Su recopilador de grupos ZFS supervisa el estado y el espacio del grupo mediante zpool, mientras que su recopilador RAID de StoreCLI puede supervisar adaptadores RAID de hardware compatibles, unidades físicas y baterías de respaldo.

Esta amplitud le da a Netdata una ventaja sobre los paneles SMART centrados en un solo aspecto.

RAID MD
SMART
ZFS
RAID de hardware
Sistemas de archivos
CPU
RAM
Red
Contenedores
     |
  Netdata
     |
Un panel

Un único agente de Netdata puede ejecutarse de forma independiente y exponer su panel local en el puerto 19999. La conectividad con la nube es opcional para el propio agente de supervisión, aunque Netdata Cloud añade vistas centralizadas y funciones adicionales para varios nodos.

Esto hace que Netdata sea especialmente útil en un servidor doméstico donde la supervisión del almacenamiento debe convivir con la carga del sistema, la presión de la RAM, la capacidad del sistema de archivos, la actividad de Docker y el rendimiento de la red.

Ideal para: usuarios que quieren un único panel que cubra el RAID y el resto del servidor.

Desventaja: Netdata ofrece una visión amplia en lugar de centrarse obsesivamente en los discos. Scrutiny proporciona una vista más clara cuando el objetivo es estudiar los atributos SMART y el deterioro físico de las unidades a largo plazo.

2. Scrutiny: la mejor opción para detectar tendencias en el estado de las unidades

Scrutiny es una de las incorporaciones más útiles para un NAS doméstico porque resuelve varias deficiencias de la supervisión SMART sin procesar.

SMART expone una gran cantidad de atributos, pero no todos son igual de útiles. Los umbrales del fabricante también pueden ser lo bastante conservadores como para que una unidad parezca estar “en buen estado” hasta que el fallo está relativamente cerca.

Scrutiny combina datos SMART con una interfaz web, almacenamiento de tendencias históricas, seguimiento de la temperatura y umbrales adicionales basados en datos reales de fallos de unidades.

Eso permite plantear preguntas como:

Sectores pendientes actuales

Enero          0
Marzo          0
Junio          2
Agosto        8

Un único informe SMART actual indica que el valor es ocho. Scrutiny te muestra que la métrica ha estado avanzando en la dirección equivocada.

También admite notificaciones configurables mediante correo electrónico, webhooks, ntfy, Gotify, Slack, Discord, Telegram y otros servicios.

La compatibilidad con controladores RAID depende de si smartctl puede acceder a las unidades físicas subyacentes. Por eso, Scrutiny documenta el passthrough del controlador y la asignación de dispositivos de Docker.

La limitación importante también está clara:

Scrutiny supervisa las unidades, no la matriz RAID en sí.

Una matriz MD de Linux debe seguir supervisándose con mdadm u otra capa compatible con matrices. Un grupo ZFS también debe contar con supervisión específica de ZFS.

Ideal para: servidores domésticos con varios HDD o SSD en los que son importantes las tendencias históricas de SMART y temperatura.

Desventaja: no confundas una fila de discos en buen estado en Scrutiny con una prueba de que la matriz RAID está en buen estado.

La capa de supervisión del estado de las unidades también depende de las propias unidades. Elegir unidades NAS adecuadas reduce los problemas evitables durante las reconstrucciones y las cargas de trabajo continuas 24/7.

3. smartmontools: la mejor base para supervisar HDD, SSD y NVMe

GitHub - smartmontools/smartmontools: 2025-06-01: Este es ahora el repositorio oficial original de smartmontools · GitHub

smartmontools es mucho menos atractivo visualmente que Scrutiny, pero es más fundamental.

El proyecto proporciona dos herramientas principales:

smartctl
   |
Inspeccionar y probar una unidad

smartd
   |
Supervisar continuamente las unidades

smartctl puede inspeccionar la información SMART y de estado de dispositivos ATA/SATA, SCSI/SAS y NVMe, y activar autopruebas de las unidades. smartd se ejecuta como demonio y comprueba continuamente los dispositivos en busca de condiciones de estado configuradas.

Muchos productos de supervisión de nivel superior dependen en última instancia de estos datos. El recopilador SMART de Netdata requiere smartmontools, Scrutiny crea su capa de estado de los discos en torno a los datos de smartctl y los exportadores smartctl de Prometheus usan la misma interfaz.

El proyecto también sigue evolucionando. El registro de cambios actual del proyecto original indica que smartmontools 8.0 será la próxima versión aún no publicada después de la 7.5.

Para un servidor doméstico ligero, smartd puede ser todo lo necesario:

Unidad
  |
SMART
  |
smartd
  |
Alerta

No necesariamente necesitas una base de datos, un panel y una pila de métricas independientes para saber que una unidad ha superado un umbral importante.

Ideal para: usuarios que quieren una base ligera y madura para el estado de las unidades físicas y las pruebas automatizadas.

Desventaja: la salida de la línea de comandos es menos accesible que Scrutiny o Cockpit, y smartd por sí solo no ofrece el mismo análisis histórico visual.

4. Monitor de mdadm: el mejor monitor nativo para RAID de software de Linux

Supervisión de matrices RAID MDADM con Cacti y SNMP · Matt Dyson

Si la matriz es Linux MD RAID, mdadm debería seguir formando parte del plan de supervisión aunque se haya instalado Netdata u otro panel.

mdadm --monitor entiende la propia matriz.

Puede informar de eventos como:

  • fallo del dispositivo;
  • matrices degradadas;
  • activación del repuesto;
  • desaparición del dispositivo;
  • inicio de la reconstrucción;
  • progreso de la reconstrucción;
  • finalización de la reconstrucción.

Eso cubre la carencia de SMART:

smartd
  |
¿Las unidades están en buen estado?

mdadm --monitor
  |
¿La matriz RAID está en buen estado?

Para un servidor doméstico Linux minimalista, combinar la supervisión de mdadm con smartd crea un sistema de supervisión sorprendentemente capaz sin añadir una gran pila web.

Ideal para: servidores Debian, Ubuntu y otros servidores Linux basados en MD RAID 1, 5, 6 o 10.

Desventaja: mdadm se centra en RAID de software de Linux, no en ZFS, RAID de hardware ni análisis gráfico a largo plazo.

5. OpenZFS ZED: la mejor supervisión nativa de eventos para grupos ZFS

renombrar el binario zed a zfs-zed · Problema n.º 17351 · openzfs/zfs

Los usuarios de ZFS deben monitorizar ZFS como ZFS, en lugar de intentar asignar cada evento a la terminología RAID tradicional.

ZED, el demonio de eventos de ZFS, monitoriza los eventos generados por el módulo del núcleo de ZFS y ejecuta las acciones de ZEDLET configuradas cuando aparecen clases de eventos coincidentes.

La relación de monitorización queda así:

Núcleo de ZFS
    |
  zevents
    |
   ZED
    |
Acciones de ZEDLET
    |
Notificaciones / automatización

Esto hace que ZED sea adecuado para los eventos de grupos y dispositivos propios de ZFS, en lugar de un panel externo de discos.

Por lo tanto, una pila completa de servidor doméstico con ZFS puede incluir:

ZED
 |
Eventos del grupo

smartd / Scrutiny
 |
Estado de las unidades físicas

Netdata / Grafana
 |
Panel e historial

Ideal para: Usuarios de TrueNAS, OpenZFS o ZFS en Linux/BSD que quieren gestión nativa de eventos en sus grupos.

Desventaja: ZED es un demonio de eventos, no un panel integral y pulido. Combínalo con otra capa si la visualización a largo plazo es importante.

6. Cockpit Storage — La mejor GUI de monitorización de RAID para principiantes de Linux

GitHub - 45Drives/cockpit-hardware: Un módulo de Cockpit para servidores de almacenamiento 45Drives · GitHub

Cockpit es una de las formas más sencillas de añadir una interfaz de administración basada en navegador a un servidor Linux normal.

Su aplicación Almacenamiento admite discos locales, particiones, RAID, cifrado, NFS, iSCSI y otras operaciones de almacenamiento habituales.

Cockpit también añadió información sobre el estado de los dispositivos SMART a la página Almacenamiento, incluida la posibilidad de ejecutar autopruebas de los discos desde el navegador.

Esto lo convierte en una opción sólida para principiantes que buscan un servidor que, por lo demás, tenga este aspecto:

Ubuntu / Debian / Fedora
          |
       Cockpit
          |
 Interfaz de almacenamiento en el navegador
          |
 RAID + SMART + puntos de montaje

Es especialmente útil cuando el usuario quiere gestionar el almacenamiento en lugar de crear una pila de observabilidad dedicada.

Ideal para: Principiantes de Linux que quieren ver el estado del RAID y de los discos en una interfaz limpia de gestión de servidores.

Desventaja: Cockpit es mejor para mostrar y gestionar el estado actual del servidor que para almacenar meses de historial detallado de SMART.

7. Prometheus + smartctl_exporter + Grafana — La mejor opción para métricas a largo plazo

Las claves JSON de smartctl son todas incorrectas · Problema n.º 42 · prometheus-community/ smartctl_exporter

Cuando la monitorización se convierte en un pasatiempo por sí misma, la pila de Prometheus ofrece mucho más control que un panel NAS diseñado específicamente para ello.

El oficial smartctl_exporter convierte las estadísticas de smartctl en métricas de Prometheus. Requiere smartmontools 7.0 o posterior porque depende de la salida JSON de smartctl.

La arquitectura es modular:

Exportadores de SMART / RAID / ZFS
           |
       Prometheus
           |
         Grafana
           |
 Paneles y alertas

Los exportadores adicionales o las métricas del nodo pueden añadir:

  • capacidad del sistema de archivos;
  • E/S de disco;
  • conjuntos ZFS;
  • estado del RAID MD;
  • temperatura;
  • carga del servidor;
  • métricas del SAI;
  • actividad de red.

Esta es la opción más sólida cuando quieres responder preguntas históricas en lugar de limitarte a comprobar el estado actual.

Por ejemplo:

  • ¿Aumentó la temperatura de la unidad durante la última reconstrucción del RAID?
  • ¿Cuándo aparecieron por primera vez los errores incorregibles?
  • ¿Cambió la latencia del almacenamiento después de añadir otra unidad?
  • ¿A qué velocidad ha crecido la utilización del conjunto durante el último año?

Grafana Alerting también puede evaluar reglas basadas en Prometheus y dirigir notificaciones cuando se cumplen las condiciones.

Ideal para: entusiastas que quieren métricas a largo plazo, paneles personalizados, correlación y alertas flexibles.

Desventaja: Prometheus + exportadores + Grafana requiere bastante más configuración que Scrutiny o Netdata. Para un NAS doméstico sencillo, esa complejidad puede aportar pocos beneficios prácticos.

8. Checkmk — La mejor opción para supervisar varios servidores domésticos

Supervisión de Kubernetes

Checkmk resulta más atractivo cuando el laboratorio doméstico contiene más de un equipo.

En lugar de pensar únicamente en un NAS, es posible que tengas:

NAS
Servidor de copias de seguridad
Host de Proxmox
Mini PC
Router
UPS
Conmutador
     |
   Checkmk

El agente de Checkmk para Linux admite la supervisión del hardware mediante complementos, incluidos los valores SMART de los HDD y SSD modernos.

Su documentación también contempla explícitamente las unidades ocultas tras controladoras RAID compatibles. Según la controladora, pueden ser necesarias herramientas como smartmontools, tw_cli, o puede ser necesario utilizar las herramientas de MegaRAID antes de que Checkmk pueda acceder a la información del dispositivo subyacente.

La mayor ventaja es la gestión centralizada: varios hosts, estados de servicios, reglas de alerta, gráficos, inventario, capacidad y supervisión del sistema pueden coexistir en una sola interfaz.

Ideal para: laboratorios domésticos donde sea necesario supervisar el estado del almacenamiento junto con varios servidores Linux y dispositivos de infraestructura.

Desventaja: Checkmk supone una sobrecarga innecesaria para un NAS individual si Netdata o la supervisión nativa del sistema operativo ya cubren las señales de fallo importantes.

9. StorCLI — La mejor opción para RAID de hardware LSI y Broadcom

Instalar Avago LSI StorCLI en VMware ESXi: guía de virtualización

El RAID de hardware requiere un enfoque de supervisión diferente, porque el sistema operativo puede ver un solo disco virtual mientras la controladora gestiona varias unidades físicas subyacentes.

Sistema operativo
      |
 Unidad virtual
      |
 Controladora RAID
      |
+-----+-----+-----+
Disco 1   Disco 2  Disco 3

StorCLI es la utilidad de administración de línea de comandos de Broadcom para controladores RAID LSI/Broadcom compatibles.

Puede inspeccionar el estado del controlador, las unidades virtuales, las unidades físicas, las operaciones de reconstrucción, la información del gabinete, la caché y los componentes de batería o respaldo compatibles.

El estado del RAID por hardware puede incluir estados como:

  • Óptima;
  • Parcialmente degradada;
  • Degradada;
  • Sin conexión.

Esa visibilidad a nivel del controlador es esencial porque las herramientas SMART genéricas podrían no detectar automáticamente las unidades miembro a través de todos los controladores RAID.

Una combinación de monitoreo útil es:

RAID Broadcom / LSI
        |
      StorCLI
        |
     Netdata
        |
Panel + alertas

El recopilador StoreCLI de Netdata puede consumir información del controlador y mostrarla junto al resto de las métricas del servidor.

Ideal para: servidores domésticos que utilizan controladores de hardware Broadcom, LSI o MegaRAID compatibles.

Desventaja: StorCLI es una herramienta de administración específica para controladores, no un panel universal para servidores domésticos.

10. Zabbix — Ideal para alertas y automatización avanzadas de RAID

Monitoreo de un entorno de infraestructura complejo con Zabbix - Blog de Zabbix

Zabbix es la opción más orientada a la infraestructura de esta lista.

Sus plantillas actuales de Agent 2 incluyen monitoreo SMART oficial, mientras que el estado de la matriz y del controlador puede añadirse mediante integraciones compatibles, elementos personalizados, scripts o plantillas adecuadas para el entorno.

Una implementación más grande de Zabbix puede combinar:

SMART
RAID
ZFS
Sistema de archivos
UPS
Temperatura
Red
Servicios
     |
   Zabbix
     |
Historial
Activadores
Notificaciones
Escalada

Su fortaleza no es ofrecer una pantalla de RAID especializada, sino permitir definir exactamente qué constituye un fallo y qué debe ocurrir después.

Por ejemplo, una advertencia podría enviarse a un canal de notificaciones normal, mientras que una matriz degradada o un disco virtual sin conexión activaría una escalada más urgente.

Ideal para: usuarios avanzados que ya ejecutan Zabbix o desean reglas detalladas de alertas y automatización para varios sistemas.

Desventaja: la complejidad de configuración es alta. Instalar Zabbix únicamente para monitorear dos discos en un NAS doméstico suele ser innecesario.

¿Qué herramienta de monitoreo de RAID deberías usar realmente?

Si quieres... Comienza con Por qué
Un solo panel para un servidor doméstico Netdata Compatible con RAID MD, SMART, ZFS, RAID por hardware y métricas del sistema
Historial detallado del estado de los discos Scrutiny Enfoque en tendencias SMART, temperatura, umbrales y notificaciones
Monitoreo ligero de discos smartmontools Herramientas de línea de comandos maduras sin una pila de monitorización grande
Eventos del RAID por software de Linux Monitor de mdadm Detecta fallos, reconstrucciones y estados degradados de matrices MD
Eventos de grupos ZFS OpenZFS ZED Demonio de eventos nativo para ZFS
Una interfaz gráfica sencilla para el almacenamiento de Linux Cockpit Gestión del RAID y estado SMART en el navegador
Paneles personalizados a largo plazo Prometheus + Grafana Métricas, historial, correlación y alertas flexibles
Varios servidores domésticos Checkmk Centraliza la monitorización de hosts, servicios, discos e infraestructura
RAID por hardware LSI/Broadcom StorCLI Lee directamente el estado del controlador, las unidades virtuales y las unidades físicas
Automatización compleja de alertas Zabbix Disparadores, plantillas, historial y escalado flexibles

Estado del RAID frente al estado SMART: no son lo mismo

Esta distinción es más importante que la elección entre la mayoría de las herramientas de la clasificación.

Señal Lo que te indica Lo que no te indica
RAID en buen estado La matriz cuenta actualmente con los miembros necesarios Todas las unidades seguirán en buen estado
RAID degradado Se ha perdido la redundancia o la pertenencia esperada La causa física exacta en todos los casos
SMART APROBADO La unidad no ha alcanzado su estado de fallo SMART Que todos los atributos sean ideales
Sectores pendientes Hay sectores a la espera de una relectura o reasignación correctas El estado completo de la matriz RAID
Sectores reasignados La unidad ha reasignado sectores inutilizables Si la matriz aún conserva redundancia
Temperatura Condiciones térmicas actuales o históricas Si el sistema de archivos es coherente
Progreso de la reconstrucción Hasta dónde ha avanzado la restauración de la redundancia Si las copias de seguridad antiguas son recuperables
Errores de suma de comprobación de ZFS ZFS detectó problemas de integridad Cada modo de fallo mecánico subyacente

Un ejemplo útil es:

mdadm:
Matriz en buen estado

Scrutiny:
Disco 3
Sectores pendientes actuales = 0 → 2 → 8

La matriz aún no ha fallado, pero el historial de la unidad física te da motivos para investigar.

También puede ocurrir lo contrario:

mdadm:
Matriz degradada

smartctl:
Disco 1 APROBADO
Disco 2 APROBADO
Disco 3 APROBADO

El miembro ausente puede haber desaparecido por problemas de cableado, alimentación, controlador, enumeración del dispositivo u otro fallo que no se refleje en un umbral de fallo de SMART.

Monitorización de mdadm frente a ZFS y RAID por hardware

La herramienta de monitorización adecuada depende en parte de dónde resida la lógica del RAID.

Arquitectura de almacenamiento Monitor nativo Segunda capa útil
RAID MD de Linux mdadm Scrutiny / Netdata
OpenZFS ZED / zpool Scrutiny / Netdata / Grafana
RAID por hardware LSI/Broadcom StorCLI Netdata / Checkmk
RAID del dispositivo NAS Monitorización integrada del sistema operativo NAS Herramienta de SMART e historial cuando es compatible

Por eso la disposición del almacenamiento afecta a la arquitectura de monitorización. El RAID por software, ZFS y el RAID por hardware exponen estados diferentes a través de distintas capas de control.

Scrutiny frente a Netdata: ¿cuál deberías instalar?

Funcionan mejor juntos que enfrentados.

Área Scrutiny Netdata
Enfoque principal Estado de las unidades físicas Monitorización de todo el servidor
Historial de SMART Excelente Disponible como métricas
Tendencias de temperatura Excelente
Estado del RAID MD No
Estado del pool de ZFS No
RAID de hardware Depende del passthrough de SMART Colector de StoreCLI
CPU, RAM y red No
Función principal Especialista en discos Panel del servidor

Por tanto, una combinación sencilla para un servidor doméstico es:

Netdata
  |
Estado de la matriz y del servidor

Scrutiny
  |
Tendencias de las unidades físicas

Si solo quieres una aplicación, Netdata cubre más capas.

Si el sistema operativo del NAS ya monitoriza bien el estado de la matriz, Scrutiny puede aportar más información nueva porque ofrece una mejor vista histórica de los discos físicos.

¿Necesitas Prometheus y Grafana para un NAS doméstico?

Normalmente, no.

Si el único requisito es:

Avísame cuando el RAID esté degradado
Avísame cuando un disco esté fallando

las alertas nativas de la matriz, junto con smartd, Scrutiny o Netdata, pueden resolver el problema con mucha menos infraestructura.

Prometheus y Grafana empiezan a tener sentido cuando te interesa:

  • historial de meses o años;
  • varios servidores;
  • paneles personalizados;
  • correlacionar la temperatura con la E/S;
  • seguir el crecimiento del almacenamiento;
  • combinar RAID con métricas de UPS, red, Docker y el host;
  • reglas de alerta PromQL personalizadas.

La razón equivocada para instalar Grafana es simplemente que el panel resulta impresionante.

La razón adecuada es que tienes preguntas que requieren un historial de series temporales.

¿Qué alertas de RAID deberías configurar?

La monitorización solo resulta útil cuando algo puede avisarte sin que tengas que abrir primero el panel.

Alertas de la matriz

  • la matriz está degradada;
  • la matriz está sin conexión;
  • falta inesperadamente un miembro;
  • se ha activado la unidad de repuesto;
  • la reconstrucción o resincronización ha comenzado;
  • la reconstrucción ha fallado;
  • la reconstrucción se ha completado.

Alertas de unidades físicas

  • fallo del estado general de SMART;
  • aumenta el recuento actual de sectores pendientes;
  • aumentan los sectores que no se pueden corregir sin conexión;
  • el recuento de sectores reasignados aumenta considerablemente;
  • advertencia crítica de NVMe;
  • la resistencia o el desgaste del SSD se acercan al nivel de reemplazo;
  • la temperatura de la unidad permanece fuera del rango esperado.

Alertas de ZFS

  • pool degradado;
  • fallo del dispositivo;
  • aumentan los errores de suma de comprobación;
  • el scrub detecta errores;
  • el resilver comienza o falla;
  • la capacidad del pool se acerca al umbral elegido.

Alertas de RAID de hardware

  • la unidad física ha fallado;
  • la unidad virtual está degradada;
  • la unidad virtual está sin conexión;
  • la reconstrucción se ha detenido o ha fallado;
  • fallo de la caché del controlador o de la batería de respaldo.

La temperatura exacta y los umbrales SMART no deben copiarse ciegamente de otro servidor. Cada modelo de unidad expone atributos y rangos operativos diferentes.

El principio es más importante:

Un panel que nunca abres no es monitorización.

Prueba SMART frente a scrub y reconstrucción: tres tareas diferentes

Estas operaciones suelen confundirse, pero inspeccionan cosas distintas.

Prueba automática SMART

Una prueba automática SMART la realiza un dispositivo de almacenamiento individual.

Una unidad
   |
Prueba SMART
   |
Resultado a nivel de dispositivo

Una prueba SMART larga puede escanear una mayor parte de la superficie de la unidad que una prueba corta, pero no verifica la paridad del RAID ni las copias de datos de ZFS en todo el sistema de almacenamiento.

Reconstrucción o resincronización de RAID

Una reconstrucción restaura la redundancia después de que un miembro haya fallado o sido reemplazado.

RAID degradado
     |
Unidad de reemplazo
     |
Reconstrucción / resincronización
     |
Redundancia restaurada

Es una operación de recuperación, no una prueba del estado del disco.

Una operación de scrub o de consistencia verifica las relaciones de datos y redundancia que ya existen.

Comprobación de ZFS o comprobación de consistencia de RAID

Responde a una pregunta diferente:

> ¿Los datos almacenados siguen coincidiendo con la información de integridad y redundancia que espera el sistema de almacenamiento?

Por eso el monitoreo debería mostrar las tres cuando la arquitectura de almacenamiento las admita.

Activa las alertas nativas del NAS antes de instalar otro panel

Un sistema operativo NAS específico puede proporcionar ya la primera capa de monitoreo que necesitas.

Por ejemplo, la gestión del almacenamiento actual de ZimaOS muestra el estado de la matriz, el estado de las unidades, la capacidad utilizable y las velocidades de lectura/escritura en Settings > Storage. Un miembro RAID fallido cambia la matriz a un estado degradado, y el flujo de recuperación guía al usuario durante la reconstrucción después de reemplazar la unidad.

ZimaOS también muestra el progreso de las comprobaciones de RAID y paridad de larga duración, así como información detallada sobre el estado de los discos, en su interfaz de almacenamiento.

Por lo tanto, el orden práctico debería ser:

1. Activa las alertas nativas del NAS
        |
2. Confirma la detección de matrices degradadas
        |
3. Añade un historial de las unidades físicas
        |
4. Añade una pila de observabilidad más amplia solo si es útil

TrueNAS, Unraid, Synology, QNAP y otras plataformas NAS también ofrecen funciones nativas de supervisión del estado del almacenamiento, que deben configurarse antes de añadir un segundo sistema de monitoreo.

La capa adicional debería responder una pregunta que la interfaz nativa no responde bien.

El monitoreo de RAID no reemplaza las copias de seguridad

Una alerta perfecta puede indicarte en cuestión de segundos que un disco ha fallado.

No puede restaurar la versión de ayer de una carpeta eliminada.

No puede recuperar archivos que ya hayan sido cifrados por ransomware.

No puede recrear el NAS después de un robo, un incendio o un fallo catastrófico del controlador.

Por eso RAID no es una copia de seguridad.

RAID
  |
Disponibilidad tras fallos de algunas unidades

Monitoreo
  |
Detectar problemas rápidamente

Copia de seguridad
  |
Recuperar datos perdidos o dañados

Las tres resuelven distintas partes del problema de fiabilidad.

El monitoreo se vuelve especialmente importante durante las reconstrucciones, porque las unidades restantes pueden experimentar una actividad sostenida mientras la redundancia está reducida. Una pérdida inesperada de energía durante ese período añade otro riesgo, por lo que la protección mediante UPS durante las operaciones de almacenamiento es importante de forma independiente del monitoreo del estado de las unidades.

Pilas de monitorización de RAID recomendadas

Servidor Linux con RAID sencillo

mdadm --monitor
       +
     smartd

Esta es la opción ligera.

mdadm supervisa la matriz de Linux. smartd supervisa los discos. Ninguno requiere una plataforma web pesada.

NAS doméstico sencillo

Monitorización nativa del NAS
         +
      Scrutiny

La interfaz del NAS gestiona el estado de la matriz y las reconstrucciones, mientras que Scrutiny añade el historial del estado de las unidades y las notificaciones.

Servidor Linux doméstico general

Netdata
   +
Scrutiny

Netdata proporciona monitorización de la matriz y de todo el servidor. Scrutiny proporciona un historial más profundo de las unidades físicas.

Servidor doméstico ZFS

ZED
 +
Scrutiny
 +
Netdata

ZED gestiona los eventos nativos de ZFS, Scrutiny supervisa las tendencias de las unidades y Netdata proporciona un panel más amplio del sistema.

Laboratorio doméstico avanzado

smartctl_exporter
Exportadores de MD / ZFS
node_exporter
      |
  Prometheus
      |
   Grafana
      |
Alertas

Esto es adecuado cuando el historial de métricas y varios servidores justifican mantener una pila completa de observabilidad.

Servidor con RAID por hardware

StorCLI
   |
Netdata / Checkmk
   |
Alertas + Panel

La utilidad del controlador sigue siendo la fuente de verdad para la capa de RAID por hardware, mientras que la plataforma de monitorización hace que su estado sea visible y permita actuar.

Veredicto final

Netdata es la mejor herramienta general de monitorización de RAID para la mayoría de los servidores domésticos porque puede situarse por encima de varias arquitecturas de almacenamiento y, al mismo tiempo, monitorizar el propio host.

Scrutiny es la herramienta complementaria más potente cuando importa el historial de cada unidad. Es especialmente útil para detectar cambios lentos en los atributos SMART antes de que la propia matriz alcance un estado degradado.

smartmontools sigue siendo la capa fundamental para el estado de salud de los discos, mientras que mdadm Monitor continúa siendo una de las respuestas más limpias para el RAID por software de Linux.

OpenZFS ZED debería seguir formando parte de una estrategia de monitorización nativa de ZFS, en lugar de intentar sustituir los eventos del pool por datos SMART genéricos.

Cockpit es la opción gráfica más sencilla para un servidor Linux normal, mientras que Prometheus y Grafana tienen más sentido cuando las métricas a largo plazo se convierten en un requisito real.

Checkmk y Zabbix adquieren más valor a medida que aumenta el número de sistemas monitorizados, y StorCLI es esencial cuando la lógica del RAID reside en hardware LSI/Broadcom compatible.

Por lo tanto, la estrategia más fiable para un servidor doméstico es una estrategia por capas:

Estado de la matriz
     +
Estado de las unidades
     +
Estado de recuperación
     +
Alertas
     +
Historial

El RAID suele fallar por capas, así que la monitorización también debería organizarse por capas.

Preguntas frecuentes

¿Cuál es la mejor herramienta de monitorización de RAID para un servidor doméstico?

Netdata es una de las mejores opciones generales porque puede monitorizar RAID MD de Linux, dispositivos SMART, pools de ZFS, RAID por hardware compatible y el resto del servidor desde una sola interfaz. Scrutiny es una herramienta especializada más potente cuando la prioridad es disponer de un historial detallado de SMART de las unidades físicas.

¿Scrutiny es una herramienta de monitorización de RAID?

Scrutiny monitoriza las unidades físicas que se encuentran bajo una matriz RAID mediante datos SMART. No sustituye la monitorización a nivel de matriz, como mdadm para MD RAID de Linux, ZED para eventos de ZFS o StorCLI para controladores RAID de hardware compatibles.

¿SMART puede indicar PASSED cuando una unidad está fallando?

SMART PASSED significa que la unidad no ha superado la condición general de fallo SMART del dispositivo. Los atributos individuales aún pueden cambiar de forma preocupante antes de que ese estado pase a indicar un fallo. La monitorización histórica es útil porque hace visibles esas tendencias.

¿Cuál es la mejor forma de monitorizar un RAID de mdadm?

Usa el modo de monitorización de mdadm para los eventos de la matriz y combínalo con smartmontools o Scrutiny para el estado de las unidades físicas. Netdata puede proporcionar una capa gráfica adicional de monitorización de MD RAID y del servidor.

¿Cuál es la mejor forma de monitorizar un pool de ZFS?

Usa herramientas nativas de ZFS, como ZED y zpool, para los eventos y el estado del pool. Añade smartmontools o Scrutiny para el estado de cada unidad, y Netdata, Prometheus o Grafana cuando necesites visualización histórica.

¿La monitorización del RAID detecta un disco duro defectuoso antes de que falle?

La monitorización de la matriz por sí sola puede no hacerlo. Las herramientas basadas en SMART pueden mostrar cambios en el estado de las unidades antes de que la matriz pierda un miembro, aunque ningún sistema de monitorización puede predecir de forma fiable todos los fallos de unidades.

¿Debo usar Netdata o Scrutiny?

Usa Netdata cuando quieras un único panel para todo el servidor que cubra RAID, almacenamiento, CPU, RAM, red y servicios. Usa Scrutiny cuando la prioridad sean las tendencias detalladas de SMART y el historial del estado de las unidades. Ejecutar ambos puede ser útil porque cubren diferentes capas.

¿Necesito Grafana para monitorizar el RAID?

No. Grafana es útil para métricas a largo plazo, paneles personalizados, varios sistemas y correlaciones. Un NAS doméstico sencillo normalmente puede monitorizarse adecuadamente con sus alertas nativas y smartmontools, Scrutiny o Netdata.

¿Qué alertas debería enviar un servidor RAID?

Como mínimo, configura alertas para matrices degradadas o sin conexión, miembros ausentes, fallos de reconstrucción, fallos del estado SMART, cambios importantes en los atributos SMART, temperaturas elevadas de las unidades, errores de ZFS y fallos del controlador RAID de hardware o de la caché, cuando corresponda.

¿Un scrub de RAID es lo mismo que una prueba SMART?

No. Una prueba SMART se ejecuta en una unidad individual. Un scrub o una comprobación de coherencia valida los datos y la redundancia a nivel del sistema de almacenamiento. Una reconstrucción restaura la redundancia después de un fallo o reemplazo de disco.

¿La monitorización del RAID sustituye a las copias de seguridad?

No. La monitorización ayuda a detectar rápidamente los fallos y el RAID puede mantener la disponibilidad después de ciertos fallos de unidades. Ninguno de los dos restaura archivos eliminados, cifrados, dañados o modificados históricamente. Sigue siendo necesaria una copia de seguridad independiente.

¿Debo monitorizar los SSD y las unidades NVMe en RAID?

Sí. Los SSD y las unidades NVMe proporcionan información sobre su estado, como advertencias críticas, temperatura, errores de medios y resistencia o desgaste. Los atributos exactos difieren de los datos SMART de los HDD, por lo que la herramienta de monitorización necesita compatibilidad adecuada con los dispositivos.

Comparaciones de productos

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.