I 10 migliori strumenti di monitoraggio RAID per server domestici

Eva Wong è la Technical Writer e smanettatrice residente di ZimaSpace. Una geek da sempre con una passione per homelab e software open-source, si specializza nel tradurre concetti tecnici complessi in guide accessibili e pratiche. Eva crede che l'auto-ospitare debba essere divertente, non intimidatorio. Attraverso i suoi tutorial, dà potere alla comunità di demistificare le configurazioni hardware, dalla costruzione del loro primo NAS al dominio dei container Docker.

Un array RAID può sembrare integro mentre uno dei suoi dischi peggiora silenziosamente. Può anche diventare degradato mentre i dischi rimanenti continuano a riportare SMART PASSED.

Per questo, un buon monitoraggio richiede più di una sola spia verde. La migliore configurazione per un home server controlla l'array, i dischi fisici, le ricostruzioni o gli scrub e gli avvisi che segnalano un cambiamento.

Il monitoraggio RAID è più del monitoraggio SMART

Lo stato del RAID e quello dei dischi rispondono a domande diverse.

Un monitor dell'array indica se il sistema di storage dispone ancora dei membri previsti, se la ridondanza è stata persa e se è in corso una ricostruzione, una risincronizzazione, uno scrub o un'operazione di coerenza.

Il monitoraggio SMART osserva ciò che si trova sotto l'array: i singoli dischi HDD, SSD e NVMe. Può rilevare la temperatura, gli errori dei supporti, i settori in attesa, i settori riallocati, la durata residua, i risultati degli autotest e altri segnali a livello del dispositivo.

Monitoraggio RAID
     |
     +-- Stato dell'array
     |     Integro / Degradato / Offline
     |
     +-- Stato delle unità
     |     SMART / NVMe / Temperatura
     |
     +-- Ripristino
     |     Ricostruzione / Risincronizzazione / Scrub
     |
     +-- Cronologia
     |     Tendenze / Errori / Capacità
     |
     +-- Avvisi
           Email / Push / Webhook / Chat

La distinzione è importante perché un array integro può contenere un disco in deterioramento, mentre un array degradato può avere ancora diversi dischi singoli il cui stato SMART resta normale.

Il modello RAID sottostante è spiegato più dettagliatamente in come funziona il RAID, ma il monitoraggio parte da una regola più semplice: controlla sia l'array sia i dischi sottostanti.

Che cosa dovrebbe monitorare concretamente uno strumento di monitoraggio RAID?

Un utile monitor per home server dovrebbe coprire il maggior numero possibile di questi livelli, in base al ruolo che deve svolgere:

Livello Segnali importanti Perché è importante
Stato dell'array Integro, degradato, offline, membro mancante Mostra se la ridondanza è ancora disponibile
Unità fisiche SMART, temperatura, stato NVMe, usura Può rivelare il deterioramento di un disco prima del guasto dell'array
Ripristino Ricostruzione, risincronizzazione, resilver, scrub, controllo di coerenza Mostra se la ridondanza viene ripristinata o verificata
Errori Errori I/O, errori di checksum, settori non correggibili Fornisce prove del cambiamento dell'affidabilità dello storage
Capacità Utilizzo di pool, file system e unità Impedisce che l'esaurimento dello spazio si trasformi in un'interruzione del servizio
Cronologia Temperatura, attributi SMART, tendenze degli errori Mostra il deterioramento graduale invece di un'unica istantanea attuale
Avvisi Email, webhook, notifiche push, chat, escalation Una dashboard è inutile se nessuno la apre dopo un guasto

Come abbiamo classificato i migliori strumenti di monitoraggio RAID

Questa non è una classifica delle dashboard più belle. Gli strumenti qui sotto risolvono problemi diversi dello stack di monitoraggio.

Li abbiamo valutati sulla base di cinque domande pratiche:

  • Che cosa può osservare concretamente? Lo stato dell'array, i singoli dischi, i pool ZFS, il RAID hardware o l'intero server?
  • Conserva la cronologia? Un conteggio degli errori che aumenta lentamente è spesso più utile di un singolo valore attuale.
  • Può inviare avvisi senza controlli manuali? Il monitoraggio dovrebbe segnalare i problemi in modo proattivo.
  • Quanto è difficile implementarlo? Un singolo NAS domestico non dovrebbe richiedere un'infrastruttura di osservabilità aziendale, a meno che l'utente non la desideri.
  • Completa gli strumenti RAID nativi? Le configurazioni più solide combinano generalmente un monitor specifico per l'array con un livello di monitoraggio dell'integrità dei dischi.

L'ordine numerico è editoriale e non rappresenta il punteggio di un benchmark sintetico.

I 10 migliori strumenti di monitoraggio RAID per server domestici in sintesi

Posizione Strumento Ideale per Stato dell'array Stato dell'unità Cronologia Difficoltà
1 Netdata Un unico dashboard per il server domestico Da bassa a media
2 Scrutiny Andamento dello stato SMART No Eccellente Eccellente Bassa
3 smartmontools Monitoraggio di base dei dischi No Eccellente Limitato senza un altro livello Bassa
4 Monitor mdadm RAID software Linux Eccellente No Orientato agli eventi Bassa
5 OpenZFS ZED Eventi del pool ZFS Eccellente per ZFS Indiretto Orientato agli eventi Da bassa a media
6 Archiviazione Cockpit GUI Linux intuitiva per principianti Limitato Bassa
7 Prometheus + Grafana Metriche personalizzate a lungo termine Con exporter Eccellente Eccellente Alta
8 Checkmk Più server domestici Con controlli/plugin Media
9 StorCLI RAID hardware LSI/Broadcom Eccellente Eccellente per le unità dei controller Orientato alla CLI Media
10 Zabbix Avvisi personalizzati avanzati Con modelli/script Eccellente Alta

1. Netdata — Il miglior dashboard complessivo per il monitoraggio RAID

Presentazione dell'ambiente demo di Netdata | Netdata

Netdata è la scelta complessivamente migliore quando vuoi un unico livello di monitoraggio per il sistema di archiviazione e il resto del server domestico.

Gli attuali collector di archiviazione coprono diverse architetture rilevanti per gli utenti RAID.

Per il RAID software Linux, il collector MD RAID legge /proc/mdstat e monitora i dispositivi MD. Per le unità fisiche, Netdata dispone di un collector SMART basato su smartctl. Il suo collector dei pool ZFS monitora l'integrità e lo spazio dei pool tramite zpool, mentre il suo collector RAID StoreCLI può monitorare gli adattatori RAID hardware supportati, le unità fisiche e le batterie di backup.

Questa ampiezza offre a Netdata un vantaggio rispetto ai dashboard SMART più specializzati.

RAID MD
SMART
ZFS
RAID hardware
File system
CPU
RAM
Rete
Container
     |
  Netdata
     |
Un dashboard

Un singolo agente Netdata può funzionare in modo indipendente ed esporre il proprio dashboard locale sulla porta 19999La connettività cloud è facoltativa per l'agente di monitoraggio stesso, sebbene Netdata Cloud aggiunga visualizzazioni centralizzate e ulteriori funzionalità per più nodi.

Questo rende Netdata particolarmente utile su un server domestico, dove il monitoraggio dello storage dovrebbe affiancare il carico del sistema, la pressione sulla RAM, la capacità del filesystem, l'attività di Docker e le prestazioni della rete.

Ideale per: utenti che desiderano un'unica dashboard per RAID e per il resto del server.

Compromesso: Netdata offre un monitoraggio ampio anziché concentrarsi ossessivamente sui dischi. Scrutiny offre una visualizzazione più chiara quando l'obiettivo è studiare gli attributi SMART e il deterioramento a lungo termine delle unità fisiche.

2. Scrutiny — Ideale per individuare gli andamenti dello stato delle unità

Scrutiny è una delle aggiunte più utili a un NAS domestico perché risolve diverse carenze del monitoraggio SMART non elaborato.

SMART espone un gran numero di attributi, ma non tutti sono ugualmente utili. Anche le soglie dei produttori possono essere abbastanza conservative da far sembrare un'unità “integra” fino a quando il guasto non è relativamente vicino.

Scrutiny combina i dati SMART con un'interfaccia Web, l'archiviazione degli andamenti storici, il monitoraggio della temperatura e soglie aggiuntive basate sui dati reali relativi ai guasti delle unità.

Ciò consente di porsi domande come:

Settori in attesa attuali

Gennaio       0
Marzo         0
Giugno          2
Agosto        8

Un singolo report SMART attuale ti dice che il valore è otto. Scrutiny ti dice che la metrica sta evolvendo nella direzione sbagliata.

Supporta inoltre notifiche configurabili tramite e-mail, webhook, ntfy, Gotify, Slack, Discord, Telegram e altri servizi.

Il supporto ai controller RAID dipende da smartctl può accedere alle unità fisiche sottostanti. Per questo Scrutiny documenta il passthrough del controller e la mappatura dei dispositivi Docker.

Il limite importante è altrettanto chiaro:

Scrutiny monitora le unità, non l'array RAID in sé.

Un array Linux MD dovrebbe comunque essere monitorato con mdadm o con un altro livello consapevole della struttura dell'array. Un pool ZFS dovrebbe comunque disporre di un monitoraggio specifico per ZFS.

Ideale per: server domestici con più HDD o SSD, dove sono importanti i dati SMART storici e l'andamento delle temperature.

Compromesso: non confondere una serie di dischi integri in Scrutiny con la prova che l'array RAID sia integro.

Il livello di monitoraggio dello stato delle unità dipende anche dalle unità stesse. Scegliere unità NAS adatte riduce i problemi evitabili durante le ricostruzioni e i carichi di lavoro continui 24/7.

3. smartmontools — La base migliore per il monitoraggio di HDD, SSD e NVMe

GitHub - smartmontools/smartmontools: 2025-06-01: questo è ora il repository upstream ufficiale di smartmontools · GitHub

smartmontools è molto meno accattivante visivamente di Scrutiny, ma è più fondamentale.

Il progetto fornisce due strumenti fondamentali:

smartctl
   |
Esamina e testa un'unità

smartd
   |
Monitora continuamente le unità

smartctl può esaminare le informazioni SMART e sullo stato di ATA/SATA, SCSI/SAS e dei dispositivi NVMe e avviare autotest delle unità. smartd viene eseguito come demone e controlla continuamente i dispositivi per verificare le condizioni di integrità configurate.

Molti prodotti di monitoraggio di livello superiore dipendono in ultima analisi da questi dati. Il collector SMART di Netdata richiede smartmontools, Scrutiny costruisce il proprio livello di integrità dei dischi intorno ai dati di smartctl ed exporter smartctl per Prometheus utilizzano la stessa interfaccia.

Il progetto è ancora in evoluzione. Il changelog upstream attuale indica smartmontools 8.0 come prossima versione non ancora rilasciata, dopo la 7.5.

Per un home server leggero, smartd potrebbe essere tutto ciò che serve:

Unità
  |
SMART
  |
smartd
  |
Avviso

Non è necessariamente necessario un database, una dashboard e uno stack di metriche separati per sapere che un'unità ha superato una soglia importante.

Ideale per: utenti che desiderano una base leggera e collaudata per il monitoraggio dello stato delle unità fisiche e i test automatizzati.

Compromesso: l'output della riga di comando è meno accessibile di quello di Scrutiny o Cockpit e smartd da solo non offre la stessa analisi visiva dei dati storici.

4. Monitor mdadm — Il miglior monitor nativo per il RAID software Linux

Monitoraggio degli array RAID MDADM con Cacti e SNMP · Matt Dyson

Se l'array è Linux MD RAID, mdadm dovrebbe rimanere parte del piano di monitoraggio anche se è installato Netdata o un'altra dashboard.

mdadm --monitor comprende l'array stesso.

Può segnalare eventi come:

  • guasto del dispositivo;
  • array degradati;
  • attivazione dell'unità di riserva;
  • scomparsa del dispositivo;
  • avvio della ricostruzione;
  • avanzamento della ricostruzione;
  • completamento della ricostruzione.

Colma la lacuna lasciata da SMART:

smartd
  |
Le unità sono integre?

mdadm --monitor
  |
L'array RAID è integro?

Per un home server Linux minimale, combinare il monitoraggio di mdadm con smartd crea un sistema di monitoraggio sorprendentemente efficace senza aggiungere un grande stack Web.

Ideale per: server Debian, Ubuntu e altri server Linux basati su MD RAID 1, 5, 6 o 10.

Compromesso: mdadm si concentra sul RAID software Linux, non su ZFS, RAID hardware o analisi grafiche a lungo termine.

5. OpenZFS ZED — Il miglior monitoraggio nativo degli eventi per i pool ZFS

rinomina il binario zed in zfs-zed · Problema #17351 · openzfs/zfs

Gli utenti ZFS dovrebbero monitorare ZFS come ZFS, anziché cercare di ricondurre ogni evento alla terminologia RAID tradizionale.

ZED, il demone degli eventi ZFS, monitora gli eventi generati dal modulo del kernel ZFS ed esegue le azioni ZEDLET configurate quando compaiono classi di eventi corrispondenti.

La relazione di monitoraggio diventa:

Kernel ZFS
    |
  zevents
    |
   ZED
    |
Azioni ZEDLET
    |
Notifiche / Automazione

Questo rende ZED adatto agli eventi dei pool e dei dispositivi che appartengono a ZFS stesso, anziché a una dashboard esterna per i dischi.

Uno stack ZFS completo per un home server può quindi includere:

ZED
 |
Eventi dei pool

smartd / Scrutiny
 |
Stato delle unità fisiche

Netdata / Grafana
 |
Dashboard e cronologia

Ideale per: utenti di TrueNAS, OpenZFS o ZFS su Linux/BSD che desiderano una gestione nativa degli eventi relativi ai propri pool.

Compromesso: ZED è un demone per gli eventi, non una dashboard completa e rifinita. Affiancalo a un altro livello se la visualizzazione a lungo termine è importante.

6. Cockpit Storage — La migliore GUI per il monitoraggio RAID per principianti di Linux

GitHub - 45Drives/cockpit-hardware: un modulo Cockpit per i server di storage 45Drives · GitHub

Cockpit è uno dei modi più semplici per aggiungere un'interfaccia di amministrazione basata sul browser a un normale server Linux.

La sua applicazione Storage supporta dischi locali, partizioni, RAID, crittografia, NFS, iSCSI e altre operazioni di archiviazione comuni.

Cockpit ha inoltre aggiunto alla pagina Storage le informazioni sullo stato SMART dei dispositivi, inclusa la possibilità di eseguire autotest dei dischi dal browser.

Questo lo rende una valida opzione per principianti per un server che altrimenti si presenta così:

Ubuntu / Debian / Fedora
          |
       Cockpit
          |
 Interfaccia di archiviazione nel browser
          |
 RAID + SMART + montaggi

È particolarmente utile quando l'utente vuole gestire lo storage anziché creare uno stack di osservabilità dedicato.

Ideale per: principianti di Linux che desiderano lo stato di RAID e dischi in un'interfaccia pulita per la gestione del server.

Compromesso: Cockpit è migliore per mostrare e gestire lo stato attuale del server che per conservare mesi di cronologia SMART dettagliata.

7. Prometheus + smartctl_exporter + Grafana — Ideale per le metriche a lungo termine

Le chiavi JSON di smartctl sono tutte errate · Problema n. 42 · prometheus-community/ smartctl_exporter

Quando il monitoraggio diventa un hobby a sé stante, lo stack Prometheus offre molto più controllo rispetto a una dashboard NAS progettata per uno scopo specifico.

L'ufficiale smartctl_exporter converte le statistiche di smartctl in metriche Prometheus. Richiede smartmontools 7.0 o versioni successive perché dipende dall'output JSON di smartctl.

L'architettura è modulare:

Esportatori SMART / RAID / ZFS
           |
       Prometheus
           |
         Grafana
           |
 Dashboard e avvisi

Gli exporter aggiuntivi o le metriche dei nodi possono aggiungere:

  • capacità del file system;
  • I/O del disco;
  • pool ZFS;
  • stato del RAID MD;
  • temperatura;
  • carico del server;
  • metriche dell'UPS;
  • attività di rete.

Questa è l'opzione più efficace quando vuoi rispondere a domande storiche anziché limitarti a controllare lo stato di salute attuale.

Ad esempio:

  • La temperatura dell'unità è aumentata durante l'ultima ricostruzione del RAID?
  • Quando sono comparsi per la prima volta gli errori non correggibili?
  • La latenza dello storage è cambiata dopo l'aggiunta di un'altra unità?
  • Quanto è cresciuta l'utilizzazione del pool nell'ultimo anno?

Grafana Alerting può anche valutare le regole basate su Prometheus e inoltrare le notifiche quando le condizioni vengono soddisfatte.

Ideale per: appassionati che desiderano metriche a lungo termine, dashboard personalizzate, correlazioni e avvisi flessibili.

Compromesso: Prometheus + exporter + Grafana richiede una configurazione decisamente più complessa rispetto a Scrutiny o Netdata. Per un semplice NAS domestico, questa complessità potrebbe offrire pochi vantaggi pratici.

8. Checkmk — Ideale per monitorare più server domestici

Monitoraggio di Kubernetes

Checkmk diventa più interessante quando l'home lab contiene più di una macchina.

Invece di pensare solo a un NAS, potresti avere:

NAS
Server di backup
Host Proxmox
Mini PC
Router
UPS
Switch
     |
   Checkmk

L'agente Linux di Checkmk supporta il monitoraggio hardware tramite plugin, inclusi i valori SMART dei moderni HDD e SSD.

La relativa documentazione tiene inoltre esplicitamente conto delle unità nascoste dietro i controller RAID supportati. A seconda del controller, potrebbero essere necessari strumenti come smartmontools, tw_cli, oppure potrebbero essere necessarie le utilità MegaRAID prima che Checkmk possa accedere alle informazioni del dispositivo sottostante.

Il vantaggio principale è la gestione centralizzata: più host, stati dei servizi, regole di avviso, grafici, inventario, capacità e monitoraggio del sistema possono risiedere tutti in un'unica interfaccia.

Ideale per: home lab in cui lo stato di salute dello storage deve essere monitorato insieme a diversi server Linux e dispositivi dell'infrastruttura.

Compromesso: Checkmk è un sovraccarico inutile per un singolo NAS se Netdata o il monitoraggio nativo del sistema operativo coprono già i segnali di errore importanti.

9. StorCLI — Ideale per RAID hardware LSI e Broadcom

Installazione di Avago LSI StorCLI VMware ESXi - Guida alla virtualizzazione

Il RAID hardware richiede un approccio diverso al monitoraggio, perché il sistema operativo può vedere un solo disco virtuale mentre il controller gestisce diversi dischi fisici sottostanti.

Sistema operativo
      |
 Unità virtuale
      |
 Controller RAID
      |
+-----+-----+-----+
Disco 1   Disco 2  Disco 3

StorCLI è l'utility da riga di comando di Broadcom per la gestione dei controller RAID LSI/Broadcom supportati.

Può esaminare lo stato del controller, i dischi virtuali, i dischi fisici, le operazioni di ricostruzione, le informazioni sullo chassis, la cache e i componenti supportati della batteria o del backup.

Lo stato del RAID hardware può includere stati come:

  • Ottimale;
  • Parzialmente degradato;
  • Degradato;
  • Offline.

Questa visibilità a livello di controller è essenziale perché gli strumenti SMART generici potrebbero non riuscire a rilevare automaticamente i dischi membri attraverso ogni controller RAID.

Una combinazione di monitoraggio utile è:

RAID Broadcom / LSI
        |
      StorCLI
        |
     Netdata
        |
Dashboard + avvisi

Il collector StoreCLI di Netdata può utilizzare le informazioni del controller e visualizzarle accanto al resto delle metriche del server.

Ideale per: server domestici che utilizzano controller hardware Broadcom, LSI o MegaRAID supportati.

Compromesso: StorCLI è uno strumento di amministrazione specifico per controller, non una dashboard universale per server domestici.

10. Zabbix — Ideale per avvisi RAID avanzati e automazione

Monitoraggio di un ambiente infrastrutturale complesso con Zabbix - Blog di Zabbix

Zabbix è l'opzione più orientata all'infrastruttura di questo elenco.

I suoi template Agent 2 attuali includono il monitoraggio SMART ufficiale, mentre lo stato degli array e dei controller può essere aggiunto tramite integrazioni supportate, elementi personalizzati, script o template adeguati all'ambiente.

Un'installazione Zabbix più ampia può combinare:

SMART
RAID
ZFS
File system
UPS
Temperatura
Rete
Servizi
     |
   Zabbix
     |
Cronologia
Trigger
Notifiche
Escalation

Il punto di forza non è una schermata RAID dedicata. È la possibilità di definire esattamente cosa costituisce un errore e cosa dovrebbe accadere dopo.

Ad esempio, un avviso potrebbe essere indirizzato a un normale canale di notifica, mentre un array degradato o un disco virtuale offline potrebbe attivare un'escalation più urgente.

Ideale per: utenti avanzati che eseguono già Zabbix o desiderano regole dettagliate di avviso e automazione per più sistemi.

Compromesso: la configurazione è complessa. Installare Zabbix solo per monitorare due dischi in un unico NAS domestico è solitamente superfluo.

Quale strumento di monitoraggio RAID dovresti usare davvero?

Se desideri... Inizia con Perché
Un'unica dashboard per un server domestico Netdata Supporta MD RAID, SMART, ZFS, RAID hardware e metriche di sistema
Cronologia dettagliata dello stato dei dischi Scrutiny Monitoraggio mirato di tendenze SMART, temperatura, soglie e notifiche
Monitoraggio leggero dei dischi smartmontools Strumenti maturi da riga di comando senza un grande stack di monitoraggio
Eventi del RAID software Linux Monitor mdadm Riconosce guasti, ricostruzioni e stati degradati degli array MD
Eventi del pool ZFS OpenZFS ZED Demone eventi nativo per ZFS
Una semplice interfaccia grafica Linux per l’archiviazione Cockpit Gestione RAID e stato SMART nel browser
Dashboard personalizzate a lungo termine Prometheus + Grafana Metriche, storico, correlazione e avvisi flessibili
Più server domestici Checkmk Centralizza il monitoraggio di host, servizi, dischi e infrastruttura
RAID hardware LSI/Broadcom StorCLI Legge direttamente lo stato del controller, dell’unità virtuale e dell’unità fisica
Automazione complessa degli avvisi Zabbix Trigger, modelli, storico ed escalation flessibili

Stato del RAID e stato SMART: non sono la stessa cosa

Questa distinzione è più importante della scelta tra la maggior parte degli strumenti in classifica.

Segnale Cosa indica Cosa non indica
RAID integro L’array dispone attualmente dei membri richiesti Ogni unità rimarrà integra
RAID degradato La ridondanza o l’appartenenza prevista sono andate perse La causa fisica esatta in ogni caso
SMART SUPERATO L’unità non ha superato la soglia di guasto SMART Che ogni attributo sia ideale
Settori in sospeso I settori sono in attesa di una rilettura o riallocazione riuscita Lo stato di salute completo dell’array RAID
Settori riallocati L’unità ha riallocato settori inutilizzabili Se l’array dispone ancora di ridondanza
Temperatura Condizioni termiche attuali o storiche Se il filesystem è coerente
Avanzamento della ricostruzione Quanto è progredito il ripristino della ridondanza Se i vecchi backup sono recuperabili
Errori di checksum ZFS ZFS ha rilevato problemi di integrità Ogni modalità di guasto meccanico sottostante

Un esempio utile è:

mdadm:
Array integro

Scrutiny:
Disco 3
Settore attualmente in sospeso = 0 → 2 → 8

L’array non è ancora guasto, ma lo storico dell’unità fisica fornisce un motivo per indagare.

Può verificarsi anche il contrario:

mdadm:
Array degradato

smartctl:
Disco 1 SUPERATO
Disco 2 SUPERATO
Disco 3 SUPERATO

Il membro mancante potrebbe essere scomparso a causa di cablaggio, alimentazione, problemi del controller, enumerazione del dispositivo o un altro guasto non rappresentato da una soglia di errore SMART.

Monitoraggio di mdadm, ZFS e RAID hardware

Lo strumento di monitoraggio corretto dipende in parte da dove risiede la logica RAID.

Architettura di archiviazione Monitor nativo Secondo livello utile
RAID MD Linux mdadm Scrutiny / Netdata
OpenZFS ZED / zpool Scrutiny / Netdata / Grafana
RAID hardware LSI/Broadcom StorCLI Netdata / Checkmk
RAID dell’appliance NAS Monitoraggio integrato nel sistema operativo NAS Strumento SMART/storico quando supportato

Ecco perché la struttura di archiviazione influisce sull’architettura di monitoraggio. RAID software, ZFS e RAID hardware espongono stati diversi attraverso diversi livelli di controllo.

Scrutiny contro Netdata: quale dovresti installare?

Funzionano meglio insieme che l’uno contro l’altro.

Area Scrutiny Netdata
Focus principale Stato di salute delle unità fisiche Monitoraggio dell’intero server
Cronologia SMART Eccellente Disponibili come metriche
Tendenze della temperatura Eccellente
Stato del RAID MD No
Stato del pool ZFS No
RAID hardware Dipendente dal passthrough SMART Collector StoreCLI
CPU / RAM / rete No
Ruolo principale Specialista dei dischi Dashboard del server

Una combinazione semplice per un server domestico è quindi:

Netdata
  |
Stato dell’array e del server

Scrutiny
  |
Tendenze delle unità fisiche

Se vuoi una sola applicazione, Netdata copre più livelli.

Se il sistema operativo del NAS monitora già bene lo stato dell’array, Scrutiny può aggiungere nuove informazioni perché offre una visualizzazione storica migliore dei dischi fisici.

Servono Prometheus e Grafana per un NAS domestico?

Di solito no.

Se l’unico requisito è:

Avvisami quando il RAID è degradato
Avvisami quando un disco sta per guastarsi

gli avvisi nativi dell’array, insieme a smartd, Scrutiny o Netdata, possono risolvere il problema con un’infrastruttura molto più leggera.

Prometheus e Grafana iniziano ad avere senso quando ti interessa:

  • cronologia di mesi o anni;
  • più server;
  • dashboard personalizzate;
  • correlazione tra temperatura e I/O;
  • monitoraggio della crescita dello spazio di archiviazione;
  • combinazione di RAID con metriche di UPS, rete, Docker e host;
  • regole di avviso PromQL personalizzate.

Il motivo sbagliato per installare Grafana è semplicemente che la dashboard ha un aspetto impressionante.

Il motivo giusto è avere domande che richiedono una cronologia nel tempo.

Quali avvisi RAID dovresti configurare?

Il monitoraggio diventa utile solo quando qualcosa può raggiungerti senza che tu debba aprire prima la dashboard.

Avvisi dell’array

  • array degradato;
  • array offline;
  • membro mancante inaspettatamente;
  • spare attivato;
  • ricostruzione o risincronizzazione avviata;
  • ricostruzione non riuscita;
  • ricostruzione completata.

Avvisi delle unità fisiche

  • errore generale dello stato di salute SMART;
  • il conteggio dei settori attualmente in sospeso aumenta;
  • il conteggio dei settori non correggibili offline aumenta;
  • il conteggio dei settori riallocati aumenta in modo significativo;
  • avviso critico NVMe;
  • la durata residua o l’usura dell’SSD si avvicina al livello che richiede la sostituzione;
  • la temperatura dell’unità rimane al di fuori dell’intervallo previsto.

Avvisi ZFS

  • pool degradato;
  • guasto del dispositivo;
  • gli errori di checksum aumentano;
  • lo scrub rileva errori;
  • il resilvering viene avviato o non riesce;
  • la capacità del pool si avvicina alla soglia scelta.

Avvisi RAID hardware

  • unità fisica guasta;
  • unità virtuale degradata;
  • unità virtuale offline;
  • ricostruzione bloccata o non riuscita;
  • errore della cache del controller o della batteria di backup.

La temperatura esatta e le soglie SMART non devono essere copiate alla cieca da un altro server. Modelli diversi di unità espongono attributi e intervalli operativi diversi.

Il principio è più importante:

Una dashboard che non apri mai non è monitoraggio.

Test SMART, scrub e ricostruzione: tre attività diverse

Queste operazioni vengono spesso confuse, ma controllano aspetti diversi.

Test automatico SMART

Un test automatico SMART viene eseguito da un singolo dispositivo di archiviazione.

Una sola unità
   |
Test SMART
   |
Risultato a livello di dispositivo

Un test SMART lungo può analizzare una porzione maggiore della superficie dell’unità rispetto a un test breve, ma non verifica la parità del RAID né le copie dei dati di ZFS sull’intero sistema di archiviazione.

Ricostruzione o risincronizzazione RAID

Una ricostruzione ripristina la ridondanza dopo il guasto o la sostituzione di un membro.

RAID degradato
     |
Unità sostitutiva
     |
Ricostruzione / risincronizzazione
     |
Ridondanza ripristinata

È un'operazione di ripristino, non un test dello stato del disco.

Scrub ZFS o verifica della coerenza RAID

Un'operazione di scrub o di verifica della coerenza verifica i dati e le relazioni di ridondanza già esistenti.

Risponde a una domanda diversa:

> I dati memorizzati corrispondono ancora alle informazioni di integrità e ridondanza previste dal sistema di archiviazione?

Per questo il monitoraggio dovrebbe mostrare tutti e tre gli aspetti quando l'architettura di archiviazione li supporta.

Abilita gli avvisi nativi del NAS prima di installare un'altra dashboard

Un sistema operativo NAS dedicato potrebbe già fornire il primo livello di monitoraggio necessario.

Ad esempio, l'attuale gestione dell'archiviazione di ZimaOS mostra lo stato dell'array, lo stato delle unità, la capacità utilizzabile e le velocità di lettura/scrittura in Impostazioni > Archiviazione. Il guasto di un membro RAID porta l'array in stato degradato e la procedura di ripristino guida l'utente nella ricostruzione dopo la sostituzione dell'unità.

ZimaOS mostra anche l'avanzamento delle operazioni RAID e dei controlli di parità di lunga durata, oltre a informazioni dettagliate sullo stato dei dischi, nella sua interfaccia di archiviazione.

L'ordine pratico dovrebbe quindi essere:

1. Abilita gli avvisi nativi del NAS
        |
2. Conferma il rilevamento degli array degradati
        |
3. Aggiungi lo storico delle unità fisiche
        |
4. Aggiungi uno stack di osservabilità più ampio solo se utile

TrueNAS, Unraid, Synology, QNAP e altre piattaforme NAS offrono analogamente funzioni native per lo stato dell'archiviazione, che dovrebbero essere configurate prima di aggiungere un secondo sistema di monitoraggio.

Il livello aggiuntivo dovrebbe rispondere a una domanda a cui l'interfaccia nativa non risponde adeguatamente.

Il monitoraggio RAID non sostituisce il backup

Un avviso perfetto può segnalare il guasto di un disco in pochi secondi.

Non può ripristinare la versione di ieri di una cartella eliminata.

Non può recuperare i file già crittografati dal ransomware.

Non può ricreare il NAS dopo un furto, un incendio o un guasto catastrofico del controller.

Ecco perché il RAID non è un backup.

RAID
  |
Disponibilità dopo il guasto di alcune unità

Monitoraggio
  |
Rilevare rapidamente i problemi

Backup
  |
Recuperare i dati persi o danneggiati

Tutti e tre risolvono aspetti diversi del problema dell'affidabilità.

Il monitoraggio diventa particolarmente importante durante le ricostruzioni, perché le unità rimanenti possono essere sottoposte a un'attività continua mentre la ridondanza è ridotta. Un'interruzione di corrente imprevista durante questo periodo aggiunge un ulteriore rischio, motivo per cui la protezione UPS durante le operazioni di archiviazione è importante indipendentemente dal monitoraggio dello stato delle unità.

Stack di monitoraggio RAID consigliati

Server Linux con RAID semplice

mdadm --monitor
       +
     smartd

Questa è l'opzione più leggera.

mdadm monitora l'array Linux. smartd monitora i dischi. Nessuno dei due richiede una piattaforma Web complessa.

NAS domestico semplice

Monitoraggio nativo del NAS
         +
      Scrutiny

L'interfaccia del NAS gestisce lo stato dell'array e le ricostruzioni, mentre Scrutiny aggiunge la cronologia dello stato delle unità e le notifiche.

Server domestico Linux generico

Netdata
   +
Scrutiny

Netdata offre il monitoraggio dell'array e dell'intero server. Scrutiny offre una cronologia più approfondita dello stato delle unità fisiche.

Server domestico ZFS

ZED
 +
Scrutiny
 +
Netdata

ZED gestisce gli eventi nativi di ZFS, Scrutiny monitora l'andamento delle unità e Netdata offre una dashboard più ampia del sistema.

Homelab avanzato

smartctl_exporter
Exporter MD / ZFS
node_exporter
      |
  Prometheus
      |
   Grafana
      |
Generazione di avvisi

Questa soluzione è adatta quando la cronologia delle metriche e la gestione di più server sono sufficientemente importanti da giustificare la manutenzione di uno stack completo di osservabilità.

Server con hardware RAID

StorCLI
   |
Netdata / Checkmk
   |
Avvisi + dashboard

L'utility del controller rimane la fonte autorevole per il livello hardware RAID, mentre la piattaforma di monitoraggio rende il suo stato visibile e utilizzabile.

Verdetto finale

Netdata è il miglior strumento di monitoraggio RAID in assoluto per la maggior parte dei server domestici perché può gestire diverse architetture di storage monitorando al contempo anche l'host.

Scrutiny è lo strumento complementare più potente quando è importante la cronologia delle singole unità. È particolarmente utile per rilevare cambiamenti graduali negli attributi SMART prima che l'array raggiunga uno stato degradato.

smartmontools rimane il livello fondamentale per lo stato dei dischi, mentre mdadm Monitor è ancora una delle soluzioni più semplici per il RAID software Linux.

OpenZFS ZED dovrebbe rimanere parte di una strategia di monitoraggio nativa per ZFS, invece di cercare di sostituire gli eventi del pool con dati SMART generici.

Cockpit è l'opzione grafica più semplice per un normale server Linux, mentre Prometheus e Grafana hanno più senso quando le metriche a lungo termine diventano un requisito concreto.

Checkmk e Zabbix diventano più utili con l'aumentare dei sistemi monitorati, mentre StorCLI è essenziale quando la logica RAID risiede in hardware LSI/Broadcom supportato.

La strategia più affidabile per un server domestico è quindi strutturata a più livelli:

Stato dell'array
     +
Stato dell'unità
     +
Stato del ripristino
     +
Avvisi
     +
Cronologia

Il RAID di solito si guasta a più livelli, quindi anche il monitoraggio dovrebbe essere strutturato a più livelli.

FAQ

Qual è il miglior strumento di monitoraggio RAID per un server domestico?

Netdata è una delle migliori opzioni in assoluto perché può monitorare Linux MD RAID, i dispositivi SMART, i pool ZFS, l'hardware RAID supportato e il resto del server da un'unica interfaccia. Scrutiny è uno strumento specialistico più potente quando la priorità è una cronologia dettagliata dello stato delle unità fisiche.

Scrutiny è uno strumento di monitoraggio RAID?

Scrutiny monitora le unità fisiche sottostanti un array RAID tramite i dati SMART. Non sostituisce il monitoraggio a livello di array, come mdadm per il RAID MD di Linux, ZED per gli eventi ZFS o StorCLI per i controller RAID hardware supportati.

SMART può indicare PASSED quando un'unità è in avaria?

SMART PASSED significa che l'unità non ha superato la condizione generale di guasto SMART del dispositivo. I singoli attributi possono comunque cambiare in modo preoccupante prima che lo stato passi a failed. Il monitoraggio storico è utile perché rende visibili queste tendenze.

Qual è il modo migliore per monitorare un RAID mdadm?

Usa la modalità di monitoraggio di mdadm per gli eventi dell'array e abbinala a smartmontools o Scrutiny per lo stato delle unità fisiche. Netdata può fornire un ulteriore livello grafico di monitoraggio del RAID MD e del server.

Qual è il modo migliore per monitorare un pool ZFS?

Usa strumenti nativi di ZFS come ZED e zpool per gli eventi e lo stato del pool. Aggiungi smartmontools o Scrutiny per lo stato delle singole unità e Netdata, Prometheus o Grafana quando è necessaria una visualizzazione storica.

Il monitoraggio RAID rileva un disco rigido in avaria prima del guasto?

Il solo monitoraggio dell'array potrebbe non bastare. Gli strumenti basati su SMART possono mostrare variazioni degli attributi dello stato dell'unità prima che l'array perda un membro, anche se nessun sistema di monitoraggio può prevedere in modo affidabile ogni guasto di un'unità.

Devo usare Netdata o Scrutiny?

Usa Netdata se vuoi un unico dashboard dell'intero server che copra RAID, archiviazione, CPU, RAM, rete e servizi. Usa Scrutiny quando la priorità è rappresentata dai trend SMART dettagliati e dalla cronologia dello stato delle unità. Eseguire entrambi può essere utile perché coprono livelli diversi.

Ho bisogno di Grafana per monitorare il RAID?

No. Grafana è utile per le metriche a lungo termine, i dashboard personalizzati, più sistemi e la correlazione degli eventi. Un semplice NAS domestico può spesso essere monitorato adeguatamente con gli avvisi nativi e smartmontools, Scrutiny o Netdata.

Quali avvisi deve inviare un server RAID?

Come minimo, configura avvisi per array degradati o offline, membri mancanti, errori di ricostruzione, errori dello stato SMART, variazioni importanti degli attributi SMART, temperature elevate delle unità, errori ZFS e guasti del controller RAID hardware o della cache, se applicabile.

Uno scrub RAID equivale a un test SMART?

No. Un test SMART opera su una singola unità. Uno scrub o un controllo di coerenza convalida i dati e la ridondanza a livello del sistema di archiviazione. Una ricostruzione ripristina la ridondanza dopo un guasto o una sostituzione del disco.

Il monitoraggio RAID sostituisce il backup?

No. Il monitoraggio aiuta a rilevare rapidamente i guasti e il RAID può mantenere la disponibilità dopo alcuni guasti delle unità. Nessuno dei due ripristina file eliminati, crittografati, danneggiati o modificati in passato. È comunque necessario un backup separato.

Devo monitorare SSD e unità NVMe in RAID?

Sì. Gli SSD e le unità NVMe espongono informazioni sullo stato, come avvisi critici, temperatura, errori dei supporti e resistenza o usura. Gli attributi esatti differiscono dai dati SMART degli HDD, quindi lo strumento di monitoraggio deve supportare adeguatamente il dispositivo.

Confronti tra prodotti

Altro da leggere

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.