De 10 bästa RAID-övervakningsverktygen för hemmaservrar

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

En RAID-array kan se frisk ut samtidigt som en av diskarna i tysthet blir sämre. Den kan också bli degraderad medan de återstående diskarna fortfarande rapporterar SMART GODKÄND.

En bra övervakning behöver därför mer än en enda grön statuslampa. Den bästa hemserverlösningen övervakar arrayen, de fysiska diskarna, återuppbyggnader eller scrub samt aviseringarna som talar om att något har förändrats.

RAID-övervakning är mer än SMART

RAID-hälsa och diskhälsa besvarar olika frågor.

En arrayövervakare talar om huruvida lagringssystemet fortfarande har de förväntade medlemmarna, om redundans har gått förlorad och om en återuppbyggnad, omsynkronisering, scrub eller konsekvenskontroll körs.

SMART-övervakning granskar den underliggande arrayen och enskilda HDD-, SSD- och NVMe-diskar. Den kan visa temperatur, mediefel, väntande sektorer, omallokerade sektorer, uthållighet, resultat från självtest och andra signaler på enhetsnivå.

RAID-övervakning
     |
     +-- Arraystatus
     |     Frisk / Degraderad / Offline
     |
     +-- Diskhälsa
     |     SMART / NVMe / Temperatur
     |
     +-- Återställning
     |     Återuppbyggnad / Omsynkronisering / Scrub
     |
     +-- Historik
     |     Trender / Fel / Kapacitet
     |
     +-- Aviseringar
           E-post / Push / Webhook / Chatt

Skillnaden spelar roll eftersom en frisk array kan innehålla en disk som försämras, medan en degraderad array fortfarande kan innehålla flera enskilda diskar vars SMART-status är normal.

Den underliggande RAID-modellen beskrivs mer ingående i hur RAID fungerar, men övervakningen börjar med en enklare regel: övervaka både arrayen och diskarna under den.

Vad bör ett verktyg för RAID-övervakning faktiskt övervaka?

En användbar övervakningslösning för hemservern bör täcka så många av dessa lager som dess roll kräver:

Lager Viktiga signaler Varför det spelar roll
Arraystatus Frisk, degraderad, offline, saknad medlem Visar om redundansen fortfarande finns kvar
Fysiska diskar SMART, temperatur, NVMe-hälsa, slitage Kan avslöja att en disk försämras innan arrayen slutar fungera
Återställning Återuppbyggnad, omsynkronisering, resilver, scrub, konsekvenskontroll Visar om redundansen återställs eller verifieras
Fel I/O-fel, kontrollsummefel, sektorer som inte kan korrigeras Ger belägg för att lagringens tillförlitlighet förändras
Kapacitet Pool-, filsystems- och diskanvändning Förhindrar att utrymmet tar slut och orsakar ett driftstopp
Historik Temperatur, SMART-attribut, feltrender Visar gradvis försämring i stället för bara en aktuell ögonblicksbild
Aviseringar E-post, webhook, push, chatt, eskalering En instrumentpanel är värdelös om ingen öppnar den efter ett fel

Så rankade vi de bästa verktygen för RAID-övervakning

Det här är inte en rangordning av de snyggaste instrumentpanelerna. Verktygen nedan löser olika delar av övervakningsstacken.

Vi utvärderade dem utifrån fem praktiska frågor:

  • Vad kan det faktiskt övervaka? Arraystatus, enskilda diskar, ZFS-pooler, hårdvaru-RAID eller hela servern?
  • Bevarar det historik? Ett långsamt stigande antal fel är ofta mer användbart än ett enda aktuellt värde.
  • Kan det skicka aviseringar utan manuell kontroll? Övervakning bör upptäcka problem proaktivt.
  • Hur svårt är det att distribuera? En enda hem-NAS bör inte kräva infrastruktur för övervakning på företagsnivå om inte användaren vill ha det.
  • Kompletterar det inbyggda RAID-verktyg? De starkaste lösningarna kombinerar vanligtvis en arrayspecifik övervakare med ett lager för diskhälsa.

Den numeriska ordningen är redaktionell och inte ett syntetiskt benchmarkresultat.

De 10 bästa RAID-övervakningsverktygen för hemservrar i korthet

Rankning Verktyg Bäst för Arrayhälsa Enhetens hälsa Historik Svårighetsgrad
1 Netdata En instrumentpanel för hemservern Ja Ja Ja Låg till medel
2 Scrutiny Trender för SMART-hälsa Nej Utmärkt Utmärkt Låg
3 smartmontools Grundläggande diskövervakning Nej Utmärkt Begränsad utan ett annat lager Låg
4 mdadm Monitor Programvarubaserad RAID i Linux Utmärkt Nej Händelseorienterad Låg
5 OpenZFS ZED ZFS-poolhändelser Utmärkt för ZFS Indirekt Händelseorienterad Låg till medel
6 Cockpit Storage Nybörjarvänligt Linux-GUI Ja Ja Begränsad Låg
7 Prometheus + Grafana Långsiktiga anpassade mätvärden Med exportörer Utmärkt Utmärkt Hög
8 Checkmk Flera hemservrar Med kontroller/plugins Ja Ja Medel
9 StorCLI LSI/Broadcom-maskinvaru-RAID Utmärkt Utmärkt för styrenheter och enheter CLI-orienterad Medel
10 Zabbix Avancerad anpassad avisering Med mallar/skript Ja Utmärkt Hög

1. Netdata — bästa övergripande RAID-övervakningsinstrumentpanelen

Introduktion till Netdatas demoutrymme | Netdata

Netdata är det bästa helhetsvalet när du vill ha ett enda övervakningslager för lagringssystemet och resten av hemservern.

Dess aktuella lagringsinsamlare täcker flera arkitekturer som är relevanta för RAID-användare.

För programvarubaserad RAID i Linux läser MD RAID-insamlaren /proc/mdstat och spårar MD-enheter. För fysiska enheter har Netdata en SMART-insamlare baserad på smartctl. Dess ZFS-poolinsamling övervakar poolhälsa och utrymme via zpool, medan dess StoreCLI RAID-insamling kan övervaka maskinvaru-RAID-adaptrar, fysiska enheter och reservbatterier.

Den bredden ger Netdata en fördel jämfört med snävt fokuserade SMART-instrumentpaneler.

MD RAID
SMART
ZFS
Maskinvaru-RAID
Filsystem
CPU
RAM-minne
Nätverk
Behållare
     |
  Netdata
     |
En instrumentpanel

En enskild Netdata-agent kan köras självständigt och exponera sin lokala instrumentpanel på port 19999. Molnanslutning är valfri för själva övervakningsagenten, även om Netdata Cloud ger centraliserade vyer och ytterligare funktioner för flera noder.

Detta gör Netdata särskilt användbart på en hemmaserver där lagringsövervakning bör finnas bredvid systembelastning, RAM-användning, filsystemets kapacitet, Docker-aktivitet och nätverksprestanda.

Bäst för: användare som vill ha en enda instrumentpanel som täcker RAID och resten av servern.

Avvägning: Netdata är brett snarare än överdrivet diskfokuserat. Scrutiny ger en renare överblick när målet är att studera SMART-attribut och långsiktig försämring av fysiska enheter.

2. Scrutiny – bäst för att upptäcka trender i diskhälsan

Scrutiny är ett av de mest användbara tilläggen till en hem-NAS eftersom det löser flera svagheter hos rå SMART-övervakning.

SMART visar ett stort antal attribut, men alla attribut är inte lika användbara. Tillverkarens tröskelvärden kan också vara tillräckligt konservativa för att en enhet ska verka ”frisk” tills ett fel är relativt nära.

Scrutiny kombinerar SMART-data med ett webbaserat gränssnitt, lagring av historiska trender, temperaturspårning och ytterligare tröskelvärden baserade på verkliga data om diskfel.

Det gör det möjligt att ställa frågor som:

Aktuella väntande sektorer

Januari       0
Mars         0
Juni          2
Augusti        8

En enda aktuell SMART-rapport visar att värdet är åtta. Scrutiny visar att mätvärdet har utvecklats i fel riktning.

Det stöder också konfigurerbara aviseringar via e-post, webhooks, ntfy, Gotify, Slack, Discord, Telegram och andra tjänster.

Stödet för RAID-styrenheter beror på om smartctl kan nå de underliggande fysiska enheterna. Scrutiny dokumenterar därför stöd för passthrough via styrenheter och enhetsmappning i Docker.

Den viktiga begränsningen är lika tydlig:

Scrutiny övervakar enheter, inte själva RAID-arrayen.

En Linux MD-array bör fortfarande övervakas med mdadm eller ett annat arraymedvetet lager. En ZFS-pool bör fortfarande ha ZFS-specifik övervakning.

Bäst för: hemmaservrar med flera HDD- eller SSD-enheter där historiska SMART- och temperaturtrender är viktiga.

Avvägning: missta inte en rad friska diskar i Scrutiny för ett bevis på att RAID-arrayen är frisk.

Lagringshälsolagret är också beroende av själva enheterna. Genom att välja lämpliga NAS-enheter minskar du problem som kan undvikas under återuppbyggnader och kontinuerlig drift dygnet runt.

3. smartmontools – bästa grunden för övervakning av HDD, SSD och NVMe

GitHub – smartmontools/smartmontools: 2025-06-01: Detta är nu det officiella uppströmsarkivet för smartmontools · GitHub

smartmontools är betydligt mindre visuellt imponerande än Scrutiny, men mer grundläggande.

Projektet tillhandahåller två kärnverktyg:

smartctl
   |
Granska och testa en enhet

smartd
   |
Övervaka enheter kontinuerligt

smartctl kan granska SMART- och hälsoinformation från ATA/SATA-, SCSI/SAS- och NVMe-enheter samt utlösa självtester av enheter. smartd körs som en daemon och kontrollerar kontinuerligt enheter efter konfigurerade hälsotillstånd.

Många övervakningsprodukter på högre nivå är i slutändan beroende av dessa data. Netdatas SMART-insamlare kräver smartmontools, Scrutiny bygger sitt lager för diskhälsa kring smartctl-data och Prometheus-exportörer för smartctl använder samma gränssnitt.

Projektet utvecklas fortfarande. Den aktuella ändringsloggen uppströms anger smartmontools 8.0 som nästa ännu ej släppta generation efter 7.5.

För en lättviktig hemmaserver kan smartd vara allt som behövs:

Enhet
  |
SMART
  |
smartd
  |
Avisering

Du behöver inte nödvändigtvis en separat databas, kontrollpanel och mätvärdesstack för att upptäcka att en enhet har passerat ett viktigt tröskelvärde.

Bäst för: användare som vill ha en lättviktig, mogen grund för fysisk enhetshälsa och automatiserade tester.

Avvägning: utdata från kommandoraden är mindre lättillgängliga än i Scrutiny eller Cockpit, och smartd ger i sig inte samma visuella historiska analys.

4. mdadm Monitor — bästa inbyggda övervakningen för Linux-programvaru-RAID

Övervakning av MDADM RAID-arrayer med Cacti och SNMP · Matt Dyson

Om arrayen är Linux MD RAID bör mdadm fortfarande ingå i övervakningsplanen även om Netdata eller en annan kontrollpanel är installerad.

mdadm --monitor förstår själva arrayen.

Det kan rapportera händelser som:

  • enhetsfel;
  • degraderade arrayer;
  • aktivering av reservdisk;
  • enhet försvinner;
  • start av återuppbyggnad;
  • återuppbyggnadens förlopp;
  • slutförd återuppbyggnad.

Det täcker luckan som SMART lämnar efter sig:

smartd
  |
Är enheterna felfria?

mdadm --monitor
  |
är RAID-arrayen felfri?

För en minimal Linux-hems

Bäst för: Debian, Ubuntu och andra Linux-servrar byggda kring MD RAID 1, 5, 6 eller 10.

Avvägning: mdadm fokuserar på Linux-programvaru-RAID snarare än ZFS, maskinvaru-RAID eller grafisk långtidsanalys.

5. OpenZFS ZED — bästa inbyggda händelseövervakningen för ZFS-pooler

byt namn till zed-binärfilen till zfs-zed · Ärende #17351 · openzfs/zfs

ZFS-användare bör övervaka ZFS som ZFS i stället för att försöka mappa varje händelse till traditionell RAID-terminologi.

ZED, ZFS Event Daemon, övervakar händelser som genereras av ZFS-kärnmodulen och kör konfigurerade ZEDLET-åtgärder när matchande händelseklasser uppstår.

Övervakningssambandet blir:

ZFS-kärna
    |
  zevents
    |
   ZED
    |
ZEDLET-åtgärder
    |
Aviseringar / automatisering

Detta gör ZED lämpligt för pool- och enhetshändelser som hör till själva ZFS, snarare än till en extern diskpanel.

En komplett ZFS-stack för en hemmaserver kan därför innehålla:

ZED
 |
Poolhändelser

smartd / Scrutiny
 |
Fysisk diskhälsa

Netdata / Grafana
 |
Instrumentpanel och historik

Bäst för: TrueNAS-, OpenZFS- eller Linux-/BSD-ZFS-användare som vill ha inbyggd händelsehantering kring sina pooler.

Avvägning: ZED är en händelsedemon, inte en polerad allt-i-ett-instrumentpanel. Kombinera den med ett annat lager om visualisering över lång tid är viktig.

6. Cockpit Storage — bäst för RAID-övervakning i grafiskt gränssnitt för Linux-nybörjare

GitHub – 45Drives/cockpit-hardware: En Cockpit-modul för 45Drives-lagringsservrar · GitHub

Cockpit är ett av de enklaste sätten att lägga till ett webbläsarbaserat administrationsgränssnitt på en vanlig Linux-server.

Lagringsprogrammet har stöd för lokala diskar, partitioner, RAID, kryptering, NFS, iSCSI och andra vanliga lagringsåtgärder.

Cockpit har också lagt till information om SMART-enheternas hälsa på lagringssidan, inklusive möjligheten att köra självtester av diskar från webbläsaren.

Det gör det till ett starkt nybörjaralternativ för en server som annars ser ut så här:

Ubuntu / Debian / Fedora
          |
       Cockpit
          |
 Lagringsgränssnitt i webbläsaren
          |
 RAID + SMART + monteringar

Det är särskilt användbart när användaren vill hantera lagring i stället för att bygga en dedikerad observabilitetsstack.

Bäst för: Linux-nybörjare som vill se RAID- och diskstatus i ett rent gränssnitt för serveradministration.

Avvägning: Cockpit är bättre på att visa och hantera serverns aktuella tillstånd än på att lagra detaljerad SMART-historik i månader.

7. Prometheus + smartctl_exporter + Grafana — bäst för mätvärden över lång tid

smartctl JSON-nycklarna är alla fel · Issue #42 · prometheus-community/smartctl_exporter

När övervakning blir ett eget fritidsintresse ger Prometheus-stacken dig mycket mer kontroll än en specialbyggd NAS-instrumentpanel.

Den officiella smartctl_exporter konverterar smartctl-statistik till Prometheus-mätvärden. Det kräver smartmontools 7.0 eller senare eftersom det är beroende av smartctls JSON-utdata.

Arkitekturen är modulär:

SMART-/RAID-/ZFS-exportörer
           |
       Prometheus
           |
         Grafana
           |
 Instrumentpaneler + aviseringar

Ytterligare exporters eller nodmätvärden kan lägga till:

  • filsystemskapacitet;
  • disk-I/O;
  • ZFS-pooler;
  • MD RAID-status;
  • temperatur;
  • serverbelastning;
  • UPS-mätvärden;
  • nätverksaktivitet.

Det här är det bästa alternativet när du vill besvara historiska frågor i stället för att bara kontrollera aktuell status.

Till exempel:

  • Ökade disktemperaturen under den senaste RAID-återuppbyggnaden?
  • När uppträdde okorrigerbara fel för första gången?
  • Förändrades lagringsfördröjningen efter att ytterligare en disk lades till?
  • Hur snabbt har poolens utnyttjandegrad ökat under det senaste året?

Grafana Alerting kan också utvärdera Prometheus-baserade regler och skicka aviseringar när villkoren är uppfyllda.

Bäst för: entusiaster som vill ha långsiktiga mätvärden, anpassade instrumentpaneler, korrelation och flexibla larm.

Avvägning: Prometheus + exporters + Grafana kräver betydligt mer konfiguration än Scrutiny eller Netdata. För en enkel NAS i hemmet kan den komplexiteten ge liten praktisk nytta.

8. Checkmk – bäst för övervakning av flera hemservrar

Övervakning av Kubernetes

Checkmk blir mer attraktivt när hemmalabbet innehåller mer än en maskin.

I stället för att bara tänka på en NAS kan du ha:

NAS
Säkerhetskopieringsserver
Proxmox-värd
Mini-PC
Router
UPS
Switch
     |
   Checkmk

Checkmk Linux-agenten stöder maskinvaruövervakning via insticksprogram, inklusive SMART-värden från moderna HDD- och SSD-enheter.

Dokumentationen tar också uttryckligen hänsyn till diskar som döljs bakom RAID-styrenheter som stöds. Beroende på styrenheten kan verktyg som smartmontools, tw_clieller MegaRAID-verktyg kan krävas innan Checkmk får åtkomst till den underliggande enhetsinformationen.

Den större fördelen är centraliserad drift: flera värdar, tjänstestatus, larmregler, diagram, inventering, kapacitet och systemövervakning kan alla finnas i ett enda gränssnitt.

Bäst för: hemmalabb där lagringshälsan behöver övervakas tillsammans med flera Linux-servrar och infrastrukturenheter.

Avvägning: Checkmk är onödigt omständligt för en enda NAS om Netdata eller operativsystemets inbyggda övervakning redan täcker de viktiga felsignalerna.

9. StorCLI – bäst för LSI- och Broadcom-maskinvaru-RAID

Installera Avago LSI StorCLI i VMware ESXi – Virtualization Howto

Maskinvaru-RAID kräver ett annat sätt att tänka kring övervakning, eftersom operativsystemet kan se en enda virtuell disk medan styrenheten hanterar flera fysiska diskar under den.

Operativsystem
      |
 Virtuell enhet
      |
 RAID-styrenhet
      |
+-----+-----+-----+
Disk 1   Disk 2  Disk 3

StorCLI är Broadcoms kommandoradsverktyg för administration av RAID-styrenheter från LSI/Broadcom som stöds.

Det kan granska styrenhetstillstånd, virtuella diskar, fysiska diskar, återuppbyggnadsåtgärder, kapslingsinformation, cache samt batteri- eller reservströmskomponenter som stöds.

Status för maskinvaru-RAID kan omfatta tillstånd som:

  • Optimal;
  • Delvis degraderad;
  • Degraderad;
  • Offline.

Den insynen på styrenhetsnivå är avgörande eftersom generiska SMART-verktyg kanske inte automatiskt kan upptäcka medlemsdiskar via alla RAID-styrenheter.

En användbar övervakningskombination är:

Broadcom-/LSI-RAID
        |
      StorCLI
        |
     Netdata
        |
Instrumentpanel + larm

Netdatas StoreCLI-insamlare kan hämta styrenhetsinformation och visa den tillsammans med resten av servermåtten.

Bäst för: hemmaservrar som använder maskinvarustyrenheter från Broadcom, LSI eller MegaRAID som stöds.

Avvägning: StorCLI är ett styrenhetsspecifikt administrationsverktyg snarare än en universell instrumentpanel för hemmaservrar.

10. Zabbix — Bäst för avancerad RAID-larmhantering och automatisering

Övervaka en komplex infrastrukturtmiljö med Zabbix – Zabbix-bloggen

Zabbix är det mest infrastruktursorienterade alternativet i den här listan.

De aktuella Agent 2-mallarna innehåller officiell SMART-övervakning, medan array- och styrenhetstillstånd kan läggas till via integreringar, anpassade objekt, skript eller mallar som passar miljön.

En större Zabbix-installation kan kombinera:

SMART
RAID
ZFS
Filsystem
UPS
Temperatur
Nätverk
Tjänster
     |
   Zabbix
     |
Historik
Utlösare
Aviseringar
Eskalering

Styrkan ligger inte i en specialbyggd RAID-vy, utan i möjligheten att exakt definiera vad som utgör ett fel och vad som ska hända därefter.

Ett varningsmeddelande kan till exempel skickas till en vanlig aviseringskanal, medan en degraderad array eller en virtuell disk som är offline utlöser en mer brådskande eskalering.

Bäst för: avancerade användare som redan kör Zabbix eller vill ha detaljerade larmregler och automatisering för flera system.

Avvägning: installationskomplexiteten är hög. Att installera Zabbix enbart för att övervaka två diskar i en NAS hemma är vanligtvis onödigt.

Vilket RAID-övervakningsverktyg bör du faktiskt använda?

Om du vill... Börja med Varför
En instrumentpanel för en hemmaserver Netdata Omfattar MD RAID, SMART, ZFS, hårdvaru-RAID och systemmått
Detaljerad historik över diskhälsa Scrutiny Fokuserar på SMART-trender, temperatur, gränsvärden och aviseringar
Lättviktsövervakning av diskar smartmontools Mogna kommandoradsverktyg utan en omfattande övervakningsstack
Händelser för Linux-programvaru-RAID mdadm Monitor Förstår fel i MD-arrayer, återuppbyggnader och degraderade tillstånd
ZFS-poolhändelser OpenZFS ZED Inbyggd händelsedemon för ZFS
Ett enkelt grafiskt Linux-gränssnitt för lagring Cockpit RAID-hantering och SMART-status i webbläsaren
Långsiktiga anpassade instrumentpaneler Prometheus + Grafana Flexibla mätvärden, historik, korrelation och aviseringar
Flera hemservrar Checkmk Centraliserar övervakning av värdar, tjänster, diskar och infrastruktur
LSI/Broadcom-maskinvaru-RAID StorCLI Läser av tillståndet för styrenhet, virtuella enheter och fysiska enheter direkt
Komplex automatisering av aviseringar Zabbix Flexibla utlösare, mallar, historik och eskalering

RAID-hälsa kontra SMART-hälsa: De är inte samma sak

Den här skillnaden är viktigare än valet mellan de flesta verktygen i rangordningen.

Signal Vad det berättar Vad det inte berättar
RAID felfri Arrayen har för närvarande de medlemmar som krävs Alla enheter förblir felfria
RAID degraderad Redundans eller förväntat medlemskap har gått förlorat Den exakta fysiska orsaken i varje fall
SMART GODKÄND Enheten har inte passerat sitt SMART-feltillstånd Att alla attribut är optimala
Väntande sektorer Sektorer väntar på lyckad omläsning eller ommappning RAID-arrayens fullständiga hälsotillstånd
Omallokerade sektorer Enheten har mappat om oanvändbara sektorer Om arrayen fortfarande har redundans
Temperatur Aktuella eller historiska temperaturförhållanden Om filsystemet är konsekvent
Återuppbyggnadens förlopp Hur långt återställningen av redundansen har kommit Om gamla säkerhetskopior kan återställas
ZFS-kontrollsummefel ZFS upptäckte integritetsproblem Varje underliggande mekaniskt felläge

Ett användbart exempel är:

mdadm:
Arrayen är felfri

Scrutiny:
Disk 3
Aktuellt väntande sektorantal = 0 → 2 → 8

Arrayen har ännu inte havererat, men historiken för den fysiska enheten ger dig anledning att undersöka saken.

Motsatsen kan också inträffa:

mdadm:
Arrayen är degraderad

smartctl:
Disk 1 GODKÄND
Disk 2 GODKÄND
Disk 3 GODKÄND

Den saknade medlemmen kan ha försvunnit på grund av kablage, strömförsörjning, styrenhetsproblem, enhetsidentifiering eller ett annat fel som inte representeras av ett SMART-tröskelvärde för fel.

Övervakning av mdadm kontra ZFS kontra maskinvaru-RAID

Rätt övervakningsverktyg beror delvis på var RAID-logiken finns.

Lagringsarkitektur Inbyggd övervakning Användbart andra lager
Linux MD-RAID mdadm Scrutiny / Netdata
OpenZFS ZED / zpool Scrutiny / Netdata / Grafana
LSI/Broadcom-maskinvaru-RAID StorCLI Netdata / Checkmk
RAID i NAS-enheten Inbyggd övervakning i NAS-operativsystemet SMART-/historikverktyg när det stöds

Därför påverkar lagringslayouten övervakningsarkitekturen. Programvaru-RAID, ZFS och maskinvaru-RAID exponerar olika tillstånd genom olika kontrollager.

Scrutiny kontra Netdata: Vilket ska du installera?

De fungerar bättre tillsammans än var för sig.

Område Scrutiny Netdata
Huvudfokus Hälsa hos fysiska diskar Övervakning av hela servern
SMART-historik Utmärkt Tillgängligt som mätvärden
Temperaturtrender Utmärkt Ja
MD RAID-status Nej Ja
ZFS-poolens status Nej Ja
Maskinvaru-RAID Beroende av SMART-genomströmning StoreCLI-insamlare
CPU/RAM/nätverk Nej Ja
Bästa användningsområde Diskverktyg Serverinstrumentpanel

En enkel kombination för en hemserver är därför:

Netdata
  |
Array- och serverhälsa

Scrutiny
  |
Trender för fysiska diskar

Om du bara vill ha en enda applikation täcker Netdata fler lager.

Om NAS-operativsystemet redan övervakar arrayens hälsa på ett bra sätt kan Scrutiny tillföra mer ny information, eftersom det ger de fysiska diskarna en bättre historisk överblick.

Behöver du Prometheus och Grafana för en hem-NAS?

Vanligtvis inte.

Om det enda kravet är:

Meddela mig när RAID är degraderat
Meddela mig när en disk håller på att gå sönder

inbyggda arrayvarningar tillsammans med smartd, Scrutiny eller Netdata kan lösa problemet med betydligt mindre infrastruktur.

Prometheus och Grafana börjar bli meningsfulla när du bryr dig om:

  • historik över månader eller år;
  • flera servrar;
  • anpassade instrumentpaneler;
  • korrelering av temperatur med I/O;
  • spårning av lagringstillväxt;
  • kombinering av RAID med UPS-, nätverks-, Docker- och värdstatistik;
  • anpassade PromQL-varningsregler.

Det felaktiga skälet att installera Grafana är helt enkelt att instrumentpanelen ser imponerande ut.

Det rätta skälet är att du har frågor som kräver historik över tid.

Vilka RAID-varningar bör du konfigurera?

Övervakning blir användbar först när något kan nå dig utan att du behöver öppna instrumentpanelen först.

Arrayvarningar

  • arrayen är degraderad;
  • arrayen är offline;
  • oväntad medlem saknas;
  • reservdisken aktiverades;
  • återuppbyggnad eller omsynkronisering startade;
  • återuppbyggnaden misslyckades;
  • återuppbyggnaden slutfördes.

Varningar för fysiska diskar

  • SMART:s övergripande hälsostatus visar fel;
  • antalet väntande sektorer ökar;
  • antalet okorrigerbara offline-sektorer ökar;
  • antalet omallokerade sektorer ökar betydligt;
  • kritisk NVMe-varning;
  • SSD:ns uthållighet eller slitage närmar sig bytesnivån;
  • disktemperaturen ligger kvar utanför det förväntade intervallet.

ZFS-varningar

  • poolen är degraderad;
  • enhetsfel;
  • kontrollsummefel ökar;
  • scrub upptäcker fel;
  • resilvering startar eller misslyckas;
  • poolens kapacitet närmar sig den valda tröskeln.

Varningar för maskinvaru-RAID

  • den fysiska disken har gått sönder;
  • den virtuella disken är degraderad;
  • den virtuella disken är offline;
  • återuppbyggnaden har stannat eller misslyckats;
  • fel på styrenhetens cache eller reservbatteri.

De exakta temperatur- och SMART-trösklarna bör inte kopieras blint från en annan server. Olika diskmodeller visar olika attribut och har olika driftsintervall.

Principen är viktigare:

En instrumentpanel som du aldrig öppnar är inte övervakning.

SMART-test kontra scrub kontra återuppbyggnad: tre olika uppgifter

De här åtgärderna blandas ofta ihop, men de granskar olika saker.

SMART-självtest

Ett SMART-självtest utförs av en enskild lagringsenhet.

En enhet
   |
SMART-test
   |
Resultat på enhetsnivå

Ett långt SMART-test kan skanna en större del av diskyta än ett kort test, men det verifierar inte RAID:s paritet eller ZFS-kopior av data i hela lagringssystemet.

RAID-ombyggnad eller omsynkronisering

En ombyggnad återställer redundansen efter att en medlem har gått sönder eller ersatts.

Degraderad RAID
     |
Ersättningsenhet
     |
Ombyggnad / omsynkronisering
     |
Redundans återställd

Det är en återställningsåtgärd, inte ett test av diskens hälsa.

ZFS-scrubbing eller RAID-konsistenskontroll

En scrubbing- eller konsistenskontroll verifierar data och redundansrelationer som redan finns.

Det besvarar en annan fråga:

> Matchar de lagrade data fortfarande den integritets- och redundansinformation som lagringssystemet förväntar sig?

Det är därför övervakningen bör visa alla tre när lagringsarkitekturen stöder dem.

Aktivera inbyggda NAS-aviseringar innan du installerar en till instrumentpanel

Ett dedikerat NAS-operativsystem kan redan tillhandahålla det första övervakningslagret du behöver.

I ZimaOS aktuella lagringshantering visas till exempel arrayens status, enheternas hälsa, användbar kapacitet samt läs- och skrivhastigheter under Inställningar > Lagring. En RAID-medlem som har gått sönder ändrar arrayens status till degraderad, och återställningsarbetsflödet vägleder användaren genom ombyggnaden efter att enheten har ersatts.

ZimaOS visar också förloppet för långvariga RAID- och paritetskontroller samt detaljerad information om diskarnas hälsa i sitt lagringsgränssnitt.

Den praktiska ordningen bör därför vara:

1. Aktivera inbyggda NAS-aviseringar
        |
2. Bekräfta identifiering av degraderade arrayer
        |
3. Lägg till historik för fysiska enheter
        |
4. Lägg till en större observabilitetsstack endast om det är användbart

TrueNAS, Unraid, Synology, QNAP och andra NAS-plattformar har på liknande sätt inbyggda funktioner för lagringsövervakning som bör konfigureras innan ett andra övervakningssystem läggs till.

Det extra lagret bör besvara en fråga som det inbyggda gränssnittet inte besvarar särskilt väl.

RAID-övervakning ersätter inte säkerhetskopiering

En perfekt avisering kan tala om inom några sekunder att en disk har gått sönder.

Det kan inte återställa gårdagens version av en borttagen mapp.

Det kan inte återställa filer som redan har krypterats av ransomware.

Det kan inte återskapa NAS-enheten efter stöld, brand eller ett katastrofalt fel på styrenheten.

Därför är RAID inte en säkerhetskopia.

RAID
  |
Tillgänglighet efter att vissa enheter har gått sönder

Övervakning
  |
Upptäck problem snabbt

Säkerhetskopiering
  |
Återställ förlorade eller skadade data

Alla tre löser olika delar av tillförlitlighetsproblemet.

Övervakning blir särskilt viktig under ombyggnader, eftersom de återstående enheterna kan utsättas för långvarig aktivitet samtidigt som redundansen är reducerad. Ett oväntat strömavbrott under den perioden innebär ytterligare en risk, och därför är UPS-skydd under lagringsåtgärder viktigt oberoende av övervakningen av enheternas hälsa.

Rekommenderade stackar för RAID-övervakning

Enkel Linux RAID-server

mdadm --monitor
       +
     smartd

Detta är det lättviktiga alternativet.

mdadm övervakar Linux-arrayen. smartd övervakar diskarna. Inget av dem kräver en tung webbaserad plattform.

Enkel hem-NAS

Inbyggd NAS-övervakning
         +
      Scrutiny

NAS-gränssnittet hanterar arraystatus och återuppbyggnader, medan Scrutiny tillför historik och aviseringar om enheternas hälsa.

Allmän Linux-hemserver

Netdata
   +
Scrutiny

Netdata övervakar arrayen och hela servern. Scrutiny ger djupare historik för fysiska enheter.

ZFS-hemserver

ZED
 +
Scrutiny
 +
Netdata

ZED hanterar inbyggda ZFS-händelser, Scrutiny bevakar enhetstrender och Netdata ger systemet en bredare instrumentpanel.

Avancerat homelab

smartctl_exporter
MD- / ZFS-exportörer
node_exporter
      |
  Prometheus
      |
   Grafana
      |
Aviseringar

Detta passar när historik för mätvärden och flera servrar är tillräckligt viktigt för att motivera underhåll av en komplett observabilitetsstack.

Server med maskinvaru-RAID

StorCLI
   |
Netdata / Checkmk
   |
Aviseringar + instrumentpanel

Styrenhetens verktyg är fortfarande den tillförlitliga källan för maskinvaru-RAID-lagret, medan övervakningsplattformen gör dess status synlig och användbar.

Slutligt omdöme

Netdata är det bästa övergripande verktyget för RAID-övervakning för de flesta hemservrar eftersom det kan ligga ovanpå flera lagringsarkitekturer och samtidigt övervaka själva värden.

Scrutiny är det starkaste kompletterande verktyget när historik för enskilda enheter är viktig. Det är särskilt användbart för att upptäcka långsamma förändringar i SMART-attribut innan arrayen själv når ett degraderat tillstånd.

smartmontools är fortfarande det grundläggande lagret för diskhälsa, medan mdadm Monitor fortfarande är ett av de renaste alternativen för Linux-programvaru-RAID.

OpenZFS ZED bör även fortsättningsvis ingå i en ZFS-inbyggd övervakningsstrategi i stället för att försöka ersätta poolhändelser med generiska SMART-data.

Cockpit är det enklaste grafiska alternativet för en vanlig Linux-server, medan Prometheus och Grafana passar bättre när långsiktiga mätvärden blir ett verkligt krav.

Checkmk och Zabbix blir mer värdefulla när antalet övervakade system växer, och StorCLI är oumbärligt när RAID-logiken finns i maskinvara från LSI/Broadcom som stöds.

Den mest tillförlitliga strategin för en hemserver är därför skiktad:

Arraystatus
     +
Enhetens hälsa
     +
Återställningsstatus
     +
Aviseringar
     +
Historik

RAID brukar fallera i flera lager, så övervakningen bör också vara skiktad.

Vanliga frågor

Vilket är det bästa verktyget för RAID-övervakning på en hemserver?

Netdata är ett av de bästa alternativen överlag eftersom det kan övervaka Linux MD RAID, SMART-enheter, ZFS-pooler, maskinvaru-RAID som stöds och resten av servern från ett och samma gränssnitt. Scrutiny är ett starkare specialistverktyg när detaljerad SMART-historik för fysiska enheter är prioriterad.

Är Scrutiny ett verktyg för RAID-övervakning?

Scrutiny övervakar de fysiska enheterna under en RAID-array via SMART-data. Det ersätter inte övervakning på arraynivå, till exempel mdadm för Linux MD RAID, ZED för ZFS-händelser eller StorCLI för maskinvaru-RAID-kontroller som stöds.

Kan SMART visa PASSED trots att en enhet håller på att gå sönder?

SMART PASSED betyder att enheten inte har överskridit sitt övergripande SMART-villkor för fel. Enskilda attribut kan fortfarande förändras på oroande sätt innan statusen växlar till failed. Historisk övervakning är användbar eftersom den synliggör sådana trender.

Vilket är det bästa sättet att övervaka mdadm-RAID?

Använd mdadm:s övervakningsläge för arrayhändelser och kombinera det med smartmontools eller Scrutiny för de fysiska enheternas hälsa. Netdata kan ge ytterligare ett grafiskt lager för övervakning av MD RAID och servern.

Vilket är det bästa sättet att övervaka en ZFS-pool?

Använd ZFS-inbyggda verktyg som ZED och zpool för poolhändelser och tillstånd. Lägg till smartmontools eller Scrutiny för hälsan hos enskilda enheter, samt Netdata, Prometheus eller Grafana när historisk visualisering behövs.

Upptäcker RAID-övervakning en hårddisk som håller på att gå sönder innan den havererar?

Enbart array-övervakning kanske inte räcker. SMART-baserade verktyg kan visa förändringar i enheternas hälsoparametrar innan arrayen förlorar en medlem, även om inget övervakningssystem kan förutsäga alla enhetsfel på ett tillförlitligt sätt.

Bör jag använda Netdata eller Scrutiny?

Använd Netdata när du vill ha en enda instrumentpanel för hela servern som täcker RAID, lagring, CPU, RAM, nätverk och tjänster. Använd Scrutiny när detaljerade SMART-trender och historik över enheternas hälsa är viktigast. Det kan vara användbart att köra båda, eftersom de täcker olika lager.

Behöver jag Grafana för att övervaka RAID?

Nej. Grafana är användbart för långsiktiga mätvärden, anpassade instrumentpaneler, flera system och korrelation. En enkel NAS-enhet hemma kan ofta övervakas tillräckligt med sina inbyggda aviseringar samt smartmontools, Scrutiny eller Netdata.

Vilka aviseringar bör en RAID-server skicka?

Konfigurera åtminstone aviseringar för degraderade eller offline-arrayer, saknade medlemmar, misslyckade ombyggnader, SMART-hälsofel, viktiga förändringar i SMART-attribut, höga enhetstemperaturer, ZFS-fel samt fel i hårdvaru-RAID-kontroller eller cache, där det är relevant.

Är en RAID-scrub samma sak som ett SMART-test?

Nej. Ett SMART-test körs på en enskild enhet. En scrub- eller konsistenskontroll validerar data och redundans på lagringssystemnivå. En ombyggnad återställer redundansen efter ett diskfel eller byte av disk.

Ersätter RAID-övervakning säkerhetskopiering?

Nej. Övervakning hjälper till att upptäcka fel snabbt, och RAID kan upprätthålla tillgängligheten efter vissa enhetsfel. Inget av detta återställer raderade, krypterade eller skadade filer, eller filer som har ändrats över tid. En separat säkerhetskopia behövs fortfarande.

Bör jag övervaka SSD:er och NVMe-enheter i RAID?

Ja. SSD:er och NVMe-enheter visar hälsoinformation som kritiska varningar, temperatur, mediefel samt uthållighet eller slitage. De exakta attributen skiljer sig från HDD:ers SMART-data, så övervakningsverktyget behöver ha stöd för rätt enhetstyp.

Produktjämförelser

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.