Hur man avgör om en borttagen RAID-disk eller en trasig enhetsplats är den verkliga orsaken

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

En borttagen RAID-medlem betyder inte automatiskt att disken har gått sönder. Den verkliga orsaken är den komponent som felet följer efter kontrollerade tester och ett strömlöst byte.

Börja med att bevara arrayens status, registrera diskens serienummer och fack, jämföra SMART-medieattribut med anslutningsfel och läsa kontrollerloggarna. Byt sedan bara en hårdvaruvariabel i taget. Denna metod hjälper dig att undvika att byta ut en frisk disk eller återuppbygga via ett felaktigt fack.

Stanna upp innan du återuppbygger eller drar ut en annan disk

En degraderad array har mindre utrymme för ytterligare misstag eller fel. Bekräfta att oersättliga data finns på en läsbar separat backup, spara aktuell lagringsstatus och minska undvikbara skrivningar innan du byter hårdvara.

Ta skärmdumpar eller exportera RAID-status, lista över fysiska diskar, SMART-rapporter och kontrollerhändelser. Registrera larmtid, påverkad logisk medlem, rapporterat fack, modell, serienummer och eventuella media-, timeout-, återställnings- eller återanslutningsräknare. Rensa inte räknare förrän bevisen är sparade utanför arrayen.

Starta inte en återuppbyggnad bara för att se om disken faller bort igen. En återuppbyggnad ökar den kontinuerliga I/O-belastningen på de överlevande medlemmarna och kan dölja om det första problemet kom från disken, dess anslutningsväg eller en delad kontrollerkomponent.

Matcha larmet med en fysisk enhet, inte bara ett facknummer

RAID-programvara kan visa ett operativsystemets enhetsnamn, kontrollerslot, chassiadress eller virtuellt medlemsnummer. Dessa etiketter är inte alltid permanenta, så den säkraste identiteten är diskens serienummer eller WWN kopplat till det fysiska facket.

En praktisk felsökningsguide rekommenderar att du registrerar enhetens serienummer eftersom enhetsidentifierare kan ändras. Skapa en liten karta som innehåller RAID-medlem, OS-enhet, serienummer eller WWN, fack, kontrollerport och tidpunkt för larmet.

Använd en lokalisering-LED endast som en bekräftelsehjälp. Innan du tar bort något, jämför det visade serienumret med etiketten på facket eller enheten. Att dra ut fel frisk medlem kan förvandla en återhämtningsbar degraderad array till ett flerdiskfel.

Separera lagringsmediafel från länkkopplingsfel

Bevis från lagringsmedia pekar inåt, mot skivorna, flashminnet, läshuvuden eller drivkretsarna. Omdirigerade sektorer, rapporterade okorrigerbara fel, aktuella väntande sektorer och offline okorrigerbara sektorer är bland de fem SMART-indikatorerna som Backblaze använder när de avgör vilka hårddiskar som behöver undersökas.

Titta på förändringar över tid istället för att behandla varje icke-noll råvärde som ett avgörande. En stigande mediakontroll, upprepade läsfel på liknande platser eller ett misslyckat utökat självtest gör disken själv mer misstänkt. En övergripande SMART-status på ”passed” utesluter inte ett intermittent eller utvecklande fel.

Anslutningsbevis pekar utåt, mot vägen mellan disk och kontroller. UDMA CRC-fel räknar misslyckade överföringar på SATA-länken; en stigande räknare kan indikera en kabel, kontakt, backplane, kontrollergränssnitt eller diskens PCB-väg snarare än skadat media.

Använd loggar för att hitta det felande lagret.

SMART-data visar vad enheten registrerade, medan system- och kontrollloggar visar hur lagringsstacken förlorade kontakten. Separera medium- eller läsfel från kommandotidsgränser, länkrestart, enhetsborttagningar, återanslutningar, strömhändelser och kontrollåterställningar.

Ett enda serienummer som rapporterar mediafel oavsett var det är anslutet talar för ett diskfel. Flera diskar som faller bort från fack som delar en kabel, backplane-kontakt, HBA-portgrupp eller strömgren talar för en delad väg. Ett fel som bara uppträder vid tung I/O kan avslöja en marginal anslutning eller strömproblem som inaktiva kontroller missar.

Bygg en tidslinje istället för att läsa isolerade meddelanden. Matcha varje bortfall till samma serienummer, fack, arbetsbelastning och kontrollkanal. Den viktiga frågan är inte om en loggrad låter allvarlig; det är om samma komponent förblir gemensam över upprepade incidenter.

Sätt tillbaka vägen innan du byter fack.

Stoppa arrayen och stäng av strömmen om inte chassit och RAID-plattformen uttryckligen stöder den exakta hot-swap-åtgärd du planerar att utföra. Ett hot-swap-kompatibelt fack gör inte automatiskt positionsförflyttningar eller diagnostiska byten säkra medan arrayen är aktiv.

Sätt tillbaka enheten i dess hållare och inspektera sedan data- och strömvägen som betjänar facket. Beroende på systemet kan den vägen inkludera en SATA- eller SAS-kontakt, breakout-kabel, backplane-kontakt, HBA, RAID-kort, strömkabel och chassianslutning. Leta efter lös passning, skadade spärrar, skräp, böjda kontakter, kabelspänning eller en delad kontakt som betjänar flera påverkade fack.

Efter omplacering, registrera en ny baslinje för CRC, timeout och mediakontroller. Återskapa den ursprungliga arbetsbelastningen med en kontrollerad läsning eller normal servicelast innan du startar en återuppbyggnad. Om anslutningsräknarna slutar öka och disken fortfarande är närvarande kan den ursprungliga händelsen ha varit ett tillfälligt kontaktproblem.

Kör ett kontrollerat isoleringstest för enhet och fack

Det avgörande testet ändrar en variabel samtidigt som diskidentitet och arraysäkerhet bevaras. Anta inte att varje RAID-implementation kan acceptera medlemmar i olika platser. Kontrollera plattformens ersättnings- eller importbeteende först, håll seriekartan synlig och använd en avstängd procedur när du är osäker.

  1. Verifiera att säkerhetskopian och sparade diagnostikdata är läsbara.
  2. Märk den misstänkta disken, dess ursprungliga fack och den kända fungerande vägen du kommer att använda.
  3. Flytta den misstänkta disken till ett känt fungerande fack eller kabelväg, eller anslut den till en separat diagnostikstyrenhet utan att skriva till den.
  4. Testa det misstänkta facket med en reserv- eller känd fungerande disk endast när det kan göras utan att ansluta, initiera, formatera eller återskapa arrayen.
  5. Kör samma kontrollerade läsarbetsbelastning och jämför endast nya logghändelser och räknarökningar.

En oberoende SATA-länkåterställningsanalys använder samma princip: flytta samma disk till ett annat fack eller kabelväg och observera om felet följer enheten eller stannar kvar vid den ursprungliga anslutningen.

Tolka om felet följer disken eller stannar kvar med facket

Använd båda delarna av testet när det är möjligt. Att bara flytta den misstänkta disken kan visa att den går sönder på annan plats, men att testa det ursprungliga facket med en annan disk bekräftar om platsen eller den delade vägen kan reproducera problemet.

Observerat resultat Mest sannolika lager Nästa åtgärd
Den misstänkta disken går sönder i ett känt fungerande fack, medan en annan disk förblir stabil i det ursprungliga facket Diskmedia, enhetselektronik eller enhetsfirmware Avsluta icke-destruktiv diagnostik, byt sedan ut disken om felen upprepas eller det utökade testet misslyckas
Den misstänkta disken är stabil på annan plats, medan en annan disk går sönder i det ursprungliga facket Fackkontakt, hållarkontakt, kabel, backplane, styrenhetsport eller strömväg Sluta använda den vägen tills den delade hårdvaran är reparerad eller utbytt
Flera fack på samma kontakt eller HBA-grupp visar återställningar Delad kabel, backplane-kontakt, styrenhet, kylning eller strömfördelning Spåra den gemensamma komponenten och testa igen efter att ha bytt en del som delas
Inga fel återkommer efter omläggning, och alla nya räknare förblir stabila Tillfällig eller marginal anslutning Fortsätt övervaka under den arbetsbelastning som ursprungligen utlöste avbrottet
Disken visar mediefel och facket orsakar också länklfel med en annan enhet Mer än ett fel Tvinga inte fram en diagnos med en enda orsak; isolera disken och reparera vägen separat

Behandla inte en ren omstart som bevis. Upprepa observationen under en jämförbar arbetsbelastning och följ förändringar i räknare, inte bara totaler. Om mediafel följer serienumret, byt ut disken. Om länksfel fortfarande är kopplade till platsen eller kontaktgruppen, reparera den vägen innan du bygger om.

Välj rätt reparation och stoppvillkor

När bevisen följer disken, verifiera de andra arraymedlemmarna, byt ut den felande medlemmen via plattformens stödda arbetsflöde och övervaka återuppbyggnaden. Välj en kompatibel NAS-ersättningsdisk baserat på kapacitet, gränssnitt, arbetsbelastning och arraykrav snarare än bara märke.

När bevisen pekar på platsen, sätt inte in en ny disk i en väg som redan orsakar återställningar. Inaktivera platsen om plattformen tillåter, reparera eller byt sedan ut kassetten, kabeln, backplane, kontrollerkanalen, chassianslutningen eller strömgrenen som identifierats av isoleringstestet.

Stoppa och eskalera när flera medlemmar försvinner, arrayen blir oläsbar, fel uppstår under en återuppbyggnad, diskidentiteten är osäker eller ingen verifierad backup finns. Initiera inte, formatera inte, rensa inte främmande metadata och tvinga inte upprepade gånger in en medlem bara för att varningen ska försvinna.

Vanliga frågor

Kan en disk klara SMART och ändå vara orsaken?

Ja. SMART är användbart bevis, men inte en fullständig garanti. Intermittent elektronik, firmwarebeteende, kommandotidsgränser eller fel som inte representeras av en leverantörs attribut kan fortfarande göra en disk opålitlig. Kombinera SMART-trender med loggar, utökade tester och om felet följer serienumret.

Bevisar en icke-noll CRC-räknare att platsen är dålig?

Nej. Räknaren kan registrera en äldre kabel- eller anslutningshändelse och kan förbli icke-noll även efter att orsaken är åtgärdad. Det som är viktigt är om värdet ökar efter att ha satt tillbaka disken och om ökningen följer disken, kabelvägen, platsgruppen eller kontrollern.

Kan jag hot-swappa diskar bara för att diagnostisera platsen?

Endast när chassit, kontrollern, RAID-implementeringen och exakt åtgärd är dokumenterade som hot-swap-säkra. En säkrare allmän regel är att stoppa arrayen, stänga av, bevara serienummer-till-plats-kartan och undvika alla åtgärder som kan trigga initialisering eller en oavsiktlig återuppbyggnad.

Ska jag bygga om innan diagnosen är klar?

Inte när en delad kabel, backplane, kontroller eller strömproblem fortfarande är möjliga. En återuppbyggnad belastar den återstående vägen och kan orsaka att en annan medlem faller bort. Säkerställ en backup, identifiera det felande lagret, bekräfta de överlevande diskarna och bygg sedan om via en stabil anslutning.

Den verkliga orsaken är den komponent som återskapar felet under ett kontrollerat test. Följ serienumret, platsen, räknare och loggar – inte den första röda ikonen – och reparera det felande lagret innan du litar på en återuppbyggnad.

Support och tips

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.