Varför en RAID-återuppbyggnad startar om efter att en disk kopplas bort

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

En återuppbyggnad kan starta om efter att en annan disk kopplas bort eftersom arrayens betrodda medlemsuppsättning ändrats igen. Kontrollern kan kassera delvis framsteg och återskapa redundans från en ny konsistenspunk.

En kort frånkoppling är inte ofarlig under degraderad drift. Rätt svar är att identifiera vilken medlem med serienummer som försvann, bevara loggar, bekräfta att arrayen fortfarande har tillräckligt med giltiga kopior och sluta experimentera med kablar eller platser tills det nuvarande återhämtningsläget är förstått.

Den andra frånkopplingen skapar en ny återhämtningshändelse

En återuppbyggnad baseras på en specifik uppsättning källmedlemmar och en måldisk. Om en annan källa försvinner, även kortvarigt, kan arrayen inte längre anta att varje block som redan skrivits till målet matchar den aktuella levande uppsättningen. Skrivningar kan också ha fortsatt medan den medlemmen var frånvarande.

Kontroller hanterar detta olika. Vissa återupptar från en bitmap eller kontrollpunkt; andra startar en fullständig rekonstruktion. Diskussionen om återuppbyggnad efter återanslutning av en disk visar varför borttagning av en medlem ändrar fel-toleransstatus även när disken fortfarande innehåller det mesta av den gamla datan.

Smutsig metadata kan få en gammal medlem att se föråldrad ut

RAID-medlemmar lagrar normalt arraymetadata som identifierar deras roll och händelsehistorik. När en disk försvinner medan skrivningar fortsätter blir dess innehåll äldre än den aktiva arrayen. Att återansluta den gör inte att de missade skrivningarna försvinner, så kontrollern måste förena eller skriva över föråldrade områden.

Ett tillfälligt borttaget RAID-medlem kan kännas igen från dess metadata, men implementeringen avgör fortfarande om den kan återansluta direkt eller behöver synkronisering. Anta inte att återgång till samma plats bevarar förtroendet.

Varför framsteg kan återgå till noll

Procentandelen beskriver ofta den aktuella återhämtningspassagen, inte en permanent logg över alla block som någonsin kopierats. Om en källmedlem ändrar tillstånd, målet omfördelas eller styrenheten sätter ihop arrayen igen, kan den visade operationen starta om från noll även om vissa målblock redan matchar.

På mjukvaru-RAID kan en ny degraderad händelse kräva en fullständig resynkronisering. En dokumenterad andra fullständiga RAID1-återuppbyggnad visar att när en md-array går in i degraderat tillstånd kan den synkronisera hela medlemmen istället för att lita på ett tidigare delvis tillstånd.

Ta inte bort en annan disk för att testa teorin

Under en återuppbyggnad är varje kvarvarande källa en del av den enda vägen för att rekonstruera saknade data. Att ta bort en annan medlem för identifiering kan överskrida RAID-nivåns fel tolerans eller skapa konkurrerande versioner av data. Lokalisera diskar efter serienummer och chassimarkeringar, inte genom provborttagning.

Stoppa hot-swap-experiment tills arrayen antingen är frisk eller kopierad till säker lagring. Om en kabel eller plats misstänks, samla först in händelseloggen och planera en enda kontrollerad ändring med systemet i vila när hårdvaran inte uttryckligen stödjer online-service.

Kontrollera om återuppbyggnaden verkligen startade om

Jämför mer än procentandelen. Registrera operationsnamn, målets serienummer, antal källmedlemmar, händelse- eller generationsnummer, bearbetade block, aktuell hastighet och beräknad sluttid. En styrenhet kan byta från återuppbyggnad till paritetsinitiering, verifiering eller bakgrundskonsistenskontroll.

Fält Samma operation Ny återhämtningshändelse
Målets serienummer Oförändrad Annorlunda eller omklassificerad
Bearbetade block Fortsätter uppåt Återgår till början
Medlemsuppsättning Stabil En annan disk saknas eller har lagts till igen
Loggmeddelande Återuppta eller fortsätt Avbryt, starta om, sätt ihop igen, ny återuppbyggnad
Arraystatus Degraderad/återuppbyggnad Mer degraderad, främmande eller återhämtande

Om medlemsuppsättningen ändrades, behandla den nya procentandelen som en ny händelse. Om bara gränssnittet återställdes medan räknare fortsätter, kan det vara ett visningsproblem snarare än förlorad framsteg.

När en omstart är mindre viktig än en diskborttagning

En planerad omstart ogiltigförklarar inte nödvändigtvis en kontrollerstyrd ombyggnad. Många kontroller sparar tillräckligt med tillstånd för att säkert återuppta. Den allvarligare händelsen är att förlora en annan källdisk eller införa en främmande konfiguration under eller efter omstarten.

En omstart under en ombyggnad kan vara återställbar, men den säkra slutsatsen beror på kontrollerns status efter uppstart. Initiera eller importera aldrig en främmande konfiguration bara för att procenten återställts.

Vad man ska göra omedelbart

  1. Pausa icke nödvändiga skrivningar och fånga loggar för arrayen, chassit och operativsystemet.
  2. Kartlägg varje aktiv, saknad, ombyggande och reservmedlem till ett fysiskt serienummer.
  3. Bekräfta att RAID-nivån fortfarande har tillräckligt många giltiga källmedlemmar för att rekonstruera data.
  4. Kontrollera SMART och länkfelfrekvenser på disken som kopplades bort och dess anslutningsväg.
  5. Låt en stabil ombyggnad köras utan ytterligare kabel-, fack-, omstart- eller arbetsbelastningsexperiment.

Om en annan källa rapporterar oläsbara sektorer eller upprepade frånkopplingar, prioritera att kopiera oersättliga data eller avbilda medlemmar istället för att upprepade gånger tvinga fram en ombyggnad.

Vanliga frågor

Kommer återanslutning av samma disk alltid att starta ombyggnaden?

Nej. Vissa kontroller kan återansluta den eller återuppta från en bitmap. Andra betraktar medlemmen som föråldrad och startar synkronisering igen. Händelselogg och medlemsgenerationsdata avgör vilket fall som inträffade.

Betyder en återställningsprocent att den nya disken raderades igen?

Inte nödvändigtvis. Det kan betyda att kontrollern startade en ny passering eller ändrade operationstyp. Dra inte slutsatsen att data gått förlorade enbart baserat på procenten; inspektera målidentiteten och händelsemeddelandena.

Kan jag fortsätta använda appar under den omstartade ombyggnaden?

Lätt användning kan stödjas, men minska undvikbara skrivningar och latenskänsliga jobb. Arrayen har redan visat en andra anslutningshändelse, så stabilitet och dataskydd prioriteras framför normal genomströmning.

Det praktiska svaret

En ombyggnad startar om eftersom konsistensantagandena ändrades när en annan medlem kopplades bort. Stabiliser hårdvaruvägen, verifiera källuppsättningen och tillåt en obruten återställning istället för att testa arrayen medan den är degraderad.

Support och tips

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.