Mantieni circa il 20% di un pool ZFS libero come punto di partenza pratico. La familiare regola dell'80% di utilizzo è una misura precauzionale, non un precipizio: carico di lavoro, configurazione dei vdev, dimensione dei record, frammentazione e blocchi conservati dagli snapshot determinano quando le prestazioni peggiorano effettivamente.
Gli snapshot sono importanti perché i blocchi sovrascritti o eliminati non possono tornare nello spazio libero finché uno snapshot continua a farvi riferimento. Un pool può quindi sembrare stabile finché una grande riscrittura, una ricezione di replica o una pulizia non rivelano quanto poco spazio di lavoro rimanga. Questa distinzione determina il metodo di misurazione, il margine di sicurezza e la condizione di arresto. Questa distinzione determina il metodo di misurazione, il margine di sicurezza e la condizione di arresto.
Considera l'utilizzo dell'80% come soglia per intervenire tempestivamente
Con un utilizzo ridotto, ZFS ha più possibilità per allocare nuovi blocchi. Quando il pool si riempie, diventa più difficile trovare regioni libere e gli aggiornamenti copy-on-write possono richiedere più lavoro all'allocatore, soprattutto nei pool HDD frammentati.
Inizia a intervenire sulla capacità quando l'utilizzo si avvicina all'80%, invece di aspettare un evento di esaurimento dello spazio. Lo storage per macchine virtuali con molte scritture, i database e l'I/O casuale di piccole dimensioni richiedono più margine rispetto a un archivio composto principalmente da dati sequenziali.
Misura sia a livello di pool sia a livello di dataset. Quote e prenotazioni possono causare il blocco di un dataset anche quando il pool segnala spazio libero, mentre gli snapshot possono occupare spazio che i normali strumenti per directory non mostrano.
Monitora i segnali che rivelano una pressione reale
Tieni sotto controllo la capacità del pool, la frammentazione, la latenza di scrittura, l'andamento dello spazio libero, lo spazio utilizzato dagli snapshot e le dimensioni dei processi di replica o backup in attesa. Una singola percentuale non può descrivere tutti questi vincoli.
Confronta la latenza durante il carico di lavoro normale al 70%, all'80% e a livelli di utilizzo superiori, se puoi farlo in sicurezza. Il vero segnale di avvertimento è un aumento ripetibile della latenza o una riduzione del throughput sotto lo stesso carico.
Usa la tabella decisionale seguente per tradurre utilizzo e comportamento in azioni.
| Stato osservato | Valutazione | Prossima azione |
|---|---|---|
| Meno del 70% utilizzato; latenza stabile | Margine sano | Continua a monitorare l'andamento |
| Circa 80% utilizzato o latenza in aumento | Soglia di intervento | Elimina snapshot in sicurezza, sposta i dati o espandi il pool |
| Oltre il 90% utilizzato; allocazioni non riuscite | Critico | Arresta le scritture non essenziali e recupera spazio |
Recupera margine senza creare un secondo incidente
Elimina solo gli snapshot al di fuori del periodo di conservazione approvato e conferma che non siano necessari come basi per la replica. La rimozione di uno snapshot comune recente può imporre un nuovo invio completo, che richiede ancora più spazio.
Sposta i dati inattivi, espandi il pool con una topologia supportata o riduci le scritture in ingresso prima di eseguire attività di manutenzione intensive. Non avviare contemporaneamente uno scrub, un resilver, una ricezione di replica e un'eliminazione di massa su un pool quasi pieno.
La diagnostica dello spazio degli snapshot di ZimaSpace separa gli snapshot dai cestini e dai file attivi.
L'analisi degli snapshot OpenZFS di Klara Systems collega il riempimento del pool, l'utilizzo degli snapshot e una pianificazione pratica della capacità.
Ripeti il test del carico di lavoro originale dopo la pulizia
Ripeti lo stesso carico di lavoro con scritture, snapshot e consultazione delle directory dopo aver recuperato spazio. Confronta latenza, throughput e pressione sull'allocatore, invece di presumere che una percentuale inferiore abbia risolto il problema.
Verifica che il ciclo successivo programmato di snapshot e replica venga completato e che il pool non torni immediatamente alla soglia di avvertimento. Imposta gli avvisi abbastanza presto da coprire la crescita normale e il più grande processo temporaneo previsto.
Mantieni il limite del 20% di spazio libero quando non sono disponibili misurazioni. Aumentalo se la latenza di scrittura cresce, la frammentazione è elevata o una grande divergenza degli snapshot è normale; interrompi le nuove scritture se il pool si avvicina all'esaurimento o le allocazioni iniziano a non riuscire.
Supporto e consigli
Altro da leggere

Qual è l'intervallo di temperatura accettabile per un'unità NVMe in un mini PC?
Per molte unità NVMe consumer, circa 30–50°C a riposo e sotto i 70°C sotto carico prolungato sono valori obiettivo utili, ma fa fede il...

Quanto spazio SSD dovrebbe riservare un media server per copertine e cache?
Inizia dall’utilizzo misurato dei dati delle app, aggiungendo un margine di crescita del 50-100%; le miniature di anteprima dettagliate possono richiedere molto più spazio...

Quanti client SMB simultanei può gestire comodamente un NAS 1GbE?
Un NAS da 1GbE può servire molti client con carichi leggeri, ma solo pochi trasferimenti intensivi; il limite pratico condiviso è di circa 100–115MB/s...

